Böyük dil modelini öz infrastrukturunuzda işlətmək artıq tədqiqat işi yox, adi mühəndislik məsələsidir. Xidmət qatı yetkinləşib, açıq çəkili modellər korporativ işlərin çoxu üçün kifayət qədər yaxşıdır və avadanlıq tələbi insanların düşündüyündən azdır — bir ədəd yüksək yaddaşlı GPU serveri ciddi daxili tətbiqi daşıyır. Çətinlik model deyil. Çətinlik dürüst ölçüləndirmə, bütün data yolunun lokal saxlanması və işə salındıqdan sonra sistemin idarə olunmasıdır.
Bu məqalə kapital ayırmadan əvvəl bilməli olduqlarınızı əhatə edir: model ölçüsünü necə seçmək, avadanlığı real paralelliyə görə necə ölçmək, API qiymətləri ilə müqayisədə nəyə başa gəldiyi və təkrarlanan konkret səhvlər.
Avadanlıqdan əvvəl iş yükünü müəyyən edin
On-premise AI-da ən bahalı səhv təsəvvür edilmiş iş yükü üçün infrastruktur almaqdır. Sonrakı hər şeyi üç sual həll edir.
Tapşırıq nədir? Axtarışa əsaslanan sual-cavab, təsnifat, çıxarış və xülasə korporativ işin böyük hissəsidir və orta ölçülü açıq çəkili modellərin imkanları daxilindədir. Çoxaddımlı mürəkkəb mühakimə və yüksək səviyyəli kod yazma isə model ölçüsünün hələ də ciddi rol oynadığı yerdir.
Fərq praktikidir: modelin işi tapılmış konteksti oxuyub ondan cavab verməkdirsə, imkan tələbi mülayimdir, çünki çətin hissəni — cavabı bilməyi — axtarış görür. Model bir neçə addımda öz biliyi üzərindən mühakimə yürütməlidirsə, daha çoxu lazımdır.
Real paralellik nədir? Qeydiyyatdan keçmiş istifadəçilər yox. Pik anda eyni vaxtda icrada olan sorğular. İki min işçi üçün daxili bilik köməkçisi adətən birrəqəmli və ya aşağı ikirəqəmli paralelliklə işləyir, çünki istifadə partlayışlı və nazik yayılmışdır. Təşkilatlar müntəzəm olaraq yüzlərlə sorğuya görə ölçür və bir il boyu 5% yüklə işləyir.
Əslində hansı gecikmə tələb olunur? İnteraktiv söhbətdə ilk tokenlər bir-iki saniyə içində gəlməli, generasiya sürəti isə oxu sürətindən yuxarı olmalıdır. Paket sənəd emalının isə gecikmə tələbi ümumiyyətlə yoxdur və eyni avadanlıqda gecə vaxtına planlaşdırıla bilər — bu, tapa biləcəyiniz ən ucuz güc ehtiyatıdır.
Avadanlıq satıcısı ilə danışmazdan əvvəl bu üç rəqəmi yazın. Cavabı onlar müəyyən edir.
Model ölçüsünün seçimi
Korporativ tətbiqlərdə fərqli miqyasların nəyə yaradığının təxmini xəritəsi.
Kiçik modellər (təxminən 7–9B parametr). Təsnifat, marşrutlaşdırma, çıxarış, sadə xülasə və sadə məzmun üzərində axtarışa əsaslanan cavab. Sürətli və ucuz. Tətbiqdəki ən yüksək həcmli yol üçün çox vaxt doğru seçimdir və ardıcıl olaraq lazımınca qiymətləndirilmir.
Orta ölçülü modellər (təxminən 24–40B). Korporativ köməkçilərin çoxu üçün praktiki qızıl orta. Yaxşı təlimat izləmə, səriştəli axtarışa əsaslanan mühakimə, məqbul çoxdilli performans. Kvantlaşdırılanda bir ədəd yüksək yaddaşlı GPU üzərində işləyir.
Böyük modellər (70B və yuxarı). Mürəkkəb mühakimədə və resursu az dillərdə nəzərəçarpacaq dərəcədə yaxşıdır. Bir neçə GPU və ya aqressiv kvantlaşdırma tələb edir. Tapşırıq həqiqətən tələb edəndə əsaslıdır — yaxşı qurulmuş sistemdə isə sorğuların yalnız azlığı belədir.
Mixture-of-experts modellər. Ümumi parametr sayı böyükdür, hər token üçün isə yalnız bir hissəsi aktivdir. Hesablama vahidinə düşən imkan əladır, əvəzində bütün çəkilər üçün yaddaş lazımdır. Ayrıca qiymətləndirməyə dəyər; iqtisadiyyatı çox əlverişli ola bilər.
Arxitektura nəticəsi model seçimindən vacibdir: tapşırığa görə marşrutlaşdırın. Yüksək həcmli sadə trafiki kiçik modelə göndərin, böyüyünü isə həqiqətən ona ehtiyacı olan sorğular üçün saxlayın. Çox vaxt özünü ödəyən tətbiqlə ilk infrastruktur baxışından sonra söndürülən tətbiq arasındakı fərq məhz budur. Bax AI orkestrasiyası nədir.
Avadanlığın ölçüləndirilməsi
Yaddaş həlledici məhdudiyyətdir
Nə işlədə biləcəyinizi GPU yaddaşı müəyyən edir. Təxmini tələb:
Model çəkiləri. 16-bit dəqiqlikdə milyard parametrə təxminən 2 GB. 8-bitdə təxminən 1 GB. 4-bitdə təxminən 0,5 GB. Konkret desək, 70B model tam dəqiqlikdə təxminən 140 GB, 4-bitdə isə təxminən 35 GB tələb edir — bu, çoxlu GPU-lu qovşaqla bir kart arasındakı fərqdir. FP16-da 70B model H200-ün 141 GB-nin demək olar hamısını doldurur; FP8 və ya INT8-də iki H100-ə və ya bir H200-ə sığır.
KV cache. Diqqət vəziyyətini saxlayan, sorğu başına düşən yaddaş — kontekst uzunluğu × paralel sorğu sayına mütənasibdir. İnsanların unutduğu məhz budur və uzun kontekstli, yüksək paralellikli tətbiqdə çox vaxt çəkilərdən böyük olur. Uzun kontekstli axtarış tətbiqləri xüsusilə təsirlənir.
Əlavə yük. Aktivasiyalar, fraqmentasiya, xidmət mühiti. 10–20% ehtiyat saxlayın.
Praktiki qayda: ümumi çəkilər + gözlənilən pik KV cache + 20%. Bu, GPU yaddaşınızı aşırsa, daha çox kvantlaşdırın, konteksti qısaldın, paralelliyi məhdudlaşdırın və ya GPU əlavə edin.
Kvantlaşdırma
Çəkilərin dəqiqliyinin azaldılması. 8-bit kvantlaşdırma korporativ tapşırıqlar üçün keyfiyyət baxımından ümumiyyətlə pulsuzdur — H100 və ya H200 üzərində TensorRT-LLM ilə FP8 xidməti təxminən 50% yaddaş qənaəti və təxminən 99,9% keyfiyyət saxlanması verir. 4-bit müasir metodlarla adətən məqbuldur və ölçülə bilən, lakin çox vaxt dözülən itki göstərir. 4-bitin altında keyfiyyət kəskin düşür.
Kvantlaşdırma on-premise tətbiqdə ən yüksək təsirli tək qərardır, çünki modelləri avadanlıq səviyyələri arasında hərəkət etdirir. 16-bitdə iki GPU tələb edən model 8-bitdə birində rahat işləyə bilər, bu da kapital xərcini yarıya endirir.
Kvantlaşdırılmış modeli dərc olunmuş benchmark-larda yox, öz tapşırıqlarınızda qiymətləndirin. İtki qeyri-bərabərdir — bəzi imkanlara daha çox təsir edir və resursu az dilləri ingilis dilindən daha ağır vurur. Konkret olaraq azərbaycandilli yüklər üçün bunu fərz etmək yox, test etmək lazımdır.
Paketləmə iqtisadiyyatın o biri yarısıdır
GPU başına buraxma qabiliyyətini əsasən paket ölçüsü müəyyən edir və xərc rəqəmləri də ona uyğun dəyişir. H100 üzərində 70B sinifli model 1 paket ölçüsündə milyon çıxış tokeninə təxminən 0,73 dollara, 8 paket ölçüsündə isə təxminən 0,18 dollara başa gəlir — sırf xidmət konfiqurasiyasının dəyişməsindən dörd dəfə azalma, avadanlıq qarışmadan.
Praktiki nəticə: zəif paketləmə ilə işləyən tətbiq avadanlıq problemi deyil, konfiqurasiya problemidir və onu həll etmək üçün daha çox GPU almaq bahalı yoldur.
Real başlanğıc konfiqurasiyası
İri təşkilata daxili köməkçi verən ilk istehsalat tətbiqi üçün:
- Bir server, bir və ya iki yüksək yaddaşlı data mərkəzi GPU-su (80 GB sinfi və yuxarı). Bu, kvantlaşdırılmış orta ölçülü modeli yaxşı sürətlə və ciddi paralelliyə yer qoyaraq işlədir.
- Bol sistem yaddaşı — modelin yüklənməsi və keşlənməsi üçün ən azı ümumi GPU yaddaşı qədər.
- Sürətli lokal NVMe — çəkilər üçün. Böyük modeli şəbəkə anbarından yükləmək hər yenidən başlatmada əsəbiləşdirəcək qədər ləngdir.
- Ayrıca, xeyli kiçik maşın — vektor bazası, orkestrasiya və tətbiq qatı üçün. Bunlar CPU-ya bağlıdır və GPU host-unun resurslarına rəqib olmamalıdır.
Bu konfiqurasiya həqiqətən faydalı tətbiqi daşıyır. Təşkilatlar bu mərhələdə ardıcıl olaraq artıq alır; doğru addım buradan başlamaq, ölçmək və sübuta əsasən böyütməkdir.
Miqyaslanma
Bundan çıxdıqda, sərfəlilik sırası ilə:
- Daha çox kvantlaşdırın, keyfiyyət imkan verirsə. Pulsuzdur.
- Xidmət mühərrikini tənzimləyin — paketləmə parametrləri, KV cache konfiqurasiyası, kontekst limitləri. Çox vaxt kapital tələb etmədən böyük qazanc verir.
- Daha çox trafiki kiçik modelə yönləndirin. Adətən əlçatan ən böyük qazanc budur.
- Mövcud host-a GPU əlavə edin.
- Yük balanslaşdırıcısı arxasına host əlavə edin.
Aşağıdan başlamaq yerinə bu siyahı ilə yuxarıdan aşağı işləyin.
Xidmət qatı
İnferens mühərriki. vLLM geniş yayılmış istehsalat seçimidir — davamlı paketləmə və səmərəli KV cache idarəetməsi ilə; onunla sadəlövh xidmət dövrəsi arasındakı fərq buraxma qabiliyyətində bir neçə dəfədir. SGLang və TensorRT-LLM güclü alternativlərdir. İstehsalat yükünü tədqiqat skriptindən işlətməyin.
Model şlüzü. Mühərriklərin qarşısında OpenAI-uyğun API — beləliklə tətbiqlər konkret modeldən ayrılır. Modeli əvəzlənə bilən edən budur və başlanğıcda qurulması heç nəyə başa gəlmir.
Vektor anbarı və embedding-lər — hər ikisi lokal. Suverenlik iddiaları ən çox burada uğursuz olur. Dil modelini öz serverinizdə saxlayıb embedding üçün xarici API çağırmaq deməkdir ki, indekslədiyiniz hər sənəd kənara ötürülür. Embedding modeli də lokal işləməlidir.
Orkestrasiya. Marşrutlaşdırma, alətlər, vəziyyət, kimlik, audit. AI orkestrasiyası nədir məqaləsində əhatə olunub.
Müşahidə. Sorğu səviyyəsində jurnal, gecikmə, token buraxma qabiliyyəti, GPU istifadəsi, sorğu başına xərc. Bunlar olmadan nə ölçüləndirə, nə tənzimləyə, nə də əsaslandıra bilərsiniz.
Əslində nəyə başa gəlir
API qiymətləri ilə müqayisə həcmdən asılıdır və dərc olunan bərabərləşmə nöqtələri planlaşdırma üçün kifayət qədər ardıcıldır.
Kəsişmə nöqtəsi. 2026-cı ilin sahə təhlilləri öz serverində saxlamanın bərabərləşmə həddini konfiqurasiyaların çoxu üçün gündə təxminən 2 milyon token, yaxud on iki aylıq pəncərədə rezerv edilmiş güclə gündə 2–5 milyon token kimi göstərir. Eyni qaydanın sadə variantı: aylıq API xərci təxminən 12 000–19 000 dolları keçəndən sonra öz serverinizdə saxlamağı ciddi modelləşdirməyə başlayın.
Kəsişmədən sonrakı marjinal xərc. Paketlə işləyəndə öz serverinizdəki 70B sinifli model milyon çıxış tokeninə təxminən 0,18 dollara başa gəlir — qabaqcıl hostlanan modellərdə isə bu, milyona dollarlarla ölçülür. Davamlı, yüksək həcmli yüklərin içəri köçüb orada qalmasının səbəbi bu fərqdir.
Kapital. Tək serverli istinad konfiqurasiyası ciddi, amma qeyri-adi olmayan korporativ alışdır — üstəgəl elektrik, soyutma və rək yeri. Dərc olunmuş rəqəmdən çıxış etmək yerinə öz bazarınız üçün cari qiymət təklifi alın; GPU qiymətləri sürətlə dəyişir, regional əlçatanlıq isə onu daha da tərpədir.
Əməliyyat. Elektrik sərfiyyatı ciddi və fasiləsizdir. Üstünə onu işlətmək üçün mühəndislik vaxtını əlavə edin — müqayisələrdən ən çox buraxılan xərc budur.
Amma tənzimlənən qurumlar üçün bu müqayisə çox vaxt əhəmiyyətsizdir, çünki söhbət gedən data üçün API variantı hüquqi olaraq əlçatan deyil. Onda sual on-premise-in API-dən ucuz olub-olmaması deyil — istifadə ssenarisinin ümumiyyətlə heç nə etməmək fonunda bu infrastruktura dəyib-dəyməməsidir. Arqumentin tam versiyası üçün bax suveren AI.
Tətbiqlər harada pozulur
Təsəvvür edilmiş pikə görə ölçüləndirmə. Ən bahalı səhv, üstəlik heç bir ölçmə olmadan edilir. Kiçikdən başlayın, ölçü qoyun, dataya görə böyüdün.
KV cache-i nəzərə almamaq. Yalnız çəkilərə görə ölçüləndirmək, sonra keş yaddaşı büdcəyə salınmadığı üçün paralelliyin planın üçdə biri olduğunu kəşf etmək.
1 paket ölçüsündə xidmət. Dörd dəfəlik buraxma qabiliyyəti qazancını götürmədən buraxıb sonra bunu kompensasiya etmək üçün avadanlıq almaq.
Lokal modelin arxasında hostlanan embedding-lər. Hüquqi baxış onu tapana qədər yaşayan suverenlik sızması.
Qiymətləndirmə dəsti olmaması. Modelləri dəyişəcəksiniz — yeni buraxılışlar dayanmadan gəlir. Öz datanızdan, öz dillərinizdə qurulmuş qiymətləndirmə dəsti olmadan hər dəyişiklik ölçülməzdir. Onu ilk istehsalat ssenarisindən əvvəl qurun.
Modeli koda bərkitmək. Birinci gündən qarşısına şlüz qoyun ki, model konfiqurasiya olsun.
Əməliyyatı azaltmaq. İş vaxtı, yeniləmələr, sürücü uyğunluğu, tutum, hadisələr. Bu, daimi bacarıqdır. Onu layihə kimi görən tətbiqlər səssizcə çürüyür.
Azərbaycan dili üzrə qiymətləndirməni ötürmək. Model kartlarındakı çoxdillilik iddiaları konkret kvantlaşdırılmış modelin sizin sahə terminologiyanızda azərbaycanca necə işlədiyini demir. Test edin. Nəticələr bəzən hər iki istiqamətdə təəccüblü olur.
Ağıllı ilk tətbiq
1–2-ci həftələr. İş yükünü, paralelliyi və gecikməni müəyyən edin. Öz sahənizdən, real xidmət göstərəcəyiniz dillərdə 50–100 real haldan ibarət qiymətləndirmə dəsti qurun.
3–4-cü həftələr. İki-üç namizəd modeli iki kvantlaşdırma səviyyəsində həmin dəstə qarşı qiymətləndirin. Benchmark-lara yox, ölçülmüş nəticələrə görə seçin.
5–6-cı həftələr. Alın və quraşdırın. Xidmət qatını, şlüzü, vektor anbarını və lokal embedding-ləri tətbiq edin.
7–9-cu həftələr. İlk istifadə ssenarisini qurun — daxili bilik axtarışı doğru seçimdir. Kimliyə həssas axtarış və audit jurnalı elə əvvəldən.
10–12-ci həftələr. Real istifadəçi qrupu ilə pilot. Gecikməni, buraxma qabiliyyətini, qiymətləndirmə dəstinə qarşı keyfiyyəti və yüklənməni ölçün. Tənzimləyin.
Sonra sübuta əsasən böyüdün. Bu nöqtədə real paralelliyinizi bilirsiniz və ikinci istifadə ssenarisi birincinin kiçik bir hissəsinə başa gəlir — platforma qurmağın bütün arqumenti də elə budur.
Əsas məqamlar
- Avadanlıqdan əvvəl iş yükünü, paralelliyi və gecikməni müəyyən edin. Təşkilatların çoxu böyük fərqlə artıq alır.
- Yaddaş həlledici məhdudiyyətdir: 70B model FP16-da ~140 GB, 4-bitdə ~35 GB-dir. İnsanların unutduğu hissə KV cache-dir.
- FP8 cari avadanlıqda demək olar eyni keyfiyyətdə yaddaşın təxminən yarısını verir — ən yüksək təsirli tək qərar.
- Paketləmə eyni GPU-da milyon çıxış tokeninin xərcini ~0,73 dollardan ~0,18 dollara endirir. Almazdan əvvəl tənzimləyin.
- API-lərlə bərabərləşmə gündə təxminən 2 milyon token, yaxud aylıq 12–19 min dollar API xərci civarındadır.
- Embedding-lər və vektor anbarı lokal olmalıdır, əks halda suverenlik iddiası dağılır.
- Tənzimlənən qurumlar üçün API xərc müqayisəsi çox vaxt əhəmiyyətsizdir, çünki API hüquqi variant deyil.
HAVAA standart olaraq belə tətbiq olunur — modellər, axtarış və embedding-lər müştərinin öz perimetri daxilində. Ölçüləndirmə, tətbiq və istismar Yukon Labs-in üzərindədir.