Üçdilli data mühitinə üç catalog lazım deyil. Ona bir catalog lazımdır: hər biznes termini üçün elan edilmiş səlahiyyətli dil, təsdiqlənmiş tərcümə kimi saxlanan digər iki dil və hər üç dili, üstəgəl onların transliterasiyalarını eyni aktivə gətirən axtarış qatı. Qalan hər şey — təkrarlanan glossary-lər, dil üzrə ayrı catalog-lar, tərcümə layihələri — uzaqlaşma doğurur.

Problem məhz bu bazardakı təşkilatlara xasdır və standart governance çərçivələri onun haqqında susur.

Üçdilli mühit catalog-u niyə sındırır?

Çünki data catalog-un əsas vədi budur: bir anlayışın bir yazısı var. Üç dil bu vədi eyni anda dörd yerdə sındırır.

Biznes terminləri üç dəfə mövcuddur. «Aktiv müştəri» tənzimləyici proses üçün azərbaycanca, vendor tətbiqi zamanı ingiliscə, on beş il əvvəl quraşdırılmış sistemin sənədləşməsində isə rusca müəyyən edilib. Üçü də inandırıcıdır; heç biri idarə edən variant kimi işarələnməyib. Fərqli mənbələrdən qurulan hesabatlar ayrılır və bunu üzləşməyə qədər heç kim görmür.

Texniki metadata bir sxemin içində qarışıqdır. musteri_hesab adlı cədvəl CLIENT_ACCOUNT ilə yanaşı dayanır, onun yanında isə sütunları transliterasiya olunmuş rus dilində olan köhnə cədvəl var. Bu, nizamsızlıq deyil — dil və qrafika mühiti sabitləşməzdən əvvəldən sistem işlədən qurumun arxeologiyasıdır.

Qrafika fərqi problemi qatlayır. Latın qrafikalı Azərbaycan dili standartdır, amma köhnə sənədləşmə və köhnə sistemlər kiril dövrünün konvensiyalarını daşıyır, istifadəçilər isə vaxtın yarısında diakritiksiz yazır. Müştəri, MusteriMushteri insan üçün bir sözdür, axtarış indeksi üçün üç token.

Sahiblik dil üzrə parçalanır. Azərbaycanca tərifi təsdiqləyən adam çox vaxt ingiliscəni saxlayan adam deyil, ona görə ikisini uyğun saxlayacaq mexanizm olmadan fərqli adamlar tərəfindən idarə olunur.

Yekun effekt belədir: təşkilatın hər gün işlətdiyi termin üzrə axtarış heç nə qaytarır — bu isə istifadəçiləri itirməyin ən sürətli yoludur. Ən çox rast gəlinən data governance çətinlikləri məqaləsində deyildiyi kimi, istifadəçini iki dəfə yandıran catalog üçüncü cəhdi almır.

Səlahiyyətli dil qaydası nədir?

Bunun çoxunu həll edən qayda: hər biznes termininin dəqiq bir səlahiyyətli dili var, digər iki yazı isə onun tərcüməsi kimi işarələnir.

Hansı dilin səlahiyyətli olması domendən asılıdır və seçim vahid şəkildə yox, domen üzrə şüurlu edilməlidir:

Tənzimləyici və hüquqi terminlər — azərbaycanca səlahiyyətli. Tələb azərbaycanca yazılıb, nəzarət söhbəti azərbaycanca gedir, qanun mətnindən uzaqlaşan tərcümə tərif isə narahatlıq yox, uyğunluq riski yaradır.

Texniki platforma terminləri — ingiliscə səlahiyyətli. Lakehouse, data lineage, orchestration, partition, connector. Bu bazardakı praktiklər ingiliscə terminləri həm danışıqda, həm axtarışda işlədir, tərcümə isə heç kimin axtarmadığı yazılar doğurur. Bu məqalədəki texniki lüğətin ingiliscə qalmasının səbəbi də budur.

Domen və məhsul terminləri — biznesin real işlədiyi dildə. Pərakəndə anlayışları üçün adətən azərbaycanca; beynəlxalq mülkiyyətli qurumlarda bəzən ingiliscə; iş lüğəti heç vaxt dəyişməmiş köhnə əməliyyat domenlərində arabir rusca.

Vacib olan mexanizmdir. Səlahiyyətli yazı təsdiqləyəni və tarixi daşıyır; tərcümələr ona istinad və tərcümə təsdiqləyicisi daşıyır. Səlahiyyətli tərif dəyişəndə tərcümələr səssizcə uzaqlaşmaq əvəzinə köhnəlmiş kimi işarələnir. Bütün məsələ bu işarələmədədir — köhnələ bilməyən tərcümə heç kimin saxlamadığı tərcümədir.

Sahiblik də eyni qaydaya tabedir: terminin sahibi olan steward səlahiyyətli variantın sahibidir və tərcümələri təsdiqləyir. Sahibliyi dil üzrə bölmək uzaqlaşmaya zəmanət verən struktur səhvidir.

Glossary necə qurulmalıdır?

Üç praktiki qərar və onlar bir-birini gücləndirir.

Bir termin, üç etiket — üç termin yox. Glossary yazısı hər dil üçün etiketi olan tək obyektdir. Catalog onu üç bağlı yazı kimi modelləşdirirsə, onlar müstəqil redaktə olunacaq və ayrılacaq. Bu, konfiqurasiya mərhələsində verilən və sonradan dəyişməsi bahalı olan modelləşdirmə qərarıdır.

Sinonim halqaları, səxavətlə doldurulmuş. Hər termin üçün alternativlər qeydə alınmalıdır: üç dil etiketi, geniş yayılmış abreviaturalar, transliterasiya formaları, daxili jarqon və onu reallaşdıran sütunların adları. NPL, qeyri-işlək kredit, non-performing loan və ya NPL_FLAG axtaran istifadəçi eyni yazıya çatmalıdır. Sinonim halqalarını doldurmaq ucuzdur və üçdilli tətbiqdə ən yüksək gəlirli konfiqurasiya tapşırığıdır.

Təriflər tərcümə yox, nativ yazılır. Maşın tərcüməsi olan tərif ana dili daşıyıcısına maşın tərcüməsi kimi oxunur və dəqiqliyi məhz ən vacib terminlərdə — söz seçiminin hüquqi çəki daşıdığı tənzimləyici anlayışlarda — səssizcə itirir. Ya steward yazsın, ya domen daşıyıcısı yazıb steward təsdiqləsin.

Axtarışı üç dildə necə işlək etmək olar?

Üçdilli catalog-lar praktikada məhz burada uğur qazanır və ya uduzur; bu, məlum cavabları olan konfiqurasiya məsələsidir.

Diakritikadan asılı olmayan uyğunlaşma. İstifadəçi musteri yazır və müştəri nəzərdə tutur. İndeks uyğunlaşma üçün ə/e, ü/u, ö/o, ş/s, ç/c, ğ/g, ı/i cütlərini birləşdirməli, göstərmək üçün isə düzgün formanı saxlamalıdır. Bu olmadan real istifadəçi sorğularının təxminən yarısı nəticəsiz qalır.

Kiril üçün transliterasiya xəritəsi. Köhnə aktivlər və sənədləşmə kiril sətirləri daşıyır. Onları indeksləmə zamanı latın formalarına xəritələmək artıq kirillə yazmayan istifadəçilər üçün tapıla bilən edir.

Dillərarası termin genişləndirməsi. Bir dildəki sorğu sinonim halqası vasitəsilə başqa dildə təsvir olunmuş aktivlərə uyğun gəlməlidir. Üçdilli təşkilat üçün bir catalog-u mümkün edən funksiya budur və onu güman etmək əvəzinə pilot zamanı açıq yoxlamağa dəyər.

Real sorğularla ölçün. İnsanların həqiqətən axtardığı əlli termini götürün, hər üç dildə yoxlayın və nəticələrə baxın. Bu, yarım günlük işdir və adoption-u istənilən funksiya müqayisəsindən yaxşı proqnozlaşdırır. Həm də platformaları qiymətləndirəndə keçirilməli konkret testdir — onları ayıran suallar OvalEdge, Collibra və Alation müqayisəsi məqaləsindədir və çoxdilli axtarış davranışı həmin qiymətləndirməyə daxil edilməlidir.

Qarışıq dilli texniki metadata ilə nə etməli?

Texniki metadata — cədvəl və sütun adları — normallaşdırıla bilməz və normallaşdırılmamalıdır. İstehsalat cədvəllərini catalog xatirinə adlandırmaq səhv güzəştdir.

Catalog-un işi düzəltmək yox, körpü qurmaqdır. İşi üç mexanizm görür:

Biznes terminə bağlama. musteri_hesab.qaliq sütunu qalıq üçün glossary terminə bağlanır. İndi istənilən dildə qalıq axtaran istifadəçi sütunun adından asılı olmayaraq onu tapır.

Səlahiyyətli dildə təsvir, üstəgəl tərcümələr. Fiziki ad qalır; insan oxuyan təsvir idarə olunur.

Adlandırma standartları yalnız irəli tətbiq olunur. Yeni aktivlər sənədləşdirilmiş konvensiyaya əməl edir — yeni platforma işi üçün adətən ingiliscə, çünki alət və sənədləşmə oradadır. Mövcud aktivlərə toxunulmur və onlar glossary vasitəsilə körpülənir. Geriyə dönük adlandırma layihələri rüblər udur və lineage-i sındırır.

Tətbiqlərdən gələn praktiki detal: crawl mənbə sistemində onsuz da mövcud olan şərh və təsvir sahələrini götürür, köhnə sistemlərdə isə bunlar tez-tez onları quran adam tərəfindən rusca doldurulub. Həmin məzmunu atmaq yox, saxlamaq və indeksləmək lazımdır — çox vaxt sütunun nə demək olduğunun yeganə sağ qalmış sənədi elə odur. OvalEdge crawl zamanı mənbə səviyyəli təsvirləri götürür və bu, on beş illik dağınıq şərhləri sənədləşdirmə layihəsi olmadan axtarıla bilən metadata-ya çevirir.

Bu, AI retrieval-a necə təsir edir?

Üçdilli problem mühitin üzərinə AI assistenti qoyulan anda kəskinləşir və bunu əvvəlcədən planlaşdırmağa dəyər.

Bir dildəki sorğu başqa dildəki sənədləri çəkməlidir. İstifadəçi azərbaycanca soruşur; səlahiyyətli siyasət sənədi ingiliscədir; əməliyyat proseduru ruscadır. Retrieval sırf leksikdirsə, istifadəçi heç nə almır və sistemin işləmədiyi qənaətinə gəlir. Embedding əsaslı retrieval dillərarası uyğunlaşmanı açar söz axtarışından xeyli yaxşı aparır, amma keyfiyyət dilə görə dəyişir və Azərbaycan dili ümumi təyinatlı embedding modellərində ingilis və ya rus dilindən qat-qat az təmsil olunur.

Glossary terminləri retrieval-ı əhəmiyyətli dərəcədə yaxşılaşdırır. Sinonim halqalarını retrieval qatına sorğu genişləndirməsi kimi vermək ucuz və effektiv müdaxilədir: istifadəçinin azərbaycanca termini retrieval işə düşməzdən əvvəl ingilis və rus qarşılıqlarına genişlənir. İdarə olunan catalog-un AI sistemini sadəcə məhdudlaşdırmaq yerinə yaxşılaşdırmasının konkret yollarından biri budur.

Cavabın dili sualın dilinə uyğun olmalıdır. Mənbə istinadı isə sənədi öz orijinal dilində adlandırmalıdır ki, istifadəçi yoxlaya bilsin. İngiliscə mənbədən azərbaycanca cavab vermək düzgün davranışdır; mənbənin ingiliscə olduğunu gizlətmək isə yox.

Kontekst keyfiyyəti ilə korporativ AI nəticələri arasındakı geniş əlaqə korporativ AI-da kontekst niyə vacibdir məqaləsində açılıb; dil ölçüsü isə ən çox pilot məyus edəndən sonra kəşf olunan hissədir.

Tətbiq necə gedir?

Üçdilli konfiqurasiya catalog tətbiqinə təxminən iki həftə əlavə edir və bunu udmaq yerinə açıq qrafikə salmaq lazımdır.

Kəşfiyyat mərhələsində dil vəziyyətini inventarlaşdırın: hansı sistemin metadata-sı hansı dildədir, kiril harada qalıb, hansı domen gündəlik hansı dildə işləyir.

Konfiqurasiya mərhələsində diakritika birləşdirməsini, transliterasiya xəritəsini və sinonim halqası modelini glossary yüklənməzdən əvvəl qurun, çünki terminlər yarandıqdan sonra modeli dəyişmək onları yenidən daxil etmək deməkdir.

Glossary mərhələsində domen üzrə səlahiyyətli dili yazılı təyin edin və steward-lara səlahiyyətli tərifləri nativ yazdırın.

İstismara verməzdən əvvəl əlli sorğuluq axtarış testini hər üç dildə keçirin və nəticəsiz qalanları düzəldin.

İş ritminə bir bənd əlavə edin: səlahiyyətli tərif dəyişəndə onun tərcümələri işarələnir və eyni dövr ərzində yenidən təsdiqlənir. Bu addım olmadan model bir il içində üç müstəqil glossary-yə çevrilir — yəni qarşısını almaq üçün qurulduğu vəziyyətə.

Əsas məqamlar

  • Bir catalog, üç etiketi olan bir termin obyekti — heç vaxt bir-birinə bağlı üç yazı, onlar uzaqlaşır.
  • Domen üzrə səlahiyyətli dil elan edin: tənzimləyici terminlər üçün azərbaycanca, texniki platforma terminləri üçün ingiliscə, biznes domenləri üçün iş dili.
  • Tərcümələr səlahiyyətli yazıya istinad edir və o dəyişəndə köhnəlmiş kimi işarələnir. Köhnələ bilməyən tərcümə saxlanılmır.
  • Üç dili, abreviaturaları, transliterasiyaları və reallaşdırıcı sütun adlarını əhatə edən sinonim halqaları ən yüksək gəlirli konfiqurasiya tapşırığıdır.
  • Axtarışa diakritika birləşdirməsi, kiril transliterasiyası və dillərarası genişləndirmə lazımdır. İstismardan əvvəl əlli real sorğu ilə yoxlayın.
  • Mövcud texniki aktivləri adlandırmayın. Onları glossary bağlaması ilə körpüləyin, adlandırma standartlarını isə yalnız irəli tətbiq edin.
  • AI retrieval üçün sorğuları glossary sinonim halqaları ilə genişləndirin və mənbələri orijinal dilində göstərin.

Yukon Labs OvalEdge-i üçdilli mühitlər üçün standart tətbiqin bir hissəsi kimi konfiqurasiya edir — axtarışın tənzimlənməsi və səlahiyyətli dil modeli daxil olmaqla. Ümumi proqram konteksti üçün Azərbaycanda data governance, bunun ümumi yetkinlikdə yeri üçün isə data governance yetkinlik modeli məqaləsinə baxın.