Data kataloqu təşkilatın sahib olduğu bütün data aktivlərinin — cədvəllər, sütunlar, hesabatlar, dashboard-lar, pipeline-lar — axtarıla bilən indeksidir; hər birinin nə demək olduğu, haradan gəldiyi, sahibinin kim olduğu və nə qədər həssas olduğu ilə birlikdə. O, sizin datanızı saxlamır. O, datanız haqqında metadata saxlayır və bu metadata-nın böyük hissəsini onsuz da işlətdiyiniz sistemlərdən avtomatik toplayır.
Ən aydın bənzətmə kitabxana kataloqudur. Kitabxana kitabları saxlayır; kataloq isə nəyin mövcud olduğunu, hansı rəfdə durduğunu, nədən bəhs etdiyini və onu götürə biləcəyinizi deyir. Kataloqu götürün — kitablar yerində qalır, sadəcə hər hansı ciddi miqyasda tapıla bilmir.
Böyük təşkilatların çoxu kataloqsuz işləyir. Minlərlə cədvəl, bir neçə yüz hesabat var, və vacib olan hər şeyin harada yerləşdiyi dörd-beş uzunmüddətli analitikin yaddaşında saxlanılır. Bu, onlardan biri işdən gedənə qədər işləyir.
Kataloqun həll etdiyi problem
Simptom həmişə eynidir, sadəcə sözlər bir az dəyişir:
"Gəliri göstərən üç hesabatımız var və rəqəmlər üst-üstə düşmür. Heç kim hansının doğru olduğunu deyə bilmir."
Bu cümlənin altında konkret, mexaniki bir uğursuzluq dayanır. Üç komanda üst-üstə düşən mənbə cədvəlləri üzərində üç ayrı pipeline qurub, hər biri metrikin bir az fərqli tərifini tətbiq edib və fərqlərin heç biri heç yerdə qeydə alınmayıb. Hesabatların hamısı öz fərziyyələri daxilində düzgündür — sadəcə fərziyyələr görünmür.
Bu, əksər təşkilatın heç vaxt ölçmədən udduğu bir sıra xərclər yaradır. Gartner zəif data keyfiyyətinin orta illik dəyərini təşkilat başına 12,9 milyon dollar olaraq qiymətləndirir; MIT Sloan Management Review-in Cork University Business School ilə birgə araşdırması eyni problemi data keyfiyyəti ciddi şəkildə pozulduqda illik gəlirin 15–25%-i kimi ifadə edir. Sahə sorğuları ardıcıl olaraq göstərir ki, mühəndislər və analitiklər vaxtlarının yarıya qədərini yeni bir şey istehsal etmək əvəzinə data problemlərini düzəltməyə sərf edirlər.
Konkret olaraq, pul beş qapıdan çıxır:
- Analitiklər vaxtlarının böyük hissəsini datanı təhlil etməyə deyil, tapmağa və doğrulamağa sərf edirlər. Hər yeni sual arxeologiyanı yenidən başladır.
- Sxem dəyişiklikləri gözlənilməz şeyləri sındırır. Mühəndis istifadə olunmayan görünən bir sütunu silir. O sütun iki aralıq view vasitəsilə rüblük tənzimləyici hesabatı qidalandırırmış.
- Eyni məntiq təkrar-təkrar qurulur, çünki onun artıq mövcud olduğunu heç kim bilmirdi.
- Tənzimləyici sualların cavabı günlərlə çəkir, və cavab sübutdan deyil, yaddaşdan bərpadır.
- AI layihələri data mərhələsində ilişib qalır. Mənşəyi bilinməyən data üzərində qurulmuş model aktiv deyil, öhdəlikdir — və bu gün təşkilatların idarəetmə işinə başlamasının ən çox rast gəlinən səbəbi məhz budur.
Kataloq bunları özü həll etmir. O, bunları görünən və müraciət edilə bilən edir — həlli mümkün edən şərt isə elə budur.
Metadata-nın üç qatı
"Metadata" sözü bir-birindən həqiqətən fərqli üç şeyi bir yerə yığır. Onları ayrı saxlamaq işləyən kataloqla çaşqınlıq istehsal edən kataloq arasındakı fərqdir.
Texniki metadata — sistemin dediyi
Sxemlər, cədvəl və sütun adları, data tipləri, null ola bilmə, açarlar, sətir sayları, partisiyalar, saxlanma həcmi, son dəyişiklik vaxtları.
Bu qat avtomatik toplanır. Konnektor sistemin öz lüğətini oxuyur və qrafik üzrə yeniləyir. Texniki metadata-nı heç bir insan əl ilə yazmamalıdır; insanların onu əl ilə yazdığı kataloq quraşdırması səhv konfiqurasiya edilib.
Texniki metadata nəyin mövcud olduğu sualına cavab verir.
Biznes metadata — təşkilatın nəzərdə tutduğu
Təriflər, sahiblik, təsnifat, kritiklik, saxlanma müddəti, tətbiq olunan tənzimləmə.
Bu qatı toplamaq mümkün deyil. O, kimsə yazana qədər yalnız insanların başında mövcuddur — və kataloq proqramının əsl işi məhz buradadır. CUST_STAT_CD = 'A' texniki metadata-dır. Bunun aktiv müştəri, yəni son doxsan gündə ən azı bir əməliyyatı olan müştəri demək olduğu isə biznes metadata-dır və bunu müəyyən etmək üçün iclas lazım olub.
Biznes metadata nə demək olduğu və kimin cavabdeh olduğu sualına cavab verir.
Əməliyyat metadata-sı — əslində nə baş verdiyi
Pipeline icra tarixçəsi, təzəlik, keyfiyyət yoxlamalarının nəticələri, sorğu həcmləri, kimin nəyə və nə vaxt müraciət etdiyi.
Texniki metadata kimi avtomatik toplanır, sadəcə sxemlərdən deyil, icra sistemlərindən. O, bu data güncəldirmi, sağlamdırmı və ondan ümumiyyətlə istifadə edən varmı sualına cavab verir — sonuncusu isə hesabatlarınızın üçdə birinin bir ildir açılmadığını üzə çıxaran şeydir.
Active metadata — iş görən metadata
Daha yeni termin, və analitik bazarın üzərində birləşdiyi termin. Active metadata sadəcə saxlanan və göstərilən metadata deyil — sistemlərə geri ötürülüb hərəkət tetikləyən metadata: mənbə sxemi dəyişəndə sahibə xəbərdarlıq göndərmək, keyfiyyət qaydası pozulanda pipeline-ı dayandırmaq, həssaslıq etiketini mənbə sütunundan ondan törəyən bütün nüsxələrə yaymaq.
Gartner Data and Analytics Governance Platforms üzrə Magic Quadrant-ını 2026 üçün yeniləyəndə — bu kateqoriyanı 2025-ci ilin yanvarında özü yaratmışdı — active metadata, maşın öyrənməsi avtomatlaşdırması və AI agentləri ilk buraxılışa nisbətən daha ağır çəkiyə malik oldu; əhatə dairəsi isə strukturlaşdırılmamış datanı, analitik modelləri və data məhsullarını da içinə alacaq şəkildə genişləndi. Bazarın istiqaməti budur: idarəetmə ildə bir dəfə görülən sənədləşdirmə tapşırığı deyil, davamlı və avtomatlaşdırılmış olmalıdır.
Data lineage: rəqəm haradan gəldi
Lineage datanın mənbədən təyinata qədər, yolda keçdiyi hər transformasiya ilə birlikdə izlənmiş yoludur.
Kommersiya baxımından əhəmiyyət daşıyan fərq iki detallıq səviyyəsi arasındadır.
Cədvəl səviyyəli lineage deyir: bu hesabat bu dörd cədvəldən oxuyur. Kobud səviyyədə təsir analizi üçün faydalıdır. Audit üçün kifayət deyil.
Sütun səviyyəli lineage deyir: _bu hesabatdakı net_exposure rəqəmi positions.notional minus collateral.value kimi hesablanır; collateral.value isə öz növbəsində collateral.amount_local dəyərinə fx_rates.close məzənnəsi tətbiq edilməklə alınır._ Bu, nəzarətçi orqanın sualına verilən cavabdır.
Əhəmiyyət daşıyan ikinci fərq lineage-in necə istehsal olunmasıdır.
Əl ilə çəkilmiş lineage — arxitektor axını diaqram alətində və ya kataloqun interfeysində çəkir. Çəkildiyi gün dəqiqdir və dərhal köhnəlməyə başlayır, çünki pipeline-lar dəyişir, diaqramlar dəyişmir. Bir il ərzində o, artıq aktiv şəkildə yanıldıcı olur — bu isə ümumiyyətlə olmamasından pisdir.
Parse edilmiş lineage — kataloq sizin real SQL-inizi, saxlanılan prosedurlarınızı, ETL təriflərinizi və BI semantik qatlarınızı oxuyur və qrafiki həqiqətən işləyən koddan çıxarır. Kod yenilənəndə o da yenilənir.
Uyğunluq mövqeyini yalnız parse edilmiş, sütun səviyyəli lineage üzərində qurmağa dəyər. Kataloqları qiymətləndirərkən texniki baxımdan ən fərqləndirici imkan budur — və marketinq dilinin məhsulun real davranışından ən çox ayrıldığı yer də budur. Onu vendorun demo dataseti üzərində deyil, öz transformasiya kodunuz üzərində sınayın.
Lineage özünü üç yerdə ödəyir: sxem dəyişikliyindən əvvəl təsir analizi, rəqəm səhv görünəndə kök səbəb analizi, və tənzimləyici bir rəqəmin necə alındığını soruşanda sübut.
Biznes lüğəti
Lüğət təşkilatın öz sözlərinin nə demək olduğunu yazıya aldığı yerdir.
Sadə səslənir. Praktikada kataloq proqramının ardıcıl olaraq ən çətin və ən dəyərli hissəsidir, çünki idarəetmənin texniki məşğuliyyət olmaqdan çıxdığı nöqtə məhz buradır.
Lüğət yazısı bir biznes anlayışıdır — Aktiv Müştəri, Net Exposure, Ödənişli Əməliyyat — təsdiqlənmiş tərifi, sahibi və onu reallaşdıran hər fiziki sütunla əlaqəsi ilə birlikdə. Onu sənəddən fərqləndirən məhz bu bağlantıdır: CUST_STAT_CD sütununa baxan analitik təsdiqlənmiş tərifi elə həmin kontekstdə, ona ehtiyac duyduğu anda görür.
İki şey mütləq səhv gedir.
Lüğət datadan ayrı qurulur. Heç bir fiziki obyektə bağlanmayan gözəl yazılmış təriflər toplusu — əlavə addımları olan PDF-dir. Dəyər tamamilə anlayışla sütun arasındakı bağdan gəlir.
Təriflər qərarlaşdırılmır, sadəcə qaralanır. Kimsə aktiv müştəri üçün məqbul tərif yazır, paylaşır, heç kim oxumadığı üçün etiraz gəlmir, və tərif dərc olunur. Altı ay sonra iki departament hələ də fərqli rəqəmlərdən istifadə edir. Razılaşmayan tərəflər arasında real mübahisədən keçməmiş tərif — tərif deyil, təklifdir.
Mübahisələr üçün vaxt ayırın. Məhsul elə onlardır.
Çoxdilli hal
Azərbaycan, rus və ingilis dilli sistemlərin yan-yana işlədiyi təşkilatda lüğət bir anlayışı çoxsaylı dil etiketi ilə modelləşdirməlidir — üç paralel lüğət saxlamamalıdır.
Fərq strukturaldır və sonradan düzəltmək bahadır. müştəri, клиент və customer bir anlayışın üç etiketidir, və hər üç sistemdəki hər fiziki sütun həmin tək anlayışa bağlanır. Üç ayrı lüğət isə zamanla mütləq ayrılacaq üç ayrı idarəetmə rejimi yaradır.
Bu imkanı qiymətləndirmə mərhələsində açıq şəkildə yoxlayın. Bir neçə kataloq məhsulu tək iş dili olduğunu fərz edir və tərcüməni data modeli kimi deyil, interfeys funksiyası kimi təklif edir — bunlar isə eyni şey deyil.
Data kataloqu, data dictionary və metadata repozitorisi
Bunlar bir-birinin əvəzinə işlədilir və eyni şey deyillər.
Data dictionary — əhatəsi bir sistem və ya bir bazadır. Adətən sənəd şəklində, əl ilə doldurulur. Auditoriyası developerlərdir.
Metadata repozitorisi — əhatəsi çoxlu sistem üzrə texniki metadata-dır. Avtomatik toplama ilə doldurulur. Auditoriyası data mühəndisləridir.
Data kataloqu — əhatəsi bütün sistemlər üzrə hər üç metadata qatı, üstəgəl lineage, lüğət, təsnifat və iş axınlarıdır. Avtomatik toplama ilə doldurulur, üstündə isə kurasiya edilmiş biznes qatı dayanır. Auditoriyası eyni dərəcədə analitiklər, data steward-ları, mühəndislər və risk funksiyalarıdır.
Data dictionary bir bazanın strukturunu təsvir edir. Kataloq isə bütün estate-i əhatə edir, məna və mənşə əlavə edir və developer olmayan insanlar üçün nəzərdə tutulub. Əgər sizin "kataloq" yalnız mühəndislər üçün oxunaqlıdırsa, biznesin işləmə tərzini dəyişməyəcək.
AI üçün əsaslandırma qatı kimi kataloq
Bu gün kataloq üçün ən güclü arqument uyğunluq deyil. Arqument budur ki, müəssisə səviyyəsində AI kataloqsuz işləmir.
Rüb sonunda net exposure nə qədər idi sualı verilən AI agenti insan analitikin sükutla həll etdiyi üç şeyi həll etməlidir: hansı cədvəl səlahiyyətlidir, metrik burada nə deməkdir, və bu istifadəçinin onu görməyə icazəsi varmı. Bunlar dəqiq olaraq kataloqun saxladığı üç şeydir — sahiblik, tərif və təsnifat — və dəqiq olaraq bazaya birbaşa qoşulmada olmayan üç şeydir.
Elə buna görə Gartner-in agentic AI layihələrinin 40%-dən çoxunun 2027-ci ilin sonuna qədər ləğv ediləcəyi proqnozu — səbəblər arasında yetərsiz risk nəzarəti də var — əslində idarəetmə statistikasıdır. Cavabının haradan gəldiyini deyə bilməyən agent istehsalata buraxıla bilməz, lineage-i olmayan təşkilat isə ona bunu dedizdirə bilməz.
Kataloqun etməyəcəyi şeylər
Bunları əvvəlcədən yazmaq ən çox rast gəlinən məyusluğun qarşısını alır.
Datanızı təmizləməyəcək. Sütunun 40% boş olduğunu göstərəcək. Onu düzəltmək ayrıca layihədir və kataloq bunu etmir.
Heç nəyə qərar verməyəcək. Dörd müştəri cədvəlinin mövcud olduğunu üzə çıxaracaq. Hansının səlahiyyətli olduğuna qərar vermək üçün səlahiyyəti olan insan lazımdır.
Sahiblik yaratmayacaq. Sahib təyin etmək idarəetmə aktıdır. Kataloq nəticəni qeyd edir.
Özünü mənimsətməyəcək. Kataloq proqramının ən çox rast gəlinən uğursuzluq forması tam doldurulmuş, amma istifadəçisi olmayan kataloqdur. Mənimsənilmə dəyişikliyin idarə olunması məsələsidir — kataloqu mövcud iş axınlarına, işə qəbul prosesinə, yeni pipeline-ın "hazır" tərifinə yerləşdirmək — və proqram məhz burada ya yaşayır, ya ölür.
Kataloq necə tətbiq olunur
Tipik ardıcıllıq, dar bir sahədə ilk nəticəyə dörd-səkkiz həftə:
- Quraşdırma. Tələb edən təşkilatlar üçün öz mühitinizdə, on-premise. Kataloqun öz bazası və oxuyacağı sistemlərə şəbəkə çıxışı olmalıdır.
- Qoşulma. Mənbə sistemlərinə yalnız-oxuma səlahiyyətləri. Təhlükəsizlik baxışı məhz buraya cəmlənir, və standart sualın dürüst cavabı budur: kataloq sətir səviyyəsində məzmunu deyil, strukturu və statistikanı oxuyur və heç nə köçürmür. Yetkin platformalar məhz buna görə geniş konnektor kitabxanaları ilə gəlir — OvalEdge köhnə bazaları, hesabat sistemlərini və bulud xidmətlərini əhatə edən 170-dən çox hazır konnektor sadalayır.
- Toplama. Texniki metadata və lineage avtomatik dolur. Təşkilatın öz estate-inin əsl ölçüsünü ilk dəfə gördüyü an budur — və o, adətən hər kəsin dediyindən böyük çıxır.
- Profilləşdirmə. Sütun üzrə statistika — paylanmalar, boşluq nisbətləri, unikal dəyər sayları, format nümunələri — bu da avtomatik həssaslıq təsnifatını idarə edir.
- Kurasiya. İnsan mərhələsi: lüğət, sahiblik, təsnifatın nəzərdən keçirilməsi. Onu əhəmiyyət daşıyan aktivlərlə məhdudlaşdırın.
- İstismar. Keyfiyyət qaydaları, giriş iş axınları, dəyişiklik xəbərdarlıqları və kataloqu güncəl saxlayan rutinlər.
1–4-cü addımlar əsasən mexanikidir. 5-ci addımda proqramlar yavaşlayır, və ondan keçmə yolu daha çox səy deyil, daha dar əhatədir.
Sizə lazımdırmı?
Məqbul göstəricilər. Üçü və ya daha çoxu uyğun gəlirsə, cavab bəlidir.
- Analitika və ya hesabatlığı qidalandıran ondan çox mənbə sistemi.
- Bir neçə rəqəmdən hansının doğru olduğu barədə təkrarlanan mübahisə.
- Rəqəmlərin necə alındığını soruşan tənzimləyici.
- Datadan istifadə etməyə deyil, onu tapmağa daha çox vaxt sərf edən analitiklər.
- Heç kimin gözləmədiyi şeyləri sındıran sxem dəyişiklikləri.
- Data keyfiyyəti və ya mənşəyi üzündən ilişib qalmış AI və ya analitika təşəbbüsü.
- Az sayda adamın başında saxlanan açar bilik.
Bu həddin altında — bir neçə sistem, bir komanda, hamı bir otaqda — sənədləşdirmə intizamı çox vaxt kifayət edir və kataloq artıq yükdür.
Əsas məqamlar
- Kataloq datanız haqqında metadata-nı indeksləyir. Datanın özünü nə saxlayır, nə köçürür.
- Texniki və əməliyyat metadata-sı avtomatik toplanır; biznes metadata-sını insanlar yaradır — əsl iş də oradadır.
- Active metadata — səhifədə durmaq əvəzinə hərəkət tetikləyən metadata — 2026-cı ilin analitik bazarının idarəetmə platformasından gözlədiyi şeydir.
- Auditdə yalnız parse edilmiş, sütun səviyyəli lineage müdafiə oluna bilər. Əl ilə çəkilmiş lineage zamanla dezinformasiyaya çevrilir.
- Lüğətin dəyəri anlayışları fiziki sütunlara bağlamaqdan və real fikir ayrılığından sağ çıxmış təriflərdən gəlir.
- Çoxdilli təşkilatlara çoxlu lüğət yox, çoxlu etiketi olan bir anlayış lazımdır. Bunu sonradan ucuz başa gətirmək mümkün deyil.
- Doldurulmuş, amma istifadəçisi olmayan kataloq standart uğursuzluqdur. Çətin hissə mənimsənilmədir.
Yukon Labs Azərbaycanda banklar və dövlət qurumları üçün OvalEdge platformasını on-premise tətbiq edir. Platforma seçiminə keçməzdən əvvəl estate-in xəritəsini çıxarmaq istəyirsinizsə, data idarəetməsi qiymətləndirməsi bunu dörd-altı həftəyə hazırlayır. Daha geniş proqram konteksti üçün Azərbaycanda data idarəetməsi yazısına baxın.