Bosh sahifa Wiki Data catalog

Data catalog

Data catalog — tashkilotdagi dataset, jadval, fayl, dashboard va boshqa ma’lumot aktivlarini topish hamda tushunishga yordam beradigan boshqariladigan metadata tizimidir. U ma’lumotning o‘zini markazga ko‘chirish shartini qo‘ymaydi; nom, joylashuv, schema, ta’rif, egasi, sifat, lineage, foydalanish va kirish siyosatini indekslaydi. Asosiy maqsad foydalanuvchiga “qaysi ma’lumot bor, nimani anglatadi va unga ishonish mumkinmi” savollariga javob berishdir.

Metadata qatlamlari

Texnik metadata ustun nomi va turi, fayl formati, partition, jadval hajmi hamda yangilanish vaqtini o‘z ichiga oladi. Biznes metadata “active_customer” kabi atamaning tasdiqlangan ta’rifi, hisoblash qoidasi va egasini beradi. Operatsion metadata pipeline ish holati, freshness, query soni va sifat testlarini ko‘rsatadi. Security metadata klassifikatsiya, maxfiylik darajasi va access policy bilan bog‘liq.

Katalog crawler, database information schema, orchestration tizimi, BI platforma va qo‘lda kiritilgan izohdan metadata yig‘adi. Avtomatik yig‘ish qamrovni oshiradi, lekin semantikani o‘zi to‘liq yaratmaydi. “amt” ustuni texnik jihatdan decimal ekani aniqlansa ham, valyuta va gross/net ma’nosini biznes egasi tasdiqlaydi.

Qidiruv va topish

Foydalanuvchi nom, tavsif, tag, domen, egasi yoki ustun bo‘yicha qidiradi. Sinonim va business glossary “mijoz”, “customer” va ichki qisqartmalarni bog‘laydi. Popularity signali keng ishlatiladigan aktivlarni yuqoriga chiqarishi mumkin, ammo ommaboplik sifatning o‘zi emas.

Dataset sahifasi sample qiymat, schema, freshness, quality score, downstream dashboard va so‘rov namunalarini ko‘rsatishi mumkin. Maxfiy ma’lumot sampleda maskalanadi. Access request katalogdan boshlansa, tasdiqlovchi va maqsad qayd etiladi; katalogning o‘zi ruxsatni chetlab o‘tmaydi.

Lineage va ta’sir tahlili

Lineage manba ustunidan transformatsiya orqali hisobotgacha bo‘lgan yo‘lni ko‘rsatadi. Schema o‘zgartirishdan oldin ta’sir qiladigan pipeline va dashboardlar topiladi. Incidentda buzilgan manbadan qaysi iste’molchilar foydalanishini aniqlash tezlashadi. SQL parsing avtomatik lineage yaratishi mumkin, ammo dynamic query, tashqi skript va qo‘lda eksport qamrovdan tashqarida qolishi mumkin.

Data provenance lineagega yaqin, lekin ma’lumotning kelib chiqishi, yig‘ilish sharti va transformatsiya dalillariga ko‘proq urg‘u beradi. Katalog bu yozuvlarga havola va versiyani saqlaydi.

Boshqaruv jarayoni

Katalog faqat metadata qabristoniga aylanmasligi uchun owner va stewardlar ta’riflarni ko‘rib chiqadi. Certified belgisi aktiv belgilangan mezonlardan o‘tganini bildiradi; eskirgan dataset deprecated qilinib, almashtiruvchi ko‘rsatiladi. Ownership yo‘qolsa, yangilanish va savollarga javob berish muddati buziladi.

Qamrov, faol foydalanuvchilar, muvaffaqiyatli qidiruv, izoh to‘liqligi, lineage ulushi va access olish vaqti foydani o‘lchaydi. Minglab jadvalni avtomatik ro‘yxatlash oson, ammo ishonchli ta’rif va sifat signalisiz topish muammosi hal bo‘lmaydi. Katalog data governance siyosatini amaliy ish oqimiga bog‘lagandagina qiymat yaratadi.

Federativ katalog

Yirik tashkilotda barcha domen metadata sini bitta markaziy jamoa qo‘lda boshqara olmaydi. Federativ model umumiy identifikator, klassifikatsiya va interoperability qoidalarini markazda belgilab, ta’rif hamda ownershipni domenlarga beradi. Qidiruv bir nechta manbani yagona indeksda ko‘rsatadi. Dublikat aktivlar canonical ID yoki equivalence havolasi bilan bog‘lanadi.

Semantic layer

Catalog fizik jadvalni topadi, semantic layer esa tasdiqlangan metric, dimension va join qoidalarini bajarish muhitiga beradi. “Revenue” ta’rifi faqat matn bo‘lib qolmasdan, qayta ishlatiladigan hisoblashga aylansa dashboardlar orasidagi farq kamayadi. Versiya o‘zgarishi downstream hisobotlarga lineage orqali yetkaziladi.

Bog‘liq tushunchalar

Metadata, Data dictionary, Data lineage, Data governance, Business glossary, Data provenance, Data quality