Data Cleansing — noto‘g‘ri, takroriy, nomuvofiq yoki to‘liq bo‘lmagan data’ni aniqlash va tuzatish jarayoni. U database arxitekturasi, data platformasi yoki governance jarayonidagi aniq vazifani ifodalaydi. Kafolatlar mahsulot, workload va tashkilot siyosatiga bog‘liq; termin nomi consistency, xavfsizlik yoki sifat darajasini avtomatik ta’minlamaydi.
Qo‘llanish sohasi
Profiling invalid format, outlier va duplicate’ni topadi. Rule standardization, deduplication, imputation yoki sourcega correction yuboradi.
Data Cleansing alohida texnologiya yoki jarayon bo‘lsa ham, source, storage, identity va consumer bilan birga ishlaydi. Authoritative state, ownership va lifecycle chegaralari yozma belgilanmasa, bir xil data turli jamoalarda boshqa ma’no olishi mumkin.
Ichki ishlash
Validation data qoidaga mosligini tekshiradi; cleansing aniqlangan muammoni tuzatadi yoki belgilaydi. Standardization formatni bir xillikka keltirishning bir qismidir.
Data Cleansing xavfsizligida access control bilan birga resource exhaustion tekshiriladi. Juda katta payload, murakkab query, cheksiz fan-out yoki yuqori cardinality umumiy xizmatni band qilmasligi uchun quota va limitlar qo‘llanadi. Data Cleansing uchun mas’ul komponent health signalidan tashqari, o‘zi himoya qiladigan invariant buzilmaganini ham davriy ravishda tekshiradi.
Data Cleansingda observability uchun high-cardinality ma’lumotni to‘g‘ridan-to‘g‘ri metric labelga aylantirish tavsiya etilmaydi. Aggregate ko‘rsatkichlar umumiy trendni, sampling qilingan trace va cheklangan diagnostik log esa muammoli key yoki queryni ko‘rsatadi. Maxfiy payload maskalanadi, correlation identifier esa qatlamlar bo‘ylab saqlanadi.
Samaradorlik
Avtomatik correction original ma’noni buzishi mumkin. Raw value, applied rule, confidence va reversible audit trail saqlanadi.
Data Cleansing uchun qabul mezoni nazorat inputi bilan tasdiqlanadi. Yakuniy qiymatdan tashqari ordering, metadata, intermediate state va external effect ham solishtiriladi; aggregate sonlar ayrim record yo‘qolishi yoki takrorlanishini yashirishi mumkin.
Correctness, latency, storage xarajati va governance birga baholanadi. Tez ingest yoki erkin schema qulaylik bersa ham, keyingi query, migration va access nazoratiga xarajat ko‘chirishi mumkin. Shu sabab Data Cleansing faqat nominal demo bilan baholanmaydi.
Sinov mezonlari
Data Cleansing monitoringi faqat process ishlayotganini emas, semantik holatni ko‘rsatadi. Consumer lag, queue depth, retry, deadlock, spill, stale statistics yoki recovery progress kabi metrikalar key va vaqt oralig‘i bilan bog‘lanadi.
Data Cleansing uchun alert aniq tekshirish qadamiga bog‘lanadi. Counter oshishi sababni o‘zi isbotlamaydi, biroq trace, raw log va configuration snapshot bilan birga muammo qaysi bosqichda yuz berganini toraytiradi.
Data Cleansing uchun dokumentatsiya example konfiguratsiya bilan cheklanmaydi. Unda invariant, failure paytidagi xulq, operator qarori va xavfsiz rollback yo‘li yoziladi. Yangi jamoa shu hujjat asosida tizimni taxminsiz tiklay olishi kerak.
Data Cleansing ishlab turgan muhitda o‘zgartirilganda canary guruh va nazorat guruhi bir xil workload bilan solishtiriladi. Error rate hamda latencydan tashqari data completeness, duplicate soni va recoverydan keyingi state tekshiriladi. Regression aniqlansa traffic eski yo‘lga qaytariladi, yangi formatda yozilgan metadata esa rollback bilan mosligi bo‘yicha alohida boshqariladi.
Data Cleansing o‘zgartirilgach normal oqim bilan birga malformed data, duplicate, schema change, restart, access denial va partial failure tekshiriladi. Qabul qilingan cheklovlar hujjatlashtiriladi va boshqa platformaga ko‘r-ko‘rona ko‘chirilmaydi.
Bog‘liq tushunchalar
data quality, deduplication, data profiling, validation, standardization, imputation