Bosh sahifa Wiki Data leakage

Data leakage

Data leakage — mashinaviy o‘rganish modelini yaratishda bashorat vaqtida mavjud bo‘lmaydigan yoki baholash to‘plamiga tegishli axborotning trening jarayoniga kirib qolishi hodisasidir. Natijada validation yoki test metrikasi sun’iy yuqori ko‘rinadi, model real ishlatilganda esa yomonlashadi. Leakage model algoritmidan ko‘ra dataset qurilishi, split va preprocessingdagi xatolardan ko‘p kelib chiqadi.

Target leakage

Feature targetning o‘zi yoki undan keyin hosil bo‘lgan ma’lumotni yashirin olib yurishi mumkin. Kredit qaytmasligini bashorat qilishda “undirishga yuborilgan sana” faqat mijoz to‘lamagandan keyin paydo bo‘ladi. Kasallikni oldindan aniqlash modelida davolash kodi tashxisdan keyin kiritilgan bo‘lsa, u deployment vaqtida mavjud emas.

Proxy ham xuddi shunday signal berishi mumkin. Record ID yaratish qoidasi klassga bog‘liq, fayl nomi annotator guruhini ochib beradi yoki missing pattern natijani bildiradi. Feature vaqti bilan prediction time qat’iy solishtiriladi: ayni qiymat real qaror paytida qonuniy olinadimi, degan savol har ustun uchun beriladi.

Train–test contamination

Bir obyektning dublikati train va testga tushsa, model yangi holatni emas, ayni namunani taniydi. Rasm augmentatsiyasining asl va o‘zgartirilgan nusxalari, bir bemorning tashriflari, bir muallif hujjatlari yoki bir qurilma signallari group bo‘yicha ajratiladi. Vaqt qatorida kelajakdan o‘tmishga ma’lumot o‘tmasligi uchun chronological split ishlatiladi.

Preprocessingni butun datasetda fit qilish ham leakage. Standardization o‘rtacha va dispersiyani, imputation medianani, vocabulary tokenlarni, feature selection target bilan bog‘liqlikni faqat training qismidan o‘rganishi kerak. Pipeline transformerni train foldda fit qilib, validation yoki testga faqat transform qo‘llaydi.

Aggregatsiya va join xatolari

“Foydalanuvchining umumiy xaridlari” featurei prediction sanasidan keyingi xaridlarni ham qo‘shsa, kelajak oqadi. Point-in-time correct join har training recordi uchun faqat o‘sha paytgacha ma’lum dimension va eventlarni oladi. Slowly changing dimensionning joriy holatini tarixiy recordlarga qo‘shish ham o‘tmishga kelajak atributini tarqatishi mumkin.

Target encoding kategoriyadagi o‘rtacha labeldan foydalanadi. U butun training setda hisoblanib ayni satrning labelini o‘z featureiga qo‘shsa, ayniqsa noyob kategoriyada kuchli leakage paydo bo‘ladi. Out-of-fold encoding va smoothing bu xavfni kamaytiradi.

Aniqlash

G‘ayrioddiy yuqori metrika, training kichik bo‘lsa ham mukammal natija va deploymentdagi keskin pasayish signal bo‘la oladi. Feature importance juda kuchli bitta ustunni ko‘rsatsa, uning kelib chiqishi tekshiriladi. Model vaqt bo‘yicha eski davrda o‘qitilib keyingi davrda sinovdan o‘tkaziladi; guruhlarni to‘liq ushlab qolgan holdout ham qo‘llanadi.

Leakage ni faqat ustun nomidan topib bo‘lmaydi. Dataset lineage, timestamp semantikasi, pipeline kodi va biznes jarayoni birga ko‘rib chiqiladi. Feature store point-in-time lookupni qo‘llashi, tajriba esa split qoidasi va transform fit chegarasini versiyalashi kerak. Test set yakuniy qarorgacha yopiq saqlanadi.

Competition va benchmark

Ochiq leaderboardga ko‘p submission yuborish uning public qismiga moslashishga olib keladi. Private holdout yakuniy reytingni boshqa namunada hisoblab, bu ta’sirni kamaytiradi. Shunga qaramay, bir benchmark yillar davomida ishlatilsa, tadqiqot hamjamiyatining tanlovlari unga moslashadi. Yangi domen va vaqt kesimidagi tashqi test natijani mustahkamlaydi.

Monitoringdagi belgi

Deploymentda model balli keskin pasayib, input distribution deyarli o‘zgarmagan bo‘lsa, training feature real vaqtda boshqacha hisoblangan bo‘lishi mumkin. Offline va online feature parity tekshiruvi bir xil entity hamda timestamp uchun qiymatlarni solishtiradi. Farq leakage, training-serving skew yoki kechikkan data sababini ajratishga yordam beradi.

Bog‘liq tushunchalar

Target leakage, Validation set, Test set, Feature engineering, Point-in-time join, Cross-validation, Data lineage