Validation set — mashinaviy o‘rganish modelini ishlab chiqish jarayonida giperparametr, arxitektura, feature va to‘xtash nuqtasini tanlash uchun ishlatiladigan, training setdan ajratilgan ma’lumotlar qismidir. Model uning label laridan gradient orqali bevosita o‘rganmaydi, lekin muhandis validation natijasiga qarab ko‘p qaror qilgani uchun to‘plam model tanlash jarayonining bilvosita qismiga aylanadi.
Uch qismli ajratish
Training set model parametrlarini moslashtiradi. Validation set nomzod modellarni solishtiradi va konfiguratsiyani tanlaydi. Test set esa barcha tanlovlar tugagach, yakuniy tizimning xolisroq bahosini beradi. Validation va testni bir xil vazifada qayta-qayta ishlatish test natijasiga moslashish va optimistik baho keltiradi.
Oddiy random split mustaqil va bir xil taqsimlangan kuzatuvlarda ishlashi mumkin. Vaqt qatorida esa kelajak yozuvlarni trainingga, o‘tmishni validationga qo‘yish real foydalanishni buzadi. Chronological split oldingi davrda o‘qitib, keyingi davrda tekshiradi. Bir foydalanuvchining ko‘p yozuvi bo‘lsa, group split uning recordlarini faqat bitta qismda saqlab, identitet oqishini oldini oladi.
Model tanlash
Learning rate, daraxt chuqurligi, regularization, threshold va feature to‘plami validation metrikasi bilan tanlanadi. Early stopping har epochdan keyin validation lossni ko‘rib, yaxshilanish to‘xtaganda treningni tugatadi. Bu overfittingni kamaytirishi mumkin, lekin validation setga juda ko‘p qaror bog‘langan sari aynan shu to‘plamga moslashish xavfi ortadi.
Bir marta ajratilgan kichik validation natijasi tasodifiy bo‘lishi mumkin. K-fold cross-validation ma’lumotni bir necha foldga bo‘lib, navbatma-navbat validation qiladi. Natija o‘rtachasi va tarqalishi barqarorlikni ko‘rsatadi. Biroq vaqt, guruh yoki geografik bog‘liqlik mavjud bo‘lsa, oddiy K-fold o‘rniga muammoga mos splitter ishlatiladi.
Metrika va taqsimot
Validation set ishlab chiqarishdagi maqsadli populyatsiya va label nisbatini aks ettirishi kerak. Imbalanced klasslarda accuracy katta ko‘rinsa ham kam uchraydigan muhim klass yomon aniqlanishi mumkin. Precision, recall, PR-AUC, kalibratsiya va biznes xarajati birgalikda ko‘riladi. Threshold modeldan alohida tanlanadi.
Segmentlar bo‘yicha natija yashirin muammoni ko‘rsatadi. Umumiy metrika yaxshi bo‘lib, yangi foydalanuvchi, muayyan qurilma yoki til guruhida yomon bo‘lishi mumkin. Juda kichik segmentda ishonch oralig‘i keng bo‘ladi; xulosaga sample size qo‘shiladi.
Leakage va boshqaruv
Preprocessing splitdan oldin butun datasetda fit qilinsa, validation statistikasi trainingga sizadi. Imputation, scaling, vocabulary va feature selection faqat training qismida o‘rganilib, validationga qo‘llanadi. Bir obyektning dublikatlari turli qismlarga tushmasligi ham tekshiriladi.
Har tajribada dataset versiyasi, split seed yoki qoidasi, kod, model va metrikalar qayd etiladi. Validation to‘plami vaqt o‘tishi bilan ishlab chiqarish taqsimotidan uzoqlashishi mumkin; yangi davr uchun rolling validation yoki alohida out-of-time to‘plam kerak bo‘ladi. Yakuniy test esa model tanlash tugamaguncha yopiq saqlanadi.
Nested validation
Model oilasi va hyperparameter tanlanib, ayni cross-validation natijasi yakuniy sifat deb e’lon qilinsa, tanlash optimizmi qoladi. Nested cross-validation tashqi foldni baholash uchun, ichki foldlarni esa tanlash uchun ishlatadi. Bu hisoblashni ko‘paytiradi, lekin kichik datasetda model selection jarayonining umumlashtirishini to‘g‘riroq baholaydi.
Dataset versiyasi
Label tuzatish yoki yangi namunalar validation setni o‘zgartirsa, eski va yangi tajriba ballari bevosita tenglashtirilmaydi. Split manifest obyekt identifikatori, label versiyasi va vaqt chegarasini saqlaydi. Bir xil nomdagi “validation.csv”ning jim yangilanishi tajribalarni qayta yaratishni imkonsiz qiladi.
Bog‘liq tushunchalar
Training set, Test set, Cross-validation, Hyperparameter tuning, Early stopping, Data leakage, Model evaluation