Test set — model, algoritm yoki ma’lumotga asoslangan pipeline ishlab chiqilishi tugagach, uning ko‘rilmagan ma’lumotdagi umumlashtirish qobiliyatini baholash uchun ajratilgan to‘plamdir. U parametr o‘qitish, feature tanlash, giperparametr sozlash yoki threshold tanlash uchun ishlatilmaydi. Test natijasi yakuniy qarorga yaqin bir martalik xolis tekshiruv sifatida qaraladi.
Validationdan farqi
Validation set ishlab chiqish siklida qayta-qayta ishlatiladi. Ikki arxitektura orasidan yaxshisini tanlash ham validation vazifasidir. Test set faqat tanlangan pipeline — preprocessing, model, threshold va postprocessing — muzlatilgandan keyin ochiladi. Test natijasi yomon chiqib, model yana o‘zgartirilsa, ayni test endi validation roliga o‘tadi va yangi yakuniy test kerak bo‘ladi.
Bu qoida labelni bevosita ko‘rish bilan cheklanmaydi. Testdagi xatolarni qo‘lda tahlil qilib yangi feature yaratish, metrikaga qarab arxitektura almashtirish yoki yaxshi test seedini tanlash ham testga moslashishdir. Ko‘p jamoa umumiy benchmarkni yillar davomida optimallashtirsa, benchmarkning o‘zi ham bilvosita training signaliga aylanishi mumkin.
Ajratish strategiyasi
Random split kuzatuvlar mustaqil bo‘lsa qo‘llanadi. Vaqtga bog‘liq vazifada test ishlab chiqarishga yaqin keyingi davrdan olinadi. Foydalanuvchi, bemor, qurilma yoki hujjat bo‘yicha guruhlangan ma’lumotda bir guruhning recordlari train va testga tarqalmasligi kerak. Aks holda model umumiy qonuniyat o‘rniga identitetni eslab qoladi.
Geografik yoki domen generalizatsiyasi talab qilinsa, butun hudud yoki manba test uchun ushlab turiladi. Rare class yetarlicha namoyon bo‘lishi uchun stratification ishlatilishi mumkin, ammo haqiqiy prevalence sun’iy o‘zgarsa metrikalar qayta vaznlanadi. Test hajmi kutilgan farqni aniqlash uchun statistik quvvatga ega bo‘lishi lozim.
Baholash
Bitta o‘rtacha metrika to‘liq tasvir bermaydi. Klassifikatsiyada confusion matrix, precision, recall, specificity, calibration va thresholdga bog‘liq xarajatlar ko‘riladi. Regressionda MAE va RMSE xatolarga turlicha vazn beradi. Ranking, generation yoki survival vazifalari o‘z metrikasini talab qiladi.
Bootstrap yoki analitik usul ishonch oralig‘ini beradi. Ikki model ayni test obyektlarida baholansa, paired comparison ularning xatolari bog‘liqligidan foydalanadi. Segment natijalari sample size bilan beriladi; o‘n elementdagi 90 foiz va o‘n ming elementdagi 90 foiz bir xil aniqlikka ega emas.
Real foydalanishga moslik
Test taqsimoti deploymentdagi kirishni aks ettirmasa, yuqori ball chalg‘itadi. Dataset qurilgan vaqtdan keyin tushuncha o‘zgarishi, yangi qurilma yoki siyosat data drift yaratadi. Out-of-time test va shadow evaluation yangi muhit xavfini kamaytiradi. Offline metrika biznes natijasini to‘liq ifodalamasa, nazoratli onlayn eksperiment kerak bo‘ladi.
Test ma’lumotining kelib chiqishi, rozilik, preprocessing va chiqarib tashlash qoidalari hujjatlashtiriladi. Maxfiy labelga kirish cheklanadi, baholash kodi versiyalanadi. Test setni yashirin saqlashning maqsadi sir yaratish emas, qarorlar undan mustaqil bo‘lishini ta’minlashdir.
Human evaluation
Matn, audio yoki generativ natijada avtomatik metrika sifatning barcha jihatini ushlamasligi mumkin. Test setdan ko‘r namuna olinib, annotatorlar oldindan yozilgan rubric bo‘yicha baholaydi. Annotator agreement, tartib effekti va model nomini bilish tarafkashligi nazorat qilinadi. Maxfiy yoki zararli kontent uchun mutaxassis va xavfsiz ko‘rish muhiti kerak bo‘lishi mumkin.
Test fixture bilan farqi
Dasturiy testdagi kichik qo‘lda yozilgan fixture ham test ma’lumoti deb ataladi, lekin statistik test set vazifasi boshqa. Fixture aniq edge case va expected outputni tekshiradi; ML test set populyatsiyadagi umumlashtirishni baholaydi. Ishonchli tizim odatda ikkalasidan ham foydalanadi.
Bog‘liq tushunchalar
Validation set, Training set, Generalization, Benchmark, Model evaluation, Data drift, Confidence interval