Bosh sahifa Wiki Object detection

Object detection

Object detectionimage yoki video ichidagi obyektlarni topib, har biri uchun class va spatial joylashuvni qaytaradigan computer vision vazifasi. Classification butun rasmga bitta label bersa, detection odatda bounding box, class score va confidence beradi. Bir rasmda turli classdagi ko‘p obyekt bo‘lishi mumkin.

Bounding box ifodasi

Box (x_min, y_min, x_max, y_max) burchaklar yoki center, width va height orqali yoziladi. Koordinata pixel yoki image o‘lchamiga nisbatan normallashtirilgan bo‘lishi mumkin. Training annotation obyektni izchil qamrashi kerak; juda bo‘sh yoki kesilgan box localizationni buzadi.

Intersection over Union predicted va reference box kesishma yuzasini birlashma yuzasiga bo‘ladi. IoU threshold’dan yuqori prediction true positive hisoblanadi. Bir real obyektga bir nechta prediction tushsa odatda bittasi to‘g‘ri, qolganlari duplicate false positive bo‘ladi.

Ikki bosqichli detektorlar

R-CNN oilasida avval region proposal, so‘ng har region uchun classification va box regression bajariladi. Faster R-CNN proposal networkni backbone feature map bilan birga o‘qitadi. ROI pooling yoki ROI Align turli o‘lchamdagi regionni fixed featurega aylantiradi. Bu yondashuv aniq, ammo ko‘p proposal sabab latency yuqoriroq bo‘lishi mumkin.

Bir bosqichli detektorlar

YOLO va SSD image grid yoki feature map nuqtalaridan class hamda boxni bevosita bashorat qiladi. Bir marta forward pass tez ishlaydi. Anchor-based model oldindan tanlangan box shakllarini tuzatadi; anchor-free model center, corner yoki distance’ni chiqaradi. Feature Pyramid Network kichik va katta obyektlar uchun turli resolution feature’larni birlashtiradi.

Predictionlar orasida confidence threshold qo‘llanadi. Non-Maximum Suppression bir classdagi kuchli boxni saqlab, u bilan IoU katta bo‘lgan past score’li duplicatlarni olib tashlaydi. Juda agressiv NMS yonma-yon obyektlardan birini yo‘qotishi mumkin; Soft-NMS score’ni pasaytiradi.

Training va data

Loss classification, localization va objectness qismlaridan tuziladi. Class imbalance kuchli: background candidate’lar obyektlardan ancha ko‘p. Focal loss oson negativlarning hissasini kamaytiradi. Crop, scale, color va mosaic augmentation robustnessni oshiradi, ammo box annotation transform bilan aynan mos o‘zgarishi shart.

Small object kam pixelga ega bo‘lgani uchun qiyin. Occlusion, blur, crowd, noodatiy viewpoint va domain shift xatoni oshiradi. Datasetdagi “obyekt” ta’rifi aniq bo‘lmasa annotatorlar bir xil scene’ni turlicha belgilaydi.

Baholash va deployment

Precision predictionlarning qanchasi to‘g‘ri, recall real obyektlarning qanchasi topilganini ko‘rsatadi. Average Precision confidence bo‘yicha precision-recall curve yuzasini, mAP esa classlar bo‘yicha o‘rtachani beradi. Hisobot IoU diapazoni, object size va class kesimini ko‘rsatadi.

Production’da latency, frame rate, xotira va threshold business cost bilan tanlanadi. Surveillance yoki face detection privacy va bias xavfiga ega. Model outputi shaxs identitysi yoki niyatini isbotlamaydi; yuqori xavfli qarorda human review, access control va aniq retention siyosati kerak.

Amaliy tekshiruv

Object detection bilan ishlaydigan tajribada annotation, confidence threshold, IoU va NMS parametrlari model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija class, obyekt hajmi va occlusion bo‘yicha precision-recall orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa bir obyektga takror box va crowd ichida yo‘qolgan detectionlarni erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.

Bog‘liq tushunchalar

Image classification, Bounding box, Intersection over Union, Non-Maximum Suppression, Feature Pyramid Network, YOLO, Mean Average Precision