Bosh sahifa Wiki Computer vision

Computer vision

Computer vision — kompyuterga tasvir va videodan mazmunli ma’lumot olish, obyektlarni aniqlash hamda vizual sahna haqida xulosa chiqarish imkonini beradigan sun’iy intellekt sohasi. Vazifalar image classification, object detection, segmentation, tracking, pose estimation, OCR va 3D reconstructionni qamrab oladi. Natija faqat “rasmni ko‘rish” emas, belgilangan amaliy vazifa uchun o‘lchanadigan predictiondir.

Tasvir representationi

Digital image width, height, channel va pixel qiymatlaridan iborat tensor sifatida ifodalanadi. RGB, grayscale, infrared va depth sensor turli channel beradi. Pixel koordinatasi, rang fazosi, bit depth va normalization model inputi bilan mos bo‘lishi kerak. EXIF orientation qo‘llanmasa rasm aylangan holda tahlil qilinishi mumkin.

Resize aspect ratio’ni buzsa obyekt shakli o‘zgaradi. Letterbox bo‘sh joy qo‘shadi, crop esa chetdagi obyektni yo‘qotishi mumkin. Training va inference preprocessing bir xil bo‘ladi. Kamera calibration va lens distortion metric o‘lchov yoki 3D vazifada alohida tuzatiladi.

Asosiy vazifalar

Classification butun tasvirga label beradi. Object detection har obyekt uchun class va bounding box qaytaradi. Semantic segmentation har pixelga class, instance segmentation esa bir classdagi obyektlarni ham ajratadi. Keypoint detection tana bo‘g‘imi yoki landmark koordinatasini topadi.

Tracking videoda bir obyekt identity’sini kadrlar bo‘ylab saqlaydi. Optical flow pixel harakatini taxmin qiladi. Depth estimation sahna masofasini, stereo vision ikki kamera farqidan chuqurlikni oladi. Generative vision rasm yaratish yoki tiklashga qaratilgan bo‘lsa-da, uning evaluation va xavflari perception vazifalaridan farq qiladi.

Modellar

Klassik yondashuv edge, corner, texture va hand-crafted descriptorlardan foydalanadi. CNN local pattern va hierarchical feature’larni data’dan o‘rganadi. Vision Transformer tasvirni patch ketma-ketligi sifatida qayta ishlaydi. Hybrid model convolutionning local bias’i bilan attentionning global kontekstini birlashtirishi mumkin.

Transfer learning katta datasetda o‘qitilgan encoderni kichik domain datasetga moslaydi. Fine-tuning barcha yoki ayrim qatlamni yangilaydi. Domain shift — masalan kunduzgi yo‘l rasmlarida o‘qigan modelning tunda ishlashi — production sifatini pasaytiradi. Target muhit namunasi bilan validation zarur.

Data va annotation

Label sifati model chegarasini belgilaydi. Bounding box qoidasi occluded obyektni qanchalik qamrashi, “unknown” class va kichik obyekt thresholdi annotatorlarga aniq beriladi. Inter-annotator agreement noaniq classlarni ko‘rsatadi. Active learning model ishonchsiz namunalarni annotationga tanlaydi.

Augmentation crop, flip, rang va shovqin bilan invariantlikni oshiradi. Ammo yo‘l belgisi yozuvini teskari flip qilish yoki tibbiy tasvir rangini asossiz o‘zgartirish noto‘g‘ri label yaratishi mumkin. Synthetic data kam uchraydigan holatni ko‘paytiradi, real data bilan farqi o‘lchanadi.

Evaluation

Classification precision, recall va confusion matrix bilan baholanadi. Detection’da IoU threshold va mean Average Precision, segmentation’da pixel IoU ishlatiladi. Yuqori umumiy metric kichik, uzoq yoki muhim classdagi yomon sifatni yashirishi mumkin. Natija sharoit, kamera va demografik guruhlar bo‘yicha kesiladi.

Latency, throughput, model hajmi va energiya edge qurilmada muhim. Confidence probability sifatida noto‘g‘ri kalibrlangan bo‘lishi mumkin. Safety-critical tizim unknown va out-of-distribution tasvirni aniqlab, inson yoki xavfsiz fallbackga o‘tadi.

Maxfiylik va xavfsizlik

Kamera yuz, raqam va joylashuvni yozib oladi. Data minimization, retention, access va rozilik qoidasi datasetdan deploymentgacha saqlanadi. Training nusxasi va annotation platformasi ham himoya qilinadi. Zarur bo‘lmasa raw video emas, lokal agregat natija saqlanadi.

Adversarial patch yoki manipulyatsiya model predictionini o‘zgartirishi mumkin. Sensor spoofing, replay va model extraction tahdid modeliga kiradi. Oddiy accuracy security kafolati emas. Input decoder sandbox, fayl hajmi va pixel limiti bilan himoyalanadi.

Bog‘liq tushunchalar

Image classification, Object detection, Image segmentation, Convolutional neural network, Vision Transformer, Optical Character Recognition, Machine learning