Bosh sahifa Wiki Text detection

Text detection

Text detection — rasm yoki video kadrida matn mavjud bo‘lgan hududlarni topish va ularning joylashuvini geometrik shakl bilan belgilash vazifasi. Natija bounding box, aylantirilgan to‘rtburchak yoki pixel mask bo‘lishi mumkin. Text detection matnning o‘zini o‘qimaydi; keyingi text recognition bosqichiga qaysi regionlarni berishni aniqlaydi.

Detection va recognition

OCR pipeline’da detector butun sahifa yoki sahna tasviridan text line, word yoki character regionlarini ajratadi. Recognizer crop qilingan regionni belgilar ketma-ketligiga aylantiradi. Ikki bosqich alohida model bo‘lishi yoki end-to-end tizimda birgalikda o‘qitilishi mumkin.

Document scan’da matn odatda tekis va zich, natural scene’da esa perspective, egri yozuv, yoritish va fon murakkab. Yo‘l belgisi, do‘kon peshlavhasi va mahsulot qadoqlari uchun oriented yoki polygon detector kerak. Video’da temporal tracking bir xil matnni har kadrda boshidan topish xarajatini kamaytiradi.

Model yondashuvlari

Connected component va edge-based klassik usullar kontrast hamda stroke xususiyatiga tayanadi. Ular aniq scan’da tez, lekin murakkab fonda ko‘p false positive beradi. Deep learning detector feature pyramid orqali turli o‘lchamdagi textni topadi. Anchor-based model oldindan belgilangan box shakllarini, segmentation model esa text region pixel maskini o‘rganadi.

Text uzun va ingichka bo‘lishi mumkin, oddiy object detectorning square anchorlari unga mos kelmaydi. Rotated box yoki quadrilateral orientationni saqlaydi. Curved text uchun polygon yoki centerline representation qo‘llanadi. Post-processing yaqin character yoki word regionlarini line’ga birlashtiradi.

Dataset va annotation

Annotation darajasi vazifaga mos bo‘lishi kerak: word box bilan o‘qitilgan model character box qaytara olmaydi. Illegible va “do not care” regionlar evaluation’da alohida belgilanadi. Juda tor box diakritika va soyani kesishi, juda keng box qo‘shni so‘zni qo‘shib olishi mumkin.

Synthetic data turli shrift, rang va perspective bilan ko‘p namuna yaratadi. Biroq real blur, material teksturasi va kamera artefaktini to‘liq bermaydi. Fine-tuning maqsad domenidagi real annotation bilan bajariladi. Train-test’da bir xil video kadrlarining yaqin nusxalari ajratilmasa leakage yuz beradi.

Baholash

Intersection over Union predicted va ground-truth region qoplamasini o‘lchaydi. Precision false detectionlarni, recall o‘tkazib yuborilgan textni ko‘rsatadi; F-score ikkalasini birlashtiradi. Box bo‘linishi yoki birlashishi sabab oddiy IoU yetarli bo‘lmasligi mumkin. End-to-end baholash region bilan birga tanilgan matnni ham tekshiradi.

Mahsulot talabi metrikani belgilaydi. Accessibility uchun kichik matnni o‘tkazib yuborish qimmat, tarjima overlay’da esa noto‘g‘ri fon regioni bezovta qiladi. Threshold confidence kalibrlanishi va qurilma latency’si bilan birga tanlanadi.

Pipeline integratsiyasi

Detector crop’ni recognizer talab qiladigan balandlikka normalize qiladi. Perspective transform qiyshiq box’ni to‘g‘rilaydi. Reading order layout analysis orqali belgilanadi. Bir regionda bir nechta satr qolsa recognition xatosi oshadi; haddan tashqari bo‘lish esa so‘z kontekstini yo‘qotadi.

Real-time tizimda rasm resize, quantization va hardware acceleration ishlatiladi. Kichik text resize’da yo‘qolmasligi uchun multi-scale inference yoki yuqori resolution tile kerak. Tile overlap bir so‘zni chegara bo‘ylab kesishdan saqlaydi, keyin duplicate boxlar non-maximum suppression bilan birlashtiriladi.

Maxfiylik

Sahna tasvirida mo‘ljallangan yozuvdan tashqari yuz, avtomobil raqami va joylashuv belgisi bo‘lishi mumkin. Edge processing raw kadrni serverga yubormasdan region natijasini chiqarishi mumkin. Saqlanadigan crop va video retention maqsad bilan cheklanadi, annotation platformasiga kirish audit qilinadi.

Bog‘liq tushunchalar

Optical Character Recognition, Text recognition, Object detection, Bounding box, Layout analysis, Computer vision, Image segmentation