Optical Character Recognition (OCR) — rasm, skan yoki videodagi yozuv tasvirini machine-readable matnga aylantirish texnologiyasi. U bosma hujjatni qidiriladigan PDF qilish, chek va formadan maydon olish, arxivni raqamlashtirish hamda tasvirdagi yozuvni tarjima qilishda ishlatiladi. OCR natijasi original tasvirning o‘zi emas, undagi belgilar haqidagi model taxminidir.
Jarayon bosqichlari
Input avval deskew, denoise, contrast normalization va binarization kabi preprocessingdan o‘tishi mumkin. Kamera tasvirida perspective correction, blur va yoritish farqi muhim. Haddan tashqari filtrlash nuqta, diakritika yoki ingichka chiziqni yo‘qotishi mumkin, shu sabab parametr hujjat turiga mos tanlanadi.
Text detection rasmda matn joylashgan regionlarni topadi. Layout analysis ustun, sarlavha, paragraf, jadval va rasm tartibini aniqlaydi. Text recognition har regionni belgilar ketma-ketligiga aylantiradi. Post-processing til modeli, lug‘at va format qoidasi bilan ehtimoliy xatoni tuzatadi.
Recognition modellari
Klassik OCR segmentatsiya orqali satrni so‘z va belgiga bo‘lib, feature hamda classifier bilan har belgini taniydi. Zamonaviy tizim CNN yoki vision encoder yordamida tasvir feature’ini oladi, recurrent/transformer decoder yoki CTC bilan matn ketma-ketligini chiqaradi. End-to-end model character segmentationni alohida talab qilmasligi mumkin.
Model til va scriptni bilishi kerak. Lotin, kirill, arab yozuvi va vertikal matn turli xususiyatga ega. Bir hujjatda bir nechta til bo‘lsa language detection yoki multilingual model ishlatiladi. O‘zbek matnida apostrofning turli Unicode variantlari va lotin-kirill aralashuvi post-processingga ta’sir qiladi.
Sifat o‘lchovi
Character Error Rate insert, delete va substitutionlar sonini reference belgilariga nisbatan o‘lchaydi. Word Error Rate so‘z darajasidagi farqni beradi. Layout uchun bounding box IoU, reading order va table structure alohida baholanadi. Faqat umumiy aniqlik kam uchraydigan, lekin muhim field xatosini yashirishi mumkin.
Ground truth inson tomonidan tekshirilgan matn va joylashuvdan tuziladi. Train hamda test bir skan to‘plamining deyarli bir xil sahifalarini bo‘lishsa data leakage natijani oshiradi. Test turli printer, kamera, shrift, shovqin, til va hujjat yoshini qamrab oladi.
Hujjatni qayta qurish
Plain text extraction o‘qish tartibini saqlashi kerak. Ikki ustunli sahifani qator bo‘yicha birlashtirish gaplarni aralashtiradi. Jadvalda cell boundary va row-column munosabati matnning o‘zidan muhim. Formada label bilan qiymat bog‘lanadi. Output ALTO XML, hOCR, searchable PDF yoki structured JSON bo‘lishi mumkin.
Searchable PDF original sahifa tasviriga ko‘rinmas text layer qo‘shadi. Coordinate va font mapping noto‘g‘ri bo‘lsa select hamda copy sifati yomonlashadi. Arxiv uchun original scan o‘zgartirilmay saqlanadi, OCR layer qayta yaratiladigan hosila sifatida versiyalanadi.
Xatolar va inson nazorati
Past resolution, blur, curved page, murakkab fon va dekorativ shrift aniqlikni pasaytiradi. 0/O, 1/l/I va o‘xshash belgilar kontekstsiz chalkashadi. Confidence score ehtimolni bildiradi, lekin turli model score’i bir xil kalibrlanmagan bo‘lishi mumkin. Threshold real xato narxiga moslanadi.
Hisob raqami, summa yoki ism kabi yuqori ta’sirli field rule va human review’dan o‘tadi. Ikki marta mustaqil kiritish yoki source image bilan side-by-side tekshirish qo‘llanadi. OCR output’ni tekshirmasdan yuridik yoki moliyaviy qarorga ishlatish xavfli.
Maxfiylik va xavfsizlik
Hujjat shaxsiy, tibbiy yoki tijorat sirini saqlashi mumkin. Cloud OCR xizmatiga yuborishdan oldin data location, retention va model training siyosati baholanadi. Access control original rasm va extracted textga bir xil darajada tatbiq etiladi. Log va preview’da maxfiy maydon maskalanadi.
Rasm parserlari ham zaiflikka ega bo‘lishi mumkin. Fayl type, o‘lcham, pixel count va decompression limiti tekshiriladi, processing sandboxda bajariladi. OCR topgan formula yoki URL ishonchli command emas; downstream avtomatizatsiya schema validation va allowlist ishlatadi.
Bog‘liq tushunchalar
Text detection, Layout analysis, Character Error Rate, Document AI, Computer vision, Handwriting recognition, CTC