Bosh sahifa Wiki Character Error Rate

Character Error Rate

Character Error Rate (CER) — tanilgan yoki generatsiya qilingan matnning reference matndan belgilar darajasida qanchalik farq qilishini o‘lchaydigan ko‘rsatkich. U ayniqsa OCR va handwriting recognition sifatini baholashda ishlatiladi. CER Levenshtein edit distance’dagi substitution, deletion va insertionlar yig‘indisini reference belgilar soniga bo‘lish orqali hisoblanadi.

Formula

CER quyidagicha ifodalanadi:

CER = (S + D + I) / N

Bu yerda S — almashtirilgan belgilar, D — tushib qolgan belgilar, I — ortiqcha qo‘shilgan belgilar, Nreference’dagi belgilar soni. Qiymat 0 bo‘lsa to‘liq moslik. Ko‘p insertion bo‘lsa CER 1 dan katta ham chiqishi mumkin.

Masalan, reference kitob, prediction kito bo‘lsa bitta deletion bor: CER 1/5 = 0.2. Reference salom, prediction solim bo‘lsa ikki substitution deb alignment topishi mumkin. Dynamic programming minimal editlar ketma-ketligini hisoblaydi.

Normalizatsiya qarorlari

CER’dan oldin matn qanday normalizatsiya qilinishi natijaga katta ta’sir qiladi. Case-insensitive baholashda harflar bir xil case’ga keltiriladi. Whitespace, punctuation va newline saqlanishi yoki chiqarilishi vazifaga bog‘liq. Bu qaror hisobotda ochiq yoziladi.

Unicode’da vizual bir xil belgi turli code point ketma-ketligida bo‘lishi mumkin. NFC normalization canonical farqni kamaytiradi. Tipografik apostrof va oddiy apostrofni birlashtirish real mahsulot talabiga qarab qilinadi. O‘zbek lotinida apostrof variantlarini butunlay e’tiborsiz qoldirish imlo xatosini yashirishi mumkin.

Alignment talqini

Edit distance bitta xato keyingi barcha belgilarni siljitib, ko‘plab xato deb sanalishining oldini olish uchun optimal alignment topadi. Shunga qaramay, bir nechta teng minimal alignment bo‘lishi mumkin. Error analysis substitution pair, position va confidence bilan ko‘riladi.

Space character sifatida sanalsa, so‘z chegarasi xatosi CERga kiradi. Space olib tashlansa birga va bir ga bir xil bo‘lib qoladi. OCR qidiruv uchun ishlatilsa bu farq muhim. Formula fieldida punctuation yoki decimal separator xatosi bitta belgi bo‘lsa ham katta biznes ta’siriga ega.

Aggregation

Dataset CER’ini barcha editlarni barcha reference belgilariga bo‘lib micro-average qilish mumkin. Har sahifa CER’ini o‘rtacha olish macro-average bo‘lib, qisqa va uzun sahifaga teng og‘irlik beradi. Ikkala natija farq qiladi. Bo‘sh reference alohida siyosat talab qiladi, chunki denominator nol.

Faqat umumiy CER kam ishlatiladigan til, kichik shrift yoki muhim fielddagi xatoni yashiradi. Natija til, hujjat turi, scan sifati va layout bo‘yicha kesiladi. Confidence threshold o‘zgarganda coverage bilan xato darajasi birga ko‘rsatiladi.

Boshqa metrikalar

Word Error Rate editlarni so‘z darajasida hisoblaydi. Bir character xatosi butun so‘zni noto‘g‘ri qiladi, shu sabab WER ko‘pincha yuqoriroq. Exact match form fieldning to‘liq to‘g‘riligini o‘lchaydi. Numeric accuracy raqam va qiymat semanticsiga mos bo‘lishi mumkin.

CER layout, reading order yoki bounding box sifatini o‘lchamaydi. Ikki ustun matni aralashsa belgilar to‘g‘ri tanilgan bo‘lsa ham katta edit distance chiqadi, ammo sabab recognition emas, layout bo‘lishi mumkin. Pipeline bosqichlari alohida va end-to-end baholanadi.

Amaliy foydalanish

Model versiyalari bir xil frozen test set va normalization skripti bilan solishtiriladi. Ground truthning o‘zi double review’dan o‘tadi; annotation xatosi modelga noto‘g‘ri jazo beradi. Test data training corpus bilan overlap qilmasligi kerak.

Production’da reference doim mavjud emas. Human-corrected namunalar, downstream validation va review rate proxy signal beradi. CER yaxshilanishi latency, model hajmi yoki muhim field aniqligi pasayishi evaziga bo‘lmasligi uchun ko‘p o‘lchamli baholash ishlatiladi.

Bog‘liq tushunchalar

Levenshtein distance, Word Error Rate, Optical Character Recognition, Edit distance, Ground truth, Text recognition, Evaluation metric