Word Error Rate (WER) — Automatic Speech Recognition transcriptini reference matn bilan solishtirib, so‘z darajasidagi xatolar ulushini o‘lchaydigan metrika. U edit distance asosida substitution, deletion va insertionlarning eng kichik sonini topadi. Formula WER = (S + D + I) / N, bunda N reference’dagi so‘zlar soni.
Xato turlari
Substitution reference’dagi bir so‘z o‘rniga boshqa so‘z yozilganda yuz beradi. Deletion reference so‘zi outputda yo‘q bo‘lsa, insertion esa outputda ortiqcha so‘z paydo bo‘lsa hisoblanadi. Dynamic programming ikki ketma-ketlik orasidagi minimal alignmentni topadi.
Masalan, reference “model tez ishlaydi”, hypothesis “modul juda tez ishlaydi” bo‘lsa “model” → “modul” substitution va “juda” insertion bo‘ladi. S=1, I=1, D=0, N=3, shuning uchun WER 2/3. Bir xato keyingi alignmentga ta’sir qilishi mumkinligi sabab qo‘lda so‘zma-so‘z qarash har doim minimal edit yo‘lini bermaydi.
Normalization
WER’dan oldin text normalization qoidasi belgilanadi. Katta-kichik harf, punctuation, apostrof, hyphen, number va abbreviation bir xil shaklga keltirilmasa acoustic xato bo‘lmagan farqlar ham hisoblanadi. “17” va “o‘n yetti” semantik teng bo‘lsa-da, oddiy tokenization ularni turli ketma-ketlik deb ko‘radi.
Tilga mos tokenizer muhim. Agglutinative tilda bitta uzun so‘zdagi qo‘shimcha xatosi bitta substitution bo‘lib ko‘rinadi, spacing qoidasi o‘zgaruvchan yozuvda esa bir semantik xato bir nechta editga aylanishi mumkin. Shu sabab Character Error Rate yoki morpheme-level metrika qo‘shimcha ko‘rsatiladi. Normalizer reference va hypothesisga aynan bir xil qo‘llanadi.
Talqin
WER odatda qancha past bo‘lsa, shuncha yaxshi. U 100 foizdan yuqori chiqishi mumkin, chunki insertionlar soni reference so‘zlaridan ko‘p bo‘lishi ehtimoli bor. Zero WER transcript tokenlari reference bilan aynan mosligini bildiradi, ammo punctuation, speaker label yoki timestamp sifati haqida hech narsa demaydi.
Turli dataset, normalization va scoring protokolidagi WER’larni bevosita solishtirish noto‘g‘ri. Read speech, telefon suhbati va shovqinli meeting murakkabligi farq qiladi. Dataset juda qisqa bo‘lsa bir necha xato natijani keskin o‘zgartiradi; confidence interval yoki bootstrap estimate foydali.
Tahlilni boyitish
Umumiy WER accent, yosh, speaker, noise, device, til va domain bo‘yicha kesiladi. Rare name, raqam, inkor va command keyword xatolari alohida hisoblanadi. Amaliy zarar barcha so‘z uchun teng emas: dori dozasi yoki pul miqdoridagi substitution oddiy article xatosidan muhimroq.
Sentence Error Rate kamida bitta xato bo‘lgan gaplar ulushini, real-time factor esa tezlikni o‘lchaydi. Streaming tizimda final WER bilan birga partial transcript stability va latency ko‘riladi. Human transcript ham mutlaq gold standard emas; noaniq audio, spelling variant va annotator kelishmovchiligi reference sifatini cheklaydi.
Hisobot amaliyoti
Reproducible hisobot test set versiyasi, text normalization, tokenizer, case va punctuation siyosati, overlap va foreign speech bilan nima qilinganini yozadi. Error list faqat bitta son berishdan ko‘ra foydaliroq: substitution pair, deletion va insertion frequency modelning acoustic yoki language bias’ini ko‘rsatadi. Tizim yangilanganda aynan bir locked test set va alohida yangi-data test bilan regression tekshiriladi.
WER hisoblash kodi va normalizer konfiguratsiyasi natija bilan birga saqlansa, keyingi model versiyalari adolatli solishtiriladi.
Bog‘liq tushunchalar
Automatic Speech Recognition, Edit distance, Character Error Rate, Text normalization, Tokenization, Transcription, Error analysis