Bosh sahifa Wiki Automatic Speech Recognition

Automatic Speech Recognition

Automatic Speech Recognition (ASR) — inson nutqi yozilgan audio signalni lingvistik tokenlar ketma-ketligiga avtomatik aylantirish sohasi. ASR “nutqni tushunish” bilan aynan bir narsa emas: u avvalo nima aytilganini transkripsiya qiladi, intent yoki ma’noni aniqlash esa keyingi natural language processing bosqichi bo‘lishi mumkin.

Klassik arxitektura

An’anaviy pipeline waveformdan MFCC yoki filterbank feature hisoblaydi. Acoustic model feature’larni phonetic state ehtimollariga bog‘laydi. Pronunciation lexicon so‘zni phoneme ketma-ketligi bilan ifodalaydi, language model esa so‘zlar ketma-ketligining ehtimolini beradi. Decoder ushbu score’larni birlashtirib eng yaxshi transcriptni qidiradi.

Hidden Markov Model vaqt bo‘yicha state transitionlarni, Gaussian Mixture Model esa feature distributionini modellashtirgan. Keyinchalik deep neural network GMM o‘rnini egalladi. Klassik tizimning modullari alohida sozlanadi va yangi vocabulary qo‘shish oson, ammo pipeline murakkab va komponent xatolari yig‘iladi.

End-to-end modellar

CTC input frame’lar bilan qisqaroq output tokenlari orasidagi alignmentni oldindan belgilamasdan o‘rganadi. Blank belgisi va takrorlarni yig‘ish orqali transcript hosil bo‘ladi. RNN-Transducer acoustic encoder, prediction network va joint networkni birlashtirib streaming recognitionga mos keladi. Attention encoder-decoder to‘liq context’dan foydalanadi, lekin oddiy shakli online ishlashga qiyinroq.

Transformer va Conformer attention bilan local convolutionni uyg‘unlashtirib speech patternlarini modellashtiradi. Self-supervised pretraining katta transkripsiyasiz audio to‘plamdan representation o‘rganadi, so‘ng kamroq labeled data bilan fine-tuning qilinadi. Multilingual model kam resursli tilga transfer beradi, biroq dominant tillarning bias’ini ham olib kelishi mumkin.

Training data

Har audio segmentga aniq transcript kerak. Text normalization son, acronym, punctuation va hesitations qanday yozilishini standartlashtiradi. Audio-transcript alignment xatosi deletion yoki hallucinationga olib keladi. Dataset turli speaker, accent, yosh, microphone, room va noise holatini qamrashi kerak.

Speed perturbation, background noise va room impulse response augmentation robustnessni oshiradi. Synthetic data kam uchraydigan terminni ko‘paytirishi mumkin, ammo TTS artefactiga haddan tashqari moslashish xavfi bor. Train, validation va test speaker bo‘yicha ajratilib, bir odamning ovozi turli splitga sizib o‘tmasligi ta’minlanadi.

Decoding va moslashuv

Greedy decoding tez, beam search esa bir nechta candidate’ni saqlaydi. External language model shallow fusion orqali score qo‘shadi. Domain lexicon, hotword va contextual phrase maxsus nomlarni ko‘taradi. Score weight va insertion penalty validation’da sozlanmasa matn ortiqcha so‘z qo‘shishi yoki kam yozishi mumkin.

Streaming ASR audio chunk kelishi bilan partial transcript qaytaradi. Endpointing gap tugaganini aniqlaydi. Past latency uchun future context cheklanadi, bu accuracy bilan trade-off yaratadi. On-device model maxfiylik va offline ishlashni yaxshilaydi, lekin compute va memory limiti kuchli compression talab qiladi.

Baholash va mas’uliyat

Asosiy metrika Word Error Rate bo‘lib, substitution, deletion va insertionni hisoblaydi. Character Error Rate ayrim yozuv tizimlari uchun aniqroq. Named entity, number va keyword accuracy alohida kuzatiladi, chunki bitta raqam xatosi amaliy jihatdan ko‘p oddiy so‘z xatosidan xavfliroq.

Natijalar noise, accent, gender, device va domain bo‘yicha kesiladi. Confidence human reviewni yo‘naltiradi, lekin kalibrlanishi kerak. Audio shaxsiy ma’lumot bo‘lgani uchun consent, encryption, retention va access control zarur. Tibbiy, yuridik yoki favqulodda vazifalarda ASR outputi mutaxassis tekshiruvisiz yakuniy yozuv sifatida qabul qilinmaydi.

Bog‘liq tushunchalar

Speech-to-Text, Acoustic model, CTC, RNN-Transducer, Conformer, Language model, Word Error Rate