ASR — audio signal ichidagi inson nutqini avtomatik ravishda matn, token yoki command ko‘rinishiga aylantiradigan sun’iy intellekt sohasi va texnologiyasi. To‘liq nomi Automatic Speech Recognition. ASR voice assistant, call center, subtitle, meeting transcription, smart device, diktovka va ovozli qidiruv tizimlarining asosini tashkil qiladi.
ASR ko‘pincha Speech-to-Text bilan bir ma’noda ishlatiladi. ASR texnik model va tanish jarayonini, STT esa foydalanuvchiga ko‘rinadigan “nutqdan matnga” xizmatini ko‘proq ifodalashi mumkin.
Signal va transcript
ASR modeli training vaqtida audio yozuv va unga mos transcript juftligidan foydalanadi:
audio waveform
→ "Bugun havo iliq."
Transcript audio bilan aniq mos bo‘lishi kerak.
Noto‘g‘ri, yetishmagan yoki ortiqcha so‘zlar model alignmentini buzadi.
Sampling rate
Audio soniyada ma’lum miqdordagi sample bilan saqlanadi.
Keng qiymatlar:
- 8 kHz — telefon audio;
- 16 kHz — nutq recognition uchun keng tarqalgan;
- 44.1 yoki 48 kHz — yuqori sifatli recording.
Model kutgan sampling rate bilan input mos bo‘lishi kerak.
Resampling signal sifatiga ta’sir qilishi mumkin.
Mono va stereo
Ko‘p ASR model bitta mono channel bilan ishlaydi.
Stereo recording:
- bir channelni tanlash;
- channelni aralashtirish;
- har channelni alohida tanish
orqali qayta ishlanadi.
Call centerda agent va mijoz alohida channelda yozilsa diarization osonlashadi.
Feature
Klassik ASR audio waveformni spectrogram, mel filter bank yoki MFCC kabi feature’ga aylantiradi.
Feature vaqt va frequency bo‘yicha nutq signalini ixcham ifodalaydi.
End-to-end neural model feature extractionni o‘zi o‘rganishi yoki raw waveform bilan ishlashi mumkin.
Acoustic model
Acoustic model audio frame va linguistic unitlar orasidagi probabilityni o‘rganadi.
Unit:
- phoneme;
- character;
- subword;
- token.
Model speaker, tezlik, pitch va shovqindagi variationlarga chidamli bo‘lishi kerak.
Pronunciation lexicon
Klassik ASRda so‘zning phoneme ketma-ketligi lug‘atda saqlanadi.
Masalan:
so‘z → phoneme sequence
Proper name, acronym va yangi termin lug‘atga qo‘shilishi mumkin.
End-to-end model explicit lexiconsiz ishlashi ham mumkin.
Language model
Language model token ketma-ketligining ehtimolini baholaydi.
Acoustic signal noaniq bo‘lsa, til contexti to‘g‘ri so‘zni tanlashga yordam beradi.
Domain-specific language model:
- product nomi;
- tibbiy termin;
- shahar;
- tashkilot;
- texnik atama
aniqligini oshirishi mumkin.
HMM-DNN tizimi
Tarixiy ASR architecture’lar Hidden Markov Model va neural acoustic modelni birlashtirgan.
HMM vaqt bo‘yicha state transitionni, DNN esa frame uchun acoustic likelihoodni hisoblagan.
Bunday tizimlar ko‘p component, lexicon va decoder graphga tayanadi.
End-to-end ASR
Zamonaviy model audio va transcriptni to‘g‘ridan-to‘g‘ri bog‘laydi.
Yondashuvlar:
- CTC;
- RNN Transducer;
- attention encoder-decoder;
- Transformer Transducer;
- encoder-decoder Transformer.
End-to-end pipeline soddaroq bo‘lishi mumkin, ammo katta dataset va compute talab qiladi.
Beam search
Decoder bitta eng yuqori tokenni emas, bir nechta candidate ketma-ketlikni saqlaydi.
Har candidate acoustic va language score oladi.
Beam kengligi oshsa sifat yaxshilanishi mumkin, lekin latency va memory ham oshadi.
Streaming
Streaming ASR audio kelishi bilan partial transcript beradi.
Talablar:
Model kelajak audio’ni ko‘rmagani sabab offline modeldan kamroq kontekstga ega bo‘lishi mumkin.
Offline recognition
Offline yoki batch ASR butun audio faylni oldindan ko‘radi.
Bu:
imkonini beradi.
Natija real vaqtda emas, keyinroq tayyorlanadi.
Keyword spotting
Ba’zi tizim to‘liq transcript emas, ma’lum wake word yoki commandni topadi.
Masalan:
"Hey assistant"
Keyword spotting kichik, energiya tejamkor model bilan qurilmada ishlashi mumkin.
False accept va false reject alohida o‘lchanadi.
Noise robustness
Real audio:
- ko‘cha shovqini;
- musiqa;
- echo;
- boshqa speaker;
- mikrofon sifati;
- reverberation
bilan murakkablashadi.
Training augmentationga noise va room simulation qo‘shiladi.
Faqat toza studiya datasetida o‘qitilgan model real muhitda yomon ishlashi mumkin.
Accent va sheva
Talaffuz speaker yoshi, hududi va til tajribasiga qarab farq qiladi.
Dataset turli accent va demographic guruhlarni qamrab oladi.
Aks holda ayrim guruhlarda error darajasi sezilarli yuqori bo‘lishi mumkin.
Code-switching
Bir gap ichida bir nechta til aralashishi mumkin:
Bugun deployni productionga chiqaramiz.
Multilingual ASR language boundaryni aniqlashi va har til tokenlarini to‘g‘ri yozishi kerak.
Technical termin va proper name ayniqsa murakkab.
Evaluation
Asosiy metric:
- Word Error Rate;
- Character Error Rate;
- real-time factor;
- latency;
- endpoint delay;
- proper-name accuracy;
- punctuation score.
WER past bo‘lsa ham raqam va ism xatosi business jarayon uchun jiddiy bo‘lishi mumkin.
Wake word va full ASR
Wake-word modeli qurilmada doimiy tinglab, faqat ma’lum signalni aniqlashi mumkin. Full ASR esa keyingi nutqni matnga aylantiradi. Bu architecture energiya va privacy sarfini kamaytiradi, chunki barcha audio cloudga yuborilmaydi. Wake word noto‘g‘ri ishlasa assistant tasodifan faollashishi yoki buyruqni o‘tkazib yuborishi mumkin.
Confidence calibration
Raw probability har doim real xato ehtimoliga teng emas. Calibration orqali 0.9 confidence berilgan segmentlarning taxminan qanchasi to‘g‘ri ekanligi tekshiriladi. Critical command uchun threshold va user confirmation ishlatiladi.
Model deployment
On-device ASR offline va privacy afzalligiga ega, cloud model esa katta compute va tez yangilanish beradi. Hybrid tizim oddiy commandni local, murakkab transkriptni serverda bajarishi mumkin.
Bog‘liq tushunchalar
Automatic Speech Recognition, Speech-to-Text, Acoustic model, Language model, CTC, RNN-T, Beam search, Keyword spotting, Word Error Rate, Speech processing