Bosh sahifa Wiki ASR

ASR

ASR — audio signal ichidagi inson nutqini avtomatik ravishda matn, token yoki command ko‘rinishiga aylantiradigan sun’iy intellekt sohasi va texnologiyasi. To‘liq nomi Automatic Speech Recognition. ASR voice assistant, call center, subtitle, meeting transcription, smart device, diktovka va ovozli qidiruv tizimlarining asosini tashkil qiladi.

ASR ko‘pincha Speech-to-Text bilan bir ma’noda ishlatiladi. ASR texnik model va tanish jarayonini, STT esa foydalanuvchiga ko‘rinadigan “nutqdan matnga” xizmatini ko‘proq ifodalashi mumkin.

Signal va transcript

ASR modeli training vaqtida audio yozuv va unga mos transcript juftligidan foydalanadi:

audio waveform
→ "Bugun havo iliq."

Transcript audio bilan aniq mos bo‘lishi kerak.

Noto‘g‘ri, yetishmagan yoki ortiqcha so‘zlar model alignmentini buzadi.

Sampling rate

Audio soniyada ma’lum miqdordagi sample bilan saqlanadi.

Keng qiymatlar:

  • 8 kHz — telefon audio;
  • 16 kHz — nutq recognition uchun keng tarqalgan;
  • 44.1 yoki 48 kHz — yuqori sifatli recording.

Model kutgan sampling rate bilan input mos bo‘lishi kerak.

Resampling signal sifatiga ta’sir qilishi mumkin.

Mono va stereo

Ko‘p ASR model bitta mono channel bilan ishlaydi.

Stereo recording:

  • bir channelni tanlash;
  • channelni aralashtirish;
  • har channelni alohida tanish

orqali qayta ishlanadi.

Call centerda agent va mijoz alohida channelda yozilsa diarization osonlashadi.

Feature

Klassik ASR audio waveformni spectrogram, mel filter bank yoki MFCC kabi feature’ga aylantiradi.

Feature vaqt va frequency bo‘yicha nutq signalini ixcham ifodalaydi.

End-to-end neural model feature extractionni o‘zi o‘rganishi yoki raw waveform bilan ishlashi mumkin.

Acoustic model

Acoustic model audio frame va linguistic unitlar orasidagi probabilityni o‘rganadi.

Unit:

  • phoneme;
  • character;
  • subword;
  • token.

Model speaker, tezlik, pitch va shovqindagi variationlarga chidamli bo‘lishi kerak.

Pronunciation lexicon

Klassik ASRda so‘zning phoneme ketma-ketligi lug‘atda saqlanadi.

Masalan:

so‘z → phoneme sequence

Proper name, acronym va yangi termin lug‘atga qo‘shilishi mumkin.

End-to-end model explicit lexiconsiz ishlashi ham mumkin.

Language model

Language model token ketma-ketligining ehtimolini baholaydi.

Acoustic signal noaniq bo‘lsa, til contexti to‘g‘ri so‘zni tanlashga yordam beradi.

Domain-specific language model:

  • product nomi;
  • tibbiy termin;
  • shahar;
  • tashkilot;
  • texnik atama

aniqligini oshirishi mumkin.

HMM-DNN tizimi

Tarixiy ASR architecture’lar Hidden Markov Model va neural acoustic modelni birlashtirgan.

HMM vaqt bo‘yicha state transitionni, DNN esa frame uchun acoustic likelihoodni hisoblagan.

Bunday tizimlar ko‘p component, lexicon va decoder graphga tayanadi.

End-to-end ASR

Zamonaviy model audio va transcriptni to‘g‘ridan-to‘g‘ri bog‘laydi.

Yondashuvlar:

End-to-end pipeline soddaroq bo‘lishi mumkin, ammo katta dataset va compute talab qiladi.

Decoder bitta eng yuqori tokenni emas, bir nechta candidate ketma-ketlikni saqlaydi.

Har candidate acoustic va language score oladi.

Beam kengligi oshsa sifat yaxshilanishi mumkin, lekin latency va memory ham oshadi.

Streaming

Streaming ASR audio kelishi bilan partial transcript beradi.

Talablar:

Model kelajak audio’ni ko‘rmagani sabab offline modeldan kamroq kontekstga ega bo‘lishi mumkin.

Offline recognition

Offline yoki batch ASR butun audio faylni oldindan ko‘radi.

Bu:

  • uzun context;
  • bidirectional encoder;
  • yaxshi punctuation;
  • aniq diarization

imkonini beradi.

Natija real vaqtda emas, keyinroq tayyorlanadi.

Keyword spotting

Ba’zi tizim to‘liq transcript emas, ma’lum wake word yoki commandni topadi.

Masalan:

"Hey assistant"

Keyword spotting kichik, energiya tejamkor model bilan qurilmada ishlashi mumkin.

False accept va false reject alohida o‘lchanadi.

Noise robustness

Real audio:

  • ko‘cha shovqini;
  • musiqa;
  • echo;
  • boshqa speaker;
  • mikrofon sifati;
  • reverberation

bilan murakkablashadi.

Training augmentationga noise va room simulation qo‘shiladi.

Faqat toza studiya datasetida o‘qitilgan model real muhitda yomon ishlashi mumkin.

Accent va sheva

Talaffuz speaker yoshi, hududi va til tajribasiga qarab farq qiladi.

Dataset turli accent va demographic guruhlarni qamrab oladi.

Aks holda ayrim guruhlarda error darajasi sezilarli yuqori bo‘lishi mumkin.

Code-switching

Bir gap ichida bir nechta til aralashishi mumkin:

Bugun deployni productionga chiqaramiz.

Multilingual ASR language boundaryni aniqlashi va har til tokenlarini to‘g‘ri yozishi kerak.

Technical termin va proper name ayniqsa murakkab.

Evaluation

Asosiy metric:

WER past bo‘lsa ham raqam va ism xatosi business jarayon uchun jiddiy bo‘lishi mumkin.

Wake word va full ASR

Wake-word modeli qurilmada doimiy tinglab, faqat ma’lum signalni aniqlashi mumkin. Full ASR esa keyingi nutqni matnga aylantiradi. Bu architecture energiya va privacy sarfini kamaytiradi, chunki barcha audio cloudga yuborilmaydi. Wake word noto‘g‘ri ishlasa assistant tasodifan faollashishi yoki buyruqni o‘tkazib yuborishi mumkin.

Confidence calibration

Raw probability har doim real xato ehtimoliga teng emas. Calibration orqali 0.9 confidence berilgan segmentlarning taxminan qanchasi to‘g‘ri ekanligi tekshiriladi. Critical command uchun threshold va user confirmation ishlatiladi.

Model deployment

On-device ASR offline va privacy afzalligiga ega, cloud model esa katta compute va tez yangilanish beradi. Hybrid tizim oddiy commandni local, murakkab transkriptni serverda bajarishi mumkin.

Bog‘liq tushunchalar

Automatic Speech Recognition, Speech-to-Text, Acoustic model, Language model, CTC, RNN-T, Beam search, Keyword spotting, Word Error Rate, Speech processing