Bosh sahifa Wiki Acoustic model

Acoustic model

Acoustic model — nutq signalining akustik xususiyatlari bilan phoneme, token yoki synthesis representationi o‘rtasidagi bog‘lanishni o‘rganuvchi model. Automatic Speech Recognition’da audio frame’lardan lingvistik birlik ehtimoli olinadi; Text-to-Speech’da esa phoneme va prosody’dan spectrogram kabi akustik feature yaratiladi. Ikki yo‘nalish atamani ishlatsa-da, input-output vazifasi teskari.

Audio feature

Raw waveform yuqori sampling rate’li ketma-ketlik. Klassik pipeline uni qisqa frame’larga bo‘lib, spectrogram, Mel filterbank yoki MFCC hisoblaydi. Log-Mel spectrogram inson eshitishiga yaqin frequency masshtabini beradi. Window length vaqt va frequency aniqligi o‘rtasida muvozanat yaratadi.

Feature normalization speaker yoki recording volume farqini kamaytiradi. Voice Activity Detection silence’ni ajratishi mumkin. Noise reduction ayrim signalni yaxshilaydi, ammo speech detailni yo‘qotishi ham mumkin. Training va inference feature parametrlari aynan mos bo‘lishi kerak.

ASR acoustic modeli

Klassik HMM-GMM tizimida acoustic model frame uchun context-dependent phonetic state likelihood beradi, HMM esa vaqt ketma-ketligini modellashtiradi. DNN acoustic feature’dan state posterior hisoblab sifatni oshirdi. CNN local time-frequency pattern, recurrent network temporal context, transformer esa attention orqali uzoq bog‘lanishni ko‘radi.

End-to-end CTC, RNN-Transducer yoki encoder-decoder model acoustic encoder’ni text objective bilan birga o‘qitadi. “Acoustic model” alohida component sifatida kamroq ko‘rinsa ham, audio encoder shu vazifani bajaradi. Self-supervised pretraining katta unlabeled audio’dan representation o‘rganib, kam transkripsiyali tilga yordam beradi.

TTS acoustic modeli

TTS’da model text yoki phoneme sequence’dan Mel-spectrogram, duration, pitch va energy hosil qiladi. Autoregressive decoder oldingi framega tayansa yuqori sifatli, lekin sekin va alignment xatosiga moyil. Non-autoregressive model duration predictor orqali parallel frame yaratadi. Vocoder akustik outputni waveformga aylantiradi.

Multi-speaker model speaker embedding oladi. Style embedding emotion yoki speaking style’ni boshqaradi. Reference encoder audio namunasidan style chiqarishi mumkin, ammo source speaker identity va background noise’ni ham ko‘chirishi ehtimoli bor. Disentanglement style, content va speaker faktorlarini ajratishga urinadi.

Data va moslashuv

ASR data audio, transcript va kerak bo‘lsa speaker/time alignmentdan iborat. TTS recording bir xil mikrofon, tinch muhit va toza transcriptni talab qiladi. Clipping, noto‘g‘ri sample rate va transcript-audio mos kelmasligi modelga zarar beradi. Dataset til, dialekt, yosh va qurilma bo‘yicha qamrovli bo‘ladi.

Domain adaptation call-center, avtomobil yoki studiya muhitiga moslaydi. Noise augmentation, speed perturbation va room impulse response robustnessni oshiradi. Noto‘g‘ri augmentation haqiqiy phonemeni buzmasligi kerak. Speaker adaptation oz data bilan yangi ovoz yoki talaffuzga moslashadi.

Decoding va language model

ASR acoustic score til model score’i bilan beam searchda birlashtirilishi mumkin. Acoustic model bir xil eshitiladigan so‘zlarni ajrata olmasa context yordam beradi. Juda kuchli language model ism va yangi terminni keng so‘zga “tuzatishi” mumkin. Hotword va contextual biasing domain nomlarini ko‘taradi.

Score masshtabi va insertion penalty validation set’da sozlanadi. End-to-end model ichki language knowledgega ega bo‘lsa tashqi model bilan double counting ehtimoli mavjud. Error analysis acoustic confusion va language bias’ni ajratadi.

Baholash va production

ASR yakuniy WER bilan, phoneme darajasida PER bilan baholanadi. TTS acoustic prediction spectrogram loss, pitch/duration xatosi va tinglovchi testi bilan tekshiriladi. Loss pastligi tabiiy audio kafolati emas. Natija noise, speaker va utterance uzunligi bo‘yicha kesiladi.

Streaming model lookaheadni cheklab latency’ni kamaytiradi. Quantization va accelerator deploymentni yengillashtiradi. Monitoring audio distribution drift, silence rate va confidence o‘zgarishini kuzatadi. Raw audio maxfiy ma’lumot bo‘lishi mumkin; retention, access va trainingga qayta foydalanish rozilik bilan boshqariladi.

Bog‘liq tushunchalar

Automatic Speech Recognition, Text-to-Speech, Spectrogram, MFCC, CTC, Vocoder, Language model