Vocoder — nutq yoki boshqa audio signalning ixcham akustik tasviridan waveform hosil qiluvchi yoxud signalni tahlil va qayta sintez qiluvchi tizim. Atama voice coder birikmasidan kelib chiqqan. Zamonaviy Text-to-Speech tizimida vocoder odatda acoustic model yaratgan Mel-spectrogramni eshitiladigan raqamli audioga aylantiradi.
Tahlil va sintez g‘oyasi
Nutq manba va filtr sifatida qaralishi mumkin. Ovoz paychalari excitation signalini beradi, vocal tract esa uning spectral shaklini belgilaydi. Klassik vocoder signalni pitch, energy va spectral envelope kabi parametrlarga ajratadi. Decoder shu parametrlar asosida taxminiy waveformni tiklaydi. Bunday representation raw audio’dan kichikroq, biroq ayrim nozik phase va timbre ma’lumotlarini yo‘qotadi.
Telekommunikatsiyadagi channel vocoder bir necha frequency band energiyasini uzatib, juda past bitrate’da tushunarli nutq yaratgan. Linear predictive coding vocal tract filtrini koeffitsiyentlar bilan ifodalaydi. Bu usullar samarali, ammo ovoz metall yoki robotga o‘xshash eshitilishi mumkin.
Neural vocoderlar
Neural vocoder data’dan akustik feature bilan waveform orasidagi murakkab bog‘lanishni o‘rganadi. WaveNet sample’larni oldingi sample’larga shartlangan autoregressive distribution orqali yaratadi. Sifat yuqori bo‘lsa-da, sample’larni ketma-ket hisoblash sekin. Parallel WaveNet va flow-based modellar parallel generationga intilgan.
GAN asosidagi HiFi-GAN singari arxitekturalar generator va discriminator yordamida tez sintez qiladi. Multi-period discriminator signalning turli periodik tuzilmalarini, multi-scale discriminator esa bir nechta vaqt masshtabini tekshiradi. Diffusion vocoder noise’dan boshlab bosqichma-bosqich waveform tiklaydi; u sifatli natija berishi mumkin, lekin sampling qadamlari latency’ni oshiradi.
Input va signal mosligi
Vocoder o‘qitilgan feature formatiga qat’iy bog‘liq. Sample rate, FFT size, hop length, window, Mel bandlar soni va normalization acoustic model outputiga mos bo‘lishi shart. Masalan, 22.05 kHz data uchun o‘qitilgan vocoderga boshqa masshtabdagi spectrogram berilsa pitch va davomiylik buziladi.
Training juftligi original waveform va aynan undan hisoblangan spectrogramdan iborat. Clipping, DC offset, noto‘g‘ri trim yoki turli recording level modelga artefact o‘rgatishi mumkin. Multi-speaker vocoder kengroq ovozlar uchun chidamli bo‘ladi, lekin target domain’ga mos fine-tuning ayrim hollarda sifatni oshiradi.
Sifat va ishlash mezonlari
Baholashda tinglovchi testi muhim: mean opinion score tabiiylikni, preference test esa ikki tizimdan qaysi biri afzalligini o‘lchaydi. Spectral distance va pitch xatosi diagnostika beradi, biroq inson idrokini to‘liq ifodalamaydi. Buzzing, metallic noise, hiss, phase buzilishi va sibilant tovushlarning parchalanishi keng tarqalgan xatolardir.
Production tizimda real-time factor, first-audio latency, xotira va energiya sarfi kuzatiladi. Quantization va model pruning mobil qurilmada ishlashni yengillashtiradi. Streaming vocoder spectrogram chunk’larini qabul qiladi, ammo chunk chegarasida uzilish bo‘lmasligi uchun overlap yoki state saqlash talab etiladi. Ovoz klonlashda vocoder faqat signal generatori bo‘lsa ham, butun pipeline rozilik, watermarking va suiiste’mol nazoratiga muhtoj.
Generalizatsiya
Universal vocoder turli speaker, pitch va recording conditionda ishlashga o‘rgatiladi. Acoustic model xato spectrogram chiqarsa vocoder uni ba’zan yumshatadi, ba’zan esa kuchli artefactga aylantiradi. Ground-truth spectrogram va predicted spectrogram bilan alohida test qilish xato manbasini ajratadi. Out-of-range pitch, juda uzun silence va keskin energy transition stress-test sifatida kiritiladi; faqat toza studio gaplari bilan baholash production xatarini yashiradi.
Bog‘liq tushunchalar
Text-to-Speech, Acoustic model, Mel-spectrogram, WaveNet, HiFi-GAN, Diffusion model, Waveform