Bosh sahifa Wiki Voice Activity Detection

Voice Activity Detection

Voice Activity Detection (VAD) — audio oqimining qaysi vaqt oraliqlarida inson nutqi mavjudligini aniqlash vazifasi. U nutq mazmunini transkripsiya qilmaydi va speaker kimligini bilmaydi; faqat frame yoki segmentni speech va non-speech sinflariga ajratadi. VAD telephony, conferencing, Automatic Speech Recognition va audio recording pipeline’larida ishlatiladi.

Signal belgilaridan qaror

Oddiy energy-based detector frame energiyasini threshold bilan solishtiradi. Tinch muhitda samarali, ammo musiqa, shamol yoki keyboard shovqini ham yuqori energiya berishi mumkin. Zero-crossing rate, spectral flatness va harmonicity nutqni yaxshiroq ajratishga yordam beradi. Statistical model noise distributionini kuzatib, signal-to-noise ratio o‘zgarishiga moslashadi.

Neural VAD log-Mel feature yoki raw waveformdan speech probability chiqaradi. CNN local spectral patternni, recurrent layer vaqt kontekstini, transformer esa uzoqroq bog‘lanishni o‘rganadi. Training label frame darajasida beriladi. Labelning o‘zi noaniq: nafas, kulgi, shivirlash yoki juda qisqa filler speech hisoblanishi applicationga bog‘liq.

Segment hosil qilish

Frame probability darhol segment emas. Start threshold oshganda speech boshlanadi, end threshold pasayganda tugaydi. Hysteresis ikki xil threshold ishlatib boundary atrofidagi tez almashishni kamaytiradi. Hangover logic probability tushganidan keyin bir necha frame’ni speechda qoldiradi, chunki so‘z oxiri past energiyali bo‘lishi mumkin.

Pre-roll buffer detector triggeridan oldingi audio’ni saqlaydi. Aks holda birinchi consonant kesilishi mumkin. Post-roll gap oxirini to‘liq qamraydi. Minimum speech duration qisqa click’ni chiqarib tashlaydi, maximum segment duration esa juda uzun gapni ASR uchun boshqariladigan chunk’larga bo‘ladi.

Streaming va endpointing

Streaming VAD kelajak audiosiz qaror chiqaradi. Kichik frame latency’ni kamaytiradi, ammo probability beqarorroq bo‘ladi. Endpointing VAD’ga punctuation, ASR blank probability yoki semantic cue qo‘shib utterance tugaganini aniqlaydi. Oddiy silence threshold sekin gapiruvchi foydalanuvchini erta uzishi mumkin.

Duplex voice assistantda VAD barge-in’ni, ya’ni tizim gapirayotgan paytda foydalanuvchi nutqini aniqlaydi. Echo cancellation yetarli bo‘lmasa synthesizerning o‘z ovozi user speech deb topiladi. Far-field microphone array, beamforming va noise suppression VAD’dan oldin signalni yaxshilashi mumkin.

Baholash

Frame-level precision va recall speech decisionni o‘lchaydi. False acceptance noise’ni nutq deb qabul qilish, false rejection esa haqiqiy nutqni yo‘qotishdir. Segment boundary error va missed speech duration amaliy ta’sirni yaxshiroq ko‘rsatadi. ASR pipeline’da yakuniy WER va latency bilan birga baholash lozim.

Test set quiet room bilan cheklanmay, traffic, music, overlapping speech, whisper, turli microphone va tillarni qamraydi. Threshold operating point use case’ga bog‘liq: recording storage uchun false positive uncha xavfli emas, accessibility caption’da so‘zni kesish jiddiyroq.

Maxfiylik va resurs

Always-on VAD raw audio’ni doim tahlil qiladi. On-device detector audio’ni serverga yubormasdan wake segmentni topishi mumkin. Shunga qaramay indicator, consent, retention va access siyosati aniq bo‘lishi kerak. Model kichik, energiya tejamkor va real-time ishlashi uchun quantization qo‘llanadi. Monitoring speech ratio va trigger rate driftini kuzatadi, lekin foydalanuvchi nutqini keraksiz saqlamasligi kerak.

Moslashtirish

Threshold barcha qurilmaga bitta qiymatda qotirilmasligi mumkin. Calibration bosqichi microphone noise floorini o‘lchab boshlang‘ich nuqta beradi, neural probability esa keyin temporal rule bilan silliqlanadi. Shu bilan birga foydalanuvchi ovozi past bo‘lsa adaptive threshold uni noise deb chiqarib tashlamasligi kerak. Production telemetry raw audio o‘rniga aggregate trigger, duration va error signalini yig‘ib, maxfiylikni saqlagan holda driftni ko‘rsatishi mumkin.

Bog‘liq tushunchalar

Automatic Speech Recognition, Endpointing, Noise suppression, Beamforming, Audio frame, Signal-to-noise ratio, Wake word