Bosh sahifa Wiki STT

STT

STT — inson nutqini audio signaldan yozma matnga aylantiradigan texnologiya. To‘liq nomi Speech-to-Text. STT call center transkripti, subtitle, voice command, meeting note, diktovka, accessibility va voice interface tizimlarida qo‘llanadi.

STT ko‘pincha ASR atamasi bilan bir ma’noda ishlatiladi. Amaliyotda STT mahsulot funksiyasini, ASR esa nutqni avtomatik tanish sohasi va modelini ifodalashi mumkin.

Audio signal

Kirish manbasi:

  • mikrofon;
  • telefon;
  • video;
  • meeting recording;
  • radio;
  • call center audio;
  • live stream

bo‘lishi mumkin.

Sample rate, channel, codec va recording sifati recognition natijasiga ta’sir qiladi.

Preprocessing

Audio modelga uzatilishidan oldin:

bajarilishi mumkin.

Juda agressiv noise reduction nutq tovushlarini ham yo‘qotishi ehtimoli bor.

Voice Activity Detection

VAD audioda nutq bor yoki yo‘qligini aniqlaydi.

U:

  • recordingni bo‘lish;
  • bo‘sh vaqtni tashlab ketish;
  • streaming endpoint;
  • hisoblashni kamaytirish

uchun ishlatiladi.

Fon musiqasi yoki shovqin VADni chalg‘itishi mumkin.

Feature extraction

Klassik tizim audio waveformdan acoustic feature oladi.

Misollar:

  • spectrogram;
  • mel-spectrogram;
  • MFCC;
  • filter bank energy.

Zamonaviy end-to-end model raw audio yoki learned feature bilan ishlashi mumkin.

Acoustic model

Acoustic model audio frame va phoneme, character yoki tokenlar orasidagi bog‘lanishni o‘rganadi.

U talaffuz, speaker va shovqin variationlarini model qiladi.

Training uchun audio va aniq transcript juftliklari kerak.

Language model

Language model acoustic jihatdan o‘xshash variantlardan grammatik va kontekstga mosini tanlashga yordam beradi.

Masalan, talaffuzi o‘xshash ikki so‘z gap kontekstida farqlanadi.

Domain vocabulary va custom phrase list recognitionni yaxshilashi mumkin.

Decoder

Decoder acoustic score, language score va boshqa constraintlarni birlashtirib yakuniy token ketma-ketligini topadi.

Usullar:

  • greedy decoding;
  • beam search;
  • CTC decoding;
  • transducer decoding;
  • sequence-to-sequence.

Beam kengligi sifat va hisoblash xarajatiga ta’sir qiladi.

CTC

Connectionist Temporal Classification audio frame va text token orasidagi aniq alignment bo‘lmaganda trainingga yordam beradi.

Model blank va token probabilitylarini chiqaradi.

Decoder takroriy token hamda blanklarni qoidaga ko‘ra collapse qiladi.

Transducer

RNN-T yoki boshqa transducer architecture streaming speech recognitionda keng ishlatiladi.

Model acoustic encoder, prediction network va joint networkdan tashkil topishi mumkin.

U audio kelishi bilan bosqichma-bosqich token chiqaradi.

Sequence-to-sequence

Encoder audio representation yaratadi, decoder attention orqali text tokenlarni generatsiya qiladi.

Bu punctuation, context va multilingual vazifalarda kuchli bo‘lishi mumkin.

Uzoq audio uchun memory, latency va hallucinationga o‘xshash xatolar nazorat qilinadi.

Streaming STT

Live audioda partial transcript doimiy yangilanadi.

Masalan:

Men bugun...
Men bugun Toshkentga...
Men bugun Toshkentga boraman.

Oldingi partial text keyingi context bilan o‘zgarishi mumkin.

Final segment endpoint aniqlanganda tasdiqlanadi.

Endpointing

Speaker gapni tugatganini aniqlash endpointing deb ataladi.

Faqat jimlik uzunligiga tayanish sekin gapiruvchi userni erta kesishi mumkin.

Model:

signalidan foydalanishi mumkin.

Punctuation

Audio ichida vergul yoki nuqta bevosita aytilmaydi.

Model gap structure va pauza asosida punctuation qo‘shadi.

Punctuation va capitalization alohida post-processing model bilan bajarilishi ham mumkin.

Speaker diarization

Bir recordingdagi speakerlarni ajratish:

Speaker 1
Speaker 2

deb belgilash.

Diarization kim gapirganini aniqlaydi, ammo har doim shaxs identity’sini bilmaydi.

Speaker overlap aniqlikni pasaytiradi.

Timestamp

STT word yoki segment uchun boshlanish va tugash vaqtini berishi mumkin.

Bu:

  • subtitle;
  • audio qidiruv;
  • editor;
  • compliance review

uchun ishlatiladi.

Timestamp alignment model va decodingga bog‘liq aniqlikka ega.

Word Error Rate

STT sifati Word Error Rate bilan o‘lchanadi.

U:

  • substitution;
  • deletion;
  • insertion

xatolarini reference so‘zlar soniga nisbatan hisoblaydi.

Past WER yaxshi, lekin ism, raqam va critical commanddagi xato alohida baholanadi.

Domain adaptation

Tibbiyot, huquq, IT yoki call center terminlari umumiy modelda noto‘g‘ri tanilishi mumkin.

Yechimlar:

Rare proper name va acronymlar uchun maxsus data kerak.

O‘zbek tili

O‘zbekcha STTda:

  • lotin va kirill transcript;
  • sheva;
  • code-switching;
  • ruscha va inglizcha termin;
  • apostrof;
  • qo‘shimchalar;
  • audio dataset hajmi

muhim.

Transcript normalization raqam, punctuation va yozuv variantlarini yagona qoidaga keltiradi.

Maxfiylik

Audio biometrik va shaxsiy ma’lumotni saqlashi mumkin.

Cloud STTda:

aniq bo‘ladi.

Sensitive suhbat uchun local yoki on-premise recognition ishlatilishi mumkin.

Transcript normalization

Model “yigirma besh” deb tanigan nutq yakuniy tizimda 25ga aylantirilishi mumkin. Sana, valuta, telefon va acronym uchun inverse text normalization ishlatiladi. Display format va verbatim transcript alohida saqlanishi foydali. Noto‘g‘ri normalization, ayniqsa ID va summa kabi qiymatlarda, recognition xatosidan ham xavfli bo‘lishi mumkin.

Confidence va alternative

Decoder bir segment uchun bir nechta candidate va confidence berishi mumkin. Form fill tizimi past confidence fieldni userga qayta tasdiqlatadi. Confidence barcha model va audio sharoitida bir xil kalibrlangan bo‘lmasligi mumkin.

Subtitle

Subtitle uchun segment uzunligi, reading speed va line break recognitiondan keyin boshqariladi. Transcript to‘g‘ri bo‘lsa ham juda uzun subtitr userga noqulay.

Bog‘liq tushunchalar

Speech-to-Text, Automatic Speech Recognition, Voice Activity Detection, Acoustic model, Language model, CTC, RNN-T, Speaker diarization, Word Error Rate, Transcription