STT — inson nutqini audio signaldan yozma matnga aylantiradigan texnologiya. To‘liq nomi Speech-to-Text. STT call center transkripti, subtitle, voice command, meeting note, diktovka, accessibility va voice interface tizimlarida qo‘llanadi.
STT ko‘pincha ASR atamasi bilan bir ma’noda ishlatiladi. Amaliyotda STT mahsulot funksiyasini, ASR esa nutqni avtomatik tanish sohasi va modelini ifodalashi mumkin.
Audio signal
Kirish manbasi:
- mikrofon;
- telefon;
- video;
- meeting recording;
- radio;
- call center audio;
- live stream
bo‘lishi mumkin.
Sample rate, channel, codec va recording sifati recognition natijasiga ta’sir qiladi.
Preprocessing
Audio modelga uzatilishidan oldin:
- resampling;
- channel conversion;
- normalization;
- noise reduction;
- echo cancellation;
- silence trimming;
- voice activity detection
bajarilishi mumkin.
Juda agressiv noise reduction nutq tovushlarini ham yo‘qotishi ehtimoli bor.
Voice Activity Detection
VAD audioda nutq bor yoki yo‘qligini aniqlaydi.
U:
uchun ishlatiladi.
Fon musiqasi yoki shovqin VADni chalg‘itishi mumkin.
Feature extraction
Klassik tizim audio waveformdan acoustic feature oladi.
Misollar:
- spectrogram;
- mel-spectrogram;
- MFCC;
- filter bank energy.
Zamonaviy end-to-end model raw audio yoki learned feature bilan ishlashi mumkin.
Acoustic model
Acoustic model audio frame va phoneme, character yoki tokenlar orasidagi bog‘lanishni o‘rganadi.
U talaffuz, speaker va shovqin variationlarini model qiladi.
Training uchun audio va aniq transcript juftliklari kerak.
Language model
Language model acoustic jihatdan o‘xshash variantlardan grammatik va kontekstga mosini tanlashga yordam beradi.
Masalan, talaffuzi o‘xshash ikki so‘z gap kontekstida farqlanadi.
Domain vocabulary va custom phrase list recognitionni yaxshilashi mumkin.
Decoder
Decoder acoustic score, language score va boshqa constraintlarni birlashtirib yakuniy token ketma-ketligini topadi.
Usullar:
Beam kengligi sifat va hisoblash xarajatiga ta’sir qiladi.
CTC
Connectionist Temporal Classification audio frame va text token orasidagi aniq alignment bo‘lmaganda trainingga yordam beradi.
Model blank va token probabilitylarini chiqaradi.
Decoder takroriy token hamda blanklarni qoidaga ko‘ra collapse qiladi.
Transducer
RNN-T yoki boshqa transducer architecture streaming speech recognitionda keng ishlatiladi.
Model acoustic encoder, prediction network va joint networkdan tashkil topishi mumkin.
U audio kelishi bilan bosqichma-bosqich token chiqaradi.
Sequence-to-sequence
Encoder audio representation yaratadi, decoder attention orqali text tokenlarni generatsiya qiladi.
Bu punctuation, context va multilingual vazifalarda kuchli bo‘lishi mumkin.
Uzoq audio uchun memory, latency va hallucinationga o‘xshash xatolar nazorat qilinadi.
Streaming STT
Live audioda partial transcript doimiy yangilanadi.
Masalan:
Men bugun...
Men bugun Toshkentga...
Men bugun Toshkentga boraman.
Oldingi partial text keyingi context bilan o‘zgarishi mumkin.
Final segment endpoint aniqlanganda tasdiqlanadi.
Endpointing
Speaker gapni tugatganini aniqlash endpointing deb ataladi.
Faqat jimlik uzunligiga tayanish sekin gapiruvchi userni erta kesishi mumkin.
signalidan foydalanishi mumkin.
Punctuation
Audio ichida vergul yoki nuqta bevosita aytilmaydi.
Model gap structure va pauza asosida punctuation qo‘shadi.
Punctuation va capitalization alohida post-processing model bilan bajarilishi ham mumkin.
Speaker diarization
Bir recordingdagi speakerlarni ajratish:
Speaker 1
Speaker 2
deb belgilash.
Diarization kim gapirganini aniqlaydi, ammo har doim shaxs identity’sini bilmaydi.
Speaker overlap aniqlikni pasaytiradi.
Timestamp
STT word yoki segment uchun boshlanish va tugash vaqtini berishi mumkin.
Bu:
- subtitle;
- audio qidiruv;
- editor;
- compliance review
uchun ishlatiladi.
Timestamp alignment model va decodingga bog‘liq aniqlikka ega.
Word Error Rate
STT sifati Word Error Rate bilan o‘lchanadi.
U:
- substitution;
- deletion;
- insertion
xatolarini reference so‘zlar soniga nisbatan hisoblaydi.
Past WER yaxshi, lekin ism, raqam va critical commanddagi xato alohida baholanadi.
Domain adaptation
Tibbiyot, huquq, IT yoki call center terminlari umumiy modelda noto‘g‘ri tanilishi mumkin.
Yechimlar:
- vocabulary;
- phrase boosting;
- fine-tuning;
- domain language model;
- pronunciation dictionary.
Rare proper name va acronymlar uchun maxsus data kerak.
O‘zbek tili
O‘zbekcha STTda:
- lotin va kirill transcript;
- sheva;
- code-switching;
- ruscha va inglizcha termin;
- apostrof;
- qo‘shimchalar;
- audio dataset hajmi
muhim.
Transcript normalization raqam, punctuation va yozuv variantlarini yagona qoidaga keltiradi.
Maxfiylik
Audio biometrik va shaxsiy ma’lumotni saqlashi mumkin.
Cloud STTda:
aniq bo‘ladi.
Sensitive suhbat uchun local yoki on-premise recognition ishlatilishi mumkin.
Transcript normalization
Model “yigirma besh” deb tanigan nutq yakuniy tizimda 25ga aylantirilishi mumkin. Sana, valuta, telefon va acronym uchun inverse text normalization ishlatiladi. Display format va verbatim transcript alohida saqlanishi foydali. Noto‘g‘ri normalization, ayniqsa ID va summa kabi qiymatlarda, recognition xatosidan ham xavfli bo‘lishi mumkin.
Confidence va alternative
Decoder bir segment uchun bir nechta candidate va confidence berishi mumkin. Form fill tizimi past confidence fieldni userga qayta tasdiqlatadi. Confidence barcha model va audio sharoitida bir xil kalibrlangan bo‘lmasligi mumkin.
Subtitle
Subtitle uchun segment uzunligi, reading speed va line break recognitiondan keyin boshqariladi. Transcript to‘g‘ri bo‘lsa ham juda uzun subtitr userga noqulay.
Bog‘liq tushunchalar
Speech-to-Text, Automatic Speech Recognition, Voice Activity Detection, Acoustic model, Language model, CTC, RNN-T, Speaker diarization, Word Error Rate, Transcription