Recurrent Neural Network (RNN) — ketma-ket data’ni oldingi qadamdan kelgan hidden state yordamida qayta ishlaydigan neural network. Text, speech, sensor va time seriesda element tartibi muhim bo‘lgani uchun RNN bir xil transition weightlarini vaqt bo‘yicha qayta qo‘llaydi.
Hidden state yangilanishi
Oddiy RNN’da joriy input x_t va oldingi state h_{t-1} linear transformdan o‘tib, tanh kabi activation bilan h_t hosil qiladi. Output joriy state’dan olinadi. Weight sharing turli uzunlikdagi sequence’ni qabul qilish va vaqt bo‘yicha patternni o‘rganish imkonini beradi.
Initial state odatda nol yoki learned vector. Sequence batchida uzunliklar farq qilsa padding qo‘shiladi, mask esa padding qadamlarining loss va state’ga ta’sirini cheklaydi. Stateful inference’da oldingi chunk state’i keyingi chunkka uzatiladi; bog‘liq bo‘lmagan sessionlar orasida state aralashmasligi zarur.
Training
Backpropagation Through Time recurrent computationni vaqt bo‘yicha ochib, loss gradientini oldingi qadamlar orqali uzatadi. To‘liq sequence juda uzun bo‘lsa xotira qimmat. Truncated BPTT ma’lum qadamdan keyin graphni uzadi; bu hisobni boshqaradi, ammo undan uzoq dependency gradientini bermaydi.
Repeated matrix multiplication vanishing yoki exploding gradientga olib keladi. Gradient clipping katta normni cheklaydi. LSTM va GRU gate’lar orqali ma’lumot oqimini boshqarib, uzoq dependency’ni oddiy RNN’dan yaxshiroq saqlaydi.
Output shakllari
Many-to-one model sequence’dan bitta label, masalan sentiment chiqaradi. One-to-many fixed representationdan ketma-ket output yaratadi. Many-to-many har qadamda label yoki boshqa uzunlikdagi sequence beradi. Sequence labelingda input va output vaqt bo‘yicha mos; encoder-decoderda ular turli uzunlikda bo‘lishi mumkin.
Bidirectional RNN oldinga va orqaga state hisoblab, joriy element uchun ikki tomon kontekstini birlashtiradi. U offline transcriptionda foydali, lekin real-time’da kelajak element hali mavjud emas. Streaming tizim unidirectional yoki cheklangan lookahead ishlatadi.
RNN va boshqa arxitekturalar
RNN computationi vaqt qadamlarida ketma-ket bo‘lgani uchun accelerator parallelizatsiyasi cheklangan. Transformer self-attention bilan tokenlarni parallel qayta ishlaydi va uzoq element orasida qisqa gradient yo‘li yaratadi. Biroq attention xotirasi sequence uzunligiga kvadratik o‘sishi mumkin, RNN esa state hajmini doimiy saqlaydi.
Kichik streaming model, edge qurilma va online time seriesda RNN hali ham qulay. Convolution local temporal patternni parallel topadi; hybrid model CNN feature’larini RNN bilan vaqt bo‘yicha birlashtiradi.
Baholash
Train va inference’da sequence order saqlanishi, mask to‘g‘ri ishlashi va hidden state detach qoidasi test qilinadi. Classification accuracy’dan tashqari uzun sequence kesimi, latency va state memory o‘lchanadi. Time series split kelajak ma’lumotini trainingga sizdirmasligi kerak. Hidden state foydali representation bo‘lsa-da, inson tushunchasidagi xotira yoki ishonchli explanation sifatida talqin qilinmaydi.
Amaliy tekshiruv
Recurrent Neural Network bilan ishlaydigan tajribada sequence mask, initial state va truncation uzunligi model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija qisqa hamda uzun sequence’dagi task metric orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa sessionlar orasida hidden state aralashuvini erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.
Bog‘liq tushunchalar
Hidden state, Backpropagation Through Time, Long Short-Term Memory, Gated Recurrent Unit, Bidirectional RNN, Vanishing gradient, Sequence model