Long Short-Term Memory (LSTM) — recurrent neural network turi bo‘lib, cell state va gate’lar orqali uzoq sequence dependency’larini saqlashga mo‘ljallangan. Oddiy RNN’dagi vanishing gradient muammosini kamaytirish uchun state bo‘ylab additive axborot yo‘lini yaratadi.
Cell va hidden state
LSTM har qadamda ikkita holat olib yuradi. Cell state c_t uzoqroq xotira yo‘li, hidden state h_t esa joriy output representationidir. Joriy input va oldingi hidden state’dan forget, input va output gate qiymatlari hisoblanadi. Gate’lar sigmoid orqali nol bilan bir oralig‘ida bo‘ladi.
Candidate cell content tanh bilan yaratiladi. Yangi cell state eski state’ning forget gate bilan qolgan qismi va candidate’ning input gate bilan tanlangan qismi yig‘indisidir. Hidden state cell’ning tanh qiymatini output gate bilan filtrlash orqali olinadi.
Gate’larning ma’nosi
Forget gate eski ma’lumotning qanchasi saqlanishini belgilaydi. Input gate yangi candidate qanchalik yozilishini boshqaradi. Output gate cell state’ning qaysi qismi tashqi hidden state’da ko‘rinishini tanlaydi. Bu nomlar tushuntirish uchun qulay, ammo trained neuronning aniq semantik vazifasini kafolatlamaydi.
Forget gate bias’ini musbat boshlash dastlab xotirani saqlashga moyillik beradi. Gate saturatsiyasi gradientni kichraytirishi mumkin. Layer normalization va ehtiyot initialization trainingni barqarorlashtiradi.
Arxitektura variantlari
Stacked LSTM bir nechta recurrent layerni ustma-ust qo‘yadi. Dropout layerlar orasida regularization beradi; recurrent dropout vaqt bo‘yicha mask siyosatiga sezgir. Peephole connection gate’ga cell state’ni ham ko‘rsatadi. Projection LSTM hidden outputni kichik dimensionga tushirib parametr va inference xarajatini kamaytiradi.
Bidirectional LSTM ikki yo‘nalish kontekstini oladi, lekin causal streamingga mos emas. Encoder-decoder LSTM source sequence’ni representationga aylantirib target sequence yaratadi. Attention bitta final state bottleneckini kamaytiradi.
Training va qo‘llanish
LSTM Backpropagation Through Time bilan o‘qitiladi. Gradient clipping exploding gradientni cheklaydi. Padding mask va sequence length state yangilanishini to‘g‘ri boshqaradi. Stateful streamda h va c ikkisi ham session bo‘yicha saqlanadi va mustaqil oqimlar orasida aralashmaydi.
LSTM speech recognition, language modeling, time-series, handwriting va anomaly detectionda ishlatilgan. Transformer ko‘p NLP vazifalarida parallel training va global attention sabab ustun bo‘lsa-da, kichik streaming yoki fixed-memory systemlarda LSTM samarali bo‘lishi mumkin.
Cheklovlar
Vaqt qadamlarini ketma-ket hisoblash parallelizmni cheklaydi. Gate’lar oddiy RNN’dan ko‘proq parameter va compute talab qiladi. Juda uzun tarix amalda to‘liq saqlanmasligi mumkin. Baholash sequence uzunligi, latency va state reset holatlari bo‘yicha o‘tkaziladi. LSTM state’i “inson xotirasi” emas va uning ichki qiymatini fakt yoki ishonch sifatida talqin qilish noto‘g‘ri.
Amaliy tekshiruv
Long Short-Term Memory bilan ishlaydigan tajribada hidden-cell state, gate ordering va forget bias model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija sequence uzunligi bo‘yicha task metric va latency orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa state reset xatosi yoki gate saturatsiyasini erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.
Bog‘liq tushunchalar
Cell state, Forget gate, Input gate, Output gate, Recurrent Neural Network, Bidirectional LSTM, Gated Recurrent Unit