Feed-forward network — axborot inputdan outputga cycle’siz yo‘nalishda o‘tadigan neural network. Transformer layerida bu atama odatda har token pozitsiyasiga mustaqil va bir xil weightlar bilan qo‘llanadigan ikki linear transform hamda nonlinear activationdan iborat position-wise modulni anglatadi.
Transformer FFN
Model dimensionidagi vector avval kattaroq hidden dimensionga project qilinadi, activationdan o‘tadi va yana model dimensioniga qaytariladi. Keng hidden layer token ichidagi feature’larni nonlinear aralashtiradi. Self-attention tokenlar orasida axborot ko‘chirsa, FFN har tokenning representationini lokal ravishda qayta shakllantiradi.
Activation ReLU, GELU, SiLU yoki gated variant bo‘lishi mumkin. GELU kichik negative qiymatlarni yumshoq saqlaydi. SwiGLU singari gated FFN ikki projectiondan birini gate sifatida ishlatadi va parameter taqsimotini o‘zgartiradi.
Dimension va parametr
Asl Transformer’da hidden dimension model dimensionidan to‘rt baravar katta bo‘lgan. Bu qat’iy qoida emas. FFN weightlari katta modellarda parameter va FLOP’larning katta qismini tashkil qiladi. Hidden width oshishi capacity beradi, lekin memory va latency’ni ko‘paytiradi.
Har position uchun bir xil weight ishlatilgani convolution’ning 1×1 qatlamiga o‘xshaydi. Tokenlar o‘rtasida to‘g‘ridan-to‘g‘ri aloqa yo‘q; context allaqachon attention outputida mavjud.
Residual va normalization
FFN outputi residual connection orqali sublayer inputiga qo‘shiladi. Shape model dimensioniga qaytishi shuning uchun zarur. Dropout output yoki hidden activationga qo‘llanishi mumkin. Pre-norm Transformer’da input avval normallanadi, post-normda residual yig‘indidan keyin.
Residual yo‘l gradient oqimini yaxshilaydi. Juda katta activation numerical overflowga olib kelishi mumkin; initialization, normalization va mixed-precision loss scaling muhim. Activation checkpointing memory evaziga forward hisobning bir qismini backward’da qayta bajaradi.
Mixture of Experts
MoE FFN bir nechta expert network va routerdan iborat. Har token faqat tanlangan oz expertga yuboriladi, shu bilan parameter soni oshsa ham har token compute’i cheklanadi. Load balancing loss barcha tokenning bir expertga yig‘ilib qolishini kamaytiradi.
Distributed MoE network communication, capacity limit va dropped token muammosini keltiradi. Router decisioni semantic explanation emas va subgroup bias’ga tekshiriladi.
Oddiy feed-forward model
Klassik multilayer perceptron fixed-size feature vectorni qayta ishlaydi. Unda recurrent state yo‘q. Classification head, tabular model va function approximationda ishlatiladi. Universal approximation nazariyasi yetarli width bilan ko‘p funksiyani yaqinlashtirish mumkinligini aytadi, ammo training samaradorligi yoki generalizationni kafolatlamaydi.
Baholash va optimallashtirish
FFN variantlari parameter soni, FLOP, throughput, validation loss va downstream metric bilan solishtiriladi. Quantization linear weight memorysini kamaytiradi; activation outlierlari aniqlikka ta’sir qilishi mumkin. Pruning kam muhim neuron yoki weightlarni olib tashlaydi, so‘ng sifat qayta tekshiriladi. Fused linear-activation kernel memory trafficni kamaytiradi.
Amaliy tekshiruv
Feed-forward network bilan ishlaydigan tajribada hidden width, activation va residual shape model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija throughput, validation loss va quantization aniqligi orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa activation outlier yoki MoE router imbalanceni erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.
Bog‘liq tushunchalar
Transformer architecture, Multilayer perceptron, Activation function, Residual connection, Layer normalization, Mixture of Experts, GELU