Bosh sahifa Wiki Encoder

Encoder

Encoder — inputni downstream vazifa uchun latent yoki contextual representationga aylantiradigan model komponenti. Transformer’da encoder token embedding va positional signalni bir necha self-attention hamda feed-forward layerlar orqali qayta ishlaydi. Natijada har token representationi inputning boshqa qismlari bilan boyitiladi.

Transformer encoder layeri

Multi-head self-attention query, key va value’ni encoderning joriy activationsidan oladi. Padding mask sun’iy tokenlarni chiqaradi. Attention output residual connection bilan inputga qo‘shiladi va normalizationdan o‘tadi. Keyin har positionga bir xil feed-forward network qo‘llanib, yana residual hamda normalization ishlatiladi.

Pre-norm arxitekturada normalization sublayerdan oldin, post-normda keyin keladi. Pre-norm chuqur network trainingini osonlashtirishi mumkin. Ikki variant checkpoint bilan aynan mos bo‘lishi kerak.

Representation shakllari

Sequence labeling har token outputidan foydalanadi. Classification maxsus token, mean pooling yoki attention pooling orqali bitta vector oladi. Padding mean hisobiga kirmaydi. Sentence embedding semantic similarity uchun contrastive objective bilan alohida o‘qitilishi mumkin.

Encoder outputi decoder cross-attention uchun memory vazifasini bajaradi. Key va value encoderdan, query decoder state’idan keladi. Source mask decoderning paddingga qarashini to‘xtatadi.

Boshqa encoderlar

CNN encoder image’ni feature mapga, RNN encoder sequence’ni hidden statesga aylantiradi. Autoencoder inputni bottleneck code’ga siqadi. Vision Transformer patch encoder, speech encoder esa spectrogram frame’larini contextual representationga aylantiradi. “Encoder” atamasi outputning aynan qanday semantikaga ega ekanini emas, arxitekturadagi rolini bildiradi.

Training objective

Masked language modeling ayrim tokenlarni yashirib, context’dan tiklashni o‘rgatadi. Contrastive learning mos sample’larni yaqin, nomoslarni uzoq joylashtiradi. Supervised encoder class loss bilan taskga moslashadi. Objective representationda qaysi axborot saqlanishini belgilaydi.

Fine-tuning barcha weightlarni yangilashi, encoder’ni freeze qilib faqat headni o‘qitishi yoki parameter-efficient adapter qo‘shishi mumkin. Freeze compute’ni kamaytiradi, ammo domain shiftga moslashishni cheklaydi.

Mask va leakage

Bidirectional encoder har token uchun ikki tomon contextni ko‘radi. Bu document understanding uchun foydali, lekin autoregressive generation targetining kelajak tokenlari inputga kirsa leakage yuz beradi. Time-series’da prediction vaqtida mavjud bo‘lmagan kelajak observation encoderga berilmaydi.

Baholash va deployment

Encoder task metric, embedding retrieval, calibration, latency va memory bilan baholanadi. Linear probe representation sifatini taxmin qiladi, ammo fine-tuned natijani to‘liq bashorat qilmaydi. Quantization va distillation edge deploymentga yordam beradi. Cached embedding model versioni bilan bog‘lanadi; encoder yangilanganda eski va yangi vector space aralashmaydi. Representation sensitive ma’lumotni saqlashi mumkin, shuning uchun access va retention raw input kabi baholanadi.

Amaliy tekshiruv

Encoder bilan ishlaydigan tajribada padding mask, pooling va embedding versioni model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija downstream task, retrieval va calibration orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa kelajak ma’lumoti leakage’i yoki eski embeddinglarni aralashtirishni erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.

Bog‘liq tushunchalar

Transformer architecture, Decoder, Self-attention, Feed-forward network, Contextual embedding, Autoencoder, Cross-attention