Bosh sahifa Wiki Transformer architecture

Transformer architecture

Transformer architecturesequence elementlari orasidagi bog‘lanishni attention orqali modellashtiradigan neural network arxitekturasi. Recurrent state o‘rniga tokenlar parallel qayta ishlanadi, tartib esa positional encoding bilan beriladi. Asl tuzilma encoder va decoder stacklaridan iborat.

Input representation

Tokenlar embedding vectorga aylantiriladi va positional signal qo‘shiladi. Har layer multi-head attention, feed-forward network, residual connection va normalizationdan tuziladi. Residual yo‘l gradient oqimini, normalization training barqarorligini yaxshilaydi.

Multi-head attention query, key va value projectionlarini bir nechta headga bo‘ladi. Har head turli bog‘lanish patternini o‘rganishi mumkin. Head natijalari concatenation qilinib output projectiondan o‘tadi. Bu interpretatsiya imkoniyat, kafolatlangan semantik bo‘linish emas.

Encoder

Encoder self-attention har input tokeniga barcha ruxsat etilgan input tokenlarni ko‘rish imkonini beradi. Padding mask sun’iy tokenlarni chiqaradi. Har pozitsiya bir xil position-wise feed-forward networkdan o‘tadi. Stack chuqurlashgani sari representation context bilan boyiydi.

BERT turidagi model faqat encoder ishlatib, understanding va representation vazifalariga moslashadi. Vision Transformer image patchlarini token deb oladi. Speech encoder spectrogram frame’larini subsamplingdan so‘ng qayta ishlaydi.

Decoder

Decoder masked self-attention bilan kelajak target tokenlarini ko‘rmaydi. Encoder-decoder attention target query’larini source representationga bog‘laydi. Training’da teacher forcing butun targetni parallel qayta ishlaydi, causal mask leakage’ni to‘xtatadi. Inference’da tokenlar autoregressive yaratiladi va key-value cache oldingi hisobni qayta ishlatadi.

Decoder-only language model barcha oldingi tokenlarga causal self-attention qiladi. Encoder-decoder translation va summarization kabi source-target vazifada source’ni alohida kodlaydi.

Hisoblash xususiyati

Oddiy self-attention score matrixi sequence uzunligiga kvadratik xotira va compute talab qiladi. Uzun document uchun sparse, local, linear yoki chunked attention variantlari mavjud. Feed-forward layer ko‘pincha parameter va compute’ning katta qismini egallaydi.

Training tokenlar bo‘yicha parallel, ammo autoregressive inference ketma-ket. KV cache latency’ni kamaytiradi, lekin context uzunligi bilan xotira oshadi. Quantization, pruning va distillation deploymentni yengillashtiradi.

Training va cheklovlar

Large-scale pretraining next-token, masked-token yoki sequence objective bilan bajariladi. Fine-tuning task data’ga moslaydi. Attention weight modelning qarorini to‘liq tushuntirmaydi; residual va feed-forward yo‘llar ham katta rol o‘ynaydi.

Model training data bias’i, memorization va hallucinationni meros qiladi. Positional limitdan tashqarida sifat tushishi mumkin. Baholash accuracy bilan birga context uzunligi, latency, calibration, subgroup va privacy leakage’ni qamraydi. Causal mask va padding mask unit testlari data leakage’ni oldini oladi.

Amaliy tekshiruv

Transformer architecture bilan ishlaydigan tajribada masklar, normalization tartibi va position ids model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija context uzunligi bo‘yicha loss, latency va memory orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa causal mask xatosi hamda KV cache aralashuvini erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.

Bog‘liq tushunchalar

Self-attention, Attention mechanism, Encoder, Decoder, Positional encoding, Feed-forward network, Multi-head attention