Bosh sahifa Wiki Positional encoding

Positional encoding

Positional encodingTransformer tokenlarning sequence ichidagi tartibi va masofasini bilishi uchun embeddingga qo‘shiladigan yoki attentionga kiritiladigan pozitsiya signali. Self-attention o‘zi tokenlar permutatsiyasiga nisbatan bir xil amal qilgani sabab positional axborotsiz “birinchi”, “keyingi” va “oldingi” tushunchalarini ajrata olmaydi.

Sinusoidal encoding

Asl Transformer turli frequency’dagi sine va cosine funksiyalaridan fixed vector yaratadi. Har dimension positionga qarab boshqa davr bilan o‘zgaradi. Signal parameter talab qilmaydi va training’da ko‘rilgan uzunlikdan tashqariga formula orqali hisoblanishi mumkin.

Sinusoidal vektor token embeddingga elementwise qo‘shiladi. Model ikki pozitsiya orasidagi relative siljishni trigonometrik bog‘lanishlar orqali o‘rganishi mumkin. Biroq uzunroq contextga formula mavjudligi sifat avtomatik saqlanadi degani emas; attention va training distributioni ham cheklaydi.

Learned position embedding

Learned variant har position uchun trainable vector saqlaydi. U taskga mos signal o‘rganadi, ammo table maksimal uzunlik bilan cheklangan. Undan uzun input truncate qilinadi, yangi vector initialize qilinadi yoki interpolation ishlatiladi. Interpolation positional geometriyani o‘zgartirishi mumkin, shuning uchun model qayta baholanadi.

Padding positionlari mask bilan chiqariladi. Batchdagi sentence qayerdan boshlanishiga qarab position index to‘g‘ri reset qilinadi. Packed sequence ishlatilsa alohida hujjatlar bitta position oqimida aralashmasligi kerak.

Relative position

Relative encoding absolute indeksdan ko‘ra query va key orasidagi masofani score’ga qo‘shadi. Bu local relation va turli sequence uzunligiga moslashishga yordam beradi. Learned relative bias masofalarni bucketlarga ajratishi mumkin; uzoq masofalar bir xil bucketga tushadi.

Rotary Position Embedding query va key juft dimensionlarini positionga bog‘liq buradi. Dot product relative burchak farqini aks ettiradi. ALiBi attention score’ga masofaga proportional head-specific penalty qo‘shadi. Har usul extrapolation, compute va implementation trade-offiga ega.

Modalitetlar

Vision Transformer 2D patch positionini bilishi kerak. Row-column embedding alohida yoki flattened indeks orqali beriladi. Image resolution o‘zgarsa positional grid interpolation qilinadi. Speech va video’da vaqt bilan birga frequency yoki spatial position ham mavjud; factorized encoding xarajatni kamaytiradi.

Decoder’da causal token position KV cache bilan izchil davom etadi. Cache’dan keyin yangi token indeksini nolga reset qilish outputni buzadi. Batchdagi turli prompt uzunliklari uchun position ids mask asosida hisoblanadi.

Baholash

Model faqat training maksimal uzunligida emas, qisqa va uzoq contextda sinovdan o‘tadi. “Needle” testi signalni uzoq masofadan topishni, order-sensitive task esa tartibni tushunishni o‘lchaydi. Positional encoding o‘zgarganda checkpoint compatibility tekshiriladi. Attention map position bias’ni ko‘rsatishi mumkin, ammo yakuniy prediction explanationi emas.

Amaliy tekshiruv

Positional encoding bilan ishlaydigan tajribada position id, padding reset va maksimal context model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija trainingdan uzun sequence’dagi order-sensitive metric orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa cache davomida position indeksining qayta boshlanishini erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.

Bog‘liq tushunchalar

Transformer architecture, Self-attention, Token embedding, Relative position, Rotary Position Embedding, ALiBi, Sequence length