Value — attention mexanizmida query va key mosligi asosida vaznlanib, output representationni hosil qiladigan axborot vektori. Query “qaysi ma’lumot kerak”, key “qaysi element mos”, value esa moslik topilganda uzatiladigan mazmun sifatida izohlanadi. Ularning barchasi inputdan learned linear projection bilan olinadi.
Attention hisobida
Scaled dot-product attention avval query va key ichki ko‘paytmasidan score hisoblaydi. Score sqrt(d_k) ga bo‘linib softmax’dan o‘tadi. Hosil bo‘lgan vaznlar value vektorlarining weighted sumini beradi. Demak key score’ni belgilaydi, value outputga real contribution kiritadi.
Key va value ko‘pincha bir source token representationidan keladi, ammo projection weightlari boshqa. Shu sabab bir element qidiruv uchun bir feature, uzatish uchun boshqa feature ishlatishi mumkin. Cross-attention’da query decoderdan, key va value encoder outputidan olinadi.
O‘lcham va headlar
Multi-head attention har head uchun alohida value projection qiladi. Value dimension odatda model dimensioni headlar soniga bo‘linadi. Har head weighted sum beradi, ular concatenation va output projection orqali birlashtiriladi.
Headlar turli relation o‘rganishi mumkin, lekin ma’lum head doim sintaksis yoki faktga tegishli degan kafolat yo‘q. Head pruning ayrim redundant headlarni olib tashlashi mumkin; quality va latency qayta baholanadi.
Mask va vazn
Padding yoki causal mask score’ga softmaxdan oldin qo‘llanadi. Masklangan positionning attention weighti nolga yaqin bo‘lib, uning value’i outputga kirmaydi. Maskni value’ga keyin qo‘llash normalizationni o‘zgartirib, noto‘g‘ri natija berishi mumkin.
Dropout attention weightlariga qo‘llansa trainingda ayrim value yo‘llari tasodifiy o‘chadi. Evaluation’da dropout o‘chiriladi. Numerical stability uchun softmax score maximumini ayirish va fused kernel ishlatiladi.
KV cache
Autoregressive decoder’da oldingi tokenlarning key va value projectionlari cache qilinadi. Yangi token faqat o‘z query, key va value’sini hisoblaydi; query cached key-value bilan attention qiladi. Bu computationni kamaytiradi, ammo cache context uzunligi, layer va batch bilan o‘sadi.
Grouped-query yoki multi-query attention bir nechta query head uchun key-value headlarni ulashib, cache hajmini kamaytiradi. Sifat va throughput trade-off model bo‘yicha o‘lchanadi. Cache session va requestlar orasida aralashmasligi kerak; u token ma’lumotini saqlagani uchun maxfiy resurs hisoblanadi.
Talqin
Yuqori attention weight muayyan value outputga ko‘proq linear hissa berganini ko‘rsatadi, ammo residual connection, output projection va keyingi nonlinear layerlar yakuniy qarorni o‘zgartiradi. Shu sabab value contribution va attention map to‘liq explanation emas. Ablation, gradient va causal intervention bilan birga tahlil qilinadi.
Amaliy tekshiruv
Value bilan ishlaydigan tajribada value projection shape’i, mask va KV cache model konfiguratsiyasi bilan birga qayd etiladi. Taqqoslash bir xil data split, preprocessing, random seed va hisoblash budjetida bajariladi. Asosiy natija head contribution va output sensitivity orqali ko‘riladi; faqat training loss yoki bitta qulay sample yetarli dalil bermaydi. Kichik synthetic test matematik xulqni, alohida real test esa shovqin, noodatiy uzunlik va domain shiftni tekshiradi. Regression test output shape, numerical finite qiymatlar va boundary holatlarini qamraydi. Monitoring ayniqsa attention weightni yakuniy sabab deb noto‘g‘ri talqin qilishni erta aniqlashga qaratiladi. Model versiyasi, parametrlar va baholash protokoli natija bilan saqlanadi, chunki bir xil nomdagi komponent turli kutubxona yoki checkpointda boshqa convention asosida ishlashi mumkin. Yuqori xavfli qo‘llanishda avtomatik natija human review va aniq fallback bilan cheklanadi.
Bog‘liq tushunchalar
Query, Key, Attention mechanism, Self-attention, Multi-head attention, KV cache, Softmax