Mode collapse — Generative Adversarial Network trainingida generator real data distributionidagi xilma-xil mode’larni qamramay, ko‘plab latent inputlar uchun bir xil yoki juda o‘xshash oz sonli output yaratib qoladigan nosozlik. Sample’lar alohida ko‘rilganda realistik bo‘lishi mumkin, ammo distribution diversitysi past bo‘ladi.
Mode tushunchasi
Probability distributiondagi mode yuqori ehtimollik to‘plangan hududdir. Masalan, turli raqamlar rasmlaridan iborat datasetda har bir digit category alohida mode sifatida qaralishi mumkin. Face datasetda pose, identity, lighting va expression kombinatsiyalari ko‘plab mode hosil qiladi. Generator faqat ayrim pose yoki rangni chiqarsa distributionni to‘liq o‘rganmagan bo‘ladi.
Complete mode collapse deyarli barcha z vectorlarni bitta outputga map qiladi. Partial collapse bir necha turdagi sample saqlaydi, lekin long-tail holatlarni tashlab ketadi. Cycling collapse’da generator vaqt o‘tishi bilan bir mode’dan boshqasiga o‘tadi; snapshotlar turli ko‘rinsa ham bir paytda diversity yetarli emas.
Yuzaga kelish sabablari
Generator discriminatorni aldashning oson yo‘lini topib, muvaffaqiyatli sample atrofida probability massni jamlaydi. Discriminator bu patternni o‘rganganida generator boshqa mode’ga sakrashi mumkin. Adversarial objective non-stationary bo‘lgani uchun ikki network bir-birining o‘zgaruvchan response’iga moslashadi.
Juda kuchli yoki juda zaif discriminator, learning rate nomutanosibligi, cheklangan batch, yomon normalization va insufficient capacity muammoni kuchaytiradi. Real distribution mode’lari o‘ta nomutanosib bo‘lsa kam uchraydigan guruhlar gradientga kam hissa qo‘shadi. Bu har bir bir xil outputni mode collapse deb atash kerak degani emas; ba’zan condition yoki datasetning o‘zi tor bo‘ladi.
Aniqlash
Faqat eng chiroyli sample’larni ko‘rish diversity muammosini yashiradi. Bir xil seed emas, ko‘p random latent bilan grid yoki audio to‘plam tekshiriladi. Pairwise feature distance, perceptual similarity va unique pattern soni collapse signalini beradi. Classifier bilan generated class distributioni real distributionga solishtiriladi.
Precision sifat va real distributionga yaqinlikni, recall esa mode qamrovini taxmin qiladi. Yuqori precision va past recall partial collapsega mos kelishi mumkin. FID umumiy distribution farqini ko‘rsatadi, ammo qaysi mode yo‘qolganini aniq aytmaydi. Nearest-neighbor tahlili collapse bilan training sample memorizationini ajratishga yordam beradi.
Kamaytirish usullari
Minibatch discrimination discriminatorga bitta sample emas, batch ichidagi o‘xshashlikni ko‘rish imkonini beradi. Feature matching generatorni discriminator feature statistikalariga moslashtiradi. Unrolled GAN generator updateida discriminatorning kelajak javobini taxmin qiladi. Wasserstein loss va gradient penalty barqarorroq gradient yaratishi mumkin.
Spectral normalization, balanced learning rate va update ratio trainingni tartibga soladi. Conditional label generatorni mode’lar bo‘yicha taqsimlaydi, ammo har label ichida collapse qolishi mumkin. Data augmentation discriminator overfittingini kamaytiradi. Multiple generator yoki mixture model mode’larni bo‘lishadi, lekin complexity oshadi.
Amaliy ta’sir
Synthetic data augmentationda collapse kam uchraydigan holatlarni yanada kamaytirib, downstream model bias’ini kuchaytiradi. Creative generationda foydalanuvchi promptlari bir xil kompozitsiyaga olib keladi. Tibbiy yoki xavfsizlik data’sida diversityni vizual sifat bilan almashtirib bo‘lmaydi. Hisobot FID bilan birga coverage, subgroup distribution va seed bo‘yicha natijalarni ko‘rsatadi; generator outputi real populationning xolis modeli deb taxmin qilinmaydi.
Collapse tekshiruvi training davomida bir xil latent bank va yangi random sample’larni birga ko‘rib, vaqt bo‘yicha diversity o‘zgarishini ajratadi.
Bog‘liq tushunchalar
Generative Adversarial Network, Generator, Discriminator, Data distribution, Diversity, Wasserstein GAN, Minibatch discrimination