Conditional GAN (cGAN) — generator va discriminatorga qo‘shimcha condition berib, yaratiladigan sample xususiyatini boshqaradigan Generative Adversarial Network turi. Condition class label, text, source image, segmentation map, audio feature yoki boshqa modality bo‘lishi mumkin. Oddiy GAN p(x) distributionini, cGAN esa p(x | c) shartli distributionini o‘rganadi.
Conditionni kiritish
Generator latent vector z bilan condition representation c ni birlashtiradi. Class label embeddingga aylantirilib z ga concatenation qilinishi yoki layer activationsga scale va bias sifatida berilishi mumkin. Conditional batch normalization har class uchun normalization parametrlarini modulyatsiya qiladi. Text condition encoder embeddingi cross-attention orqali generatorga ulanadi.
Discriminator sample’ning faqat realistikligini emas, conditionga mosligini ham tekshirishi kerak. Label embedding image feature bilan concatenation qilinadi yoki projection discriminator feature va condition embedding ichki ko‘paytmasini score’ga qo‘shadi. Agar discriminator conditionni ko‘rmasa generator uni e’tiborsiz qoldirib, realistik ammo noto‘g‘ri classdagi output yaratishi mumkin.
Image-to-image vazifalari
Pix2pix kabi paired image translation’da source image condition, target image esa real sample hisoblanadi. Adversarial loss outputning realistik texture’ini, L1 yoki L2 reconstruction loss esa source bilan spatial mosligini saqlaydi. PatchGAN discriminator local patch realnessini baholaydi. Misollar orasida edge’dan photo, map’dan aerial image va segmentation’dan scene yaratish bor.
Paired data bo‘lmasa cycle-consistency kabi constraint ikki domain o‘rtasida mapping o‘rganadi. Bunday model semantic elementni o‘zgartirib yuborishi mumkin; cycle reconstruction mukammal bo‘lsa ham mapping haqiqiy causal transform ekanini kafolatlamaydi.
Class va text shartlash
Class-conditional generation har label uchun sample yaratadi. Auxiliary Classifier GAN discriminatorga class prediction head qo‘shadi. Bu class separabilityni oshiradi, ammo classifier bias’i generatorga o‘tadi. Imbalanced datasetda kam classlar mode collapse yoki past sifatga moyil; balanced sampling va per-class metrika kerak.
Text-conditioned GAN natural language promptni embeddingga aylantiradi. Matching-aware discriminator real image bilan noto‘g‘ri caption juftligini ham fake sifatida ko‘rishi mumkin. Bu semantic alignmentni o‘rgatadi. Murakkab promptdagi spatial relation va counting alohida muammo bo‘lib qoladi.
Training va baholash
Adversarial lossga reconstruction, perceptual, class yoki contrastive loss qo‘shiladi. Ularning vazni outputning fidelity va diversity muvozanatini belgilaydi. Condition dropout classifier-free uslubdagi guidance variantlariga imkon berishi mumkin. Condition juda kuchli bo‘lsa latent z e’tiborsiz qolib, bitta condition uchun diversity kamayadi.
FID umumiy sifatni, conditional accuracy condition mosligini, precision-recall diversityni baholaydi. Metrikalar har class yoki condition guruhida ham hisoblanadi. Human evaluation prompt adherence va visual plausibilityni alohida so‘raydi. Source-target task’da PSNR yoki perceptual similarity ishlatilishi mumkin, lekin bir nechta to‘g‘ri target mavjud bo‘lsa pixel metrika generatorni blurga undaydi.
Xavfsizlik
Condition boshqaruvi foydali dizayn, data augmentation va simulation beradi, shu bilan birga aniq shaxs, logo yoki zararli scene’ni yaratishni osonlashtiradi. Training data litsenziyasi, identity roziligi, subgroup bias va memorization tekshiriladi. Output provenance va moderation condition hamda generated sample’ni birga ko‘radi; class labelning o‘zi xavfsiz natijani kafolatlamaydi.
Condition metadata noto‘g‘ri bo‘lsa model qarama-qarshi signal oladi. Dataset audit label aniqligi, class balance va source-target mosligini trainingdan oldin tekshiradi.
Bog‘liq tushunchalar
Generative Adversarial Network, Generator, Discriminator, Conditioning, Pix2pix, Projection discriminator, Image-to-image translation