Convolutional Neural Network (CNN) — grid tuzilishidagi data, ayniqsa image va time-frequency signalda local patternlarni o‘rganish uchun convolution operatoridan foydalanadigan neural network turi. CNN weight sharing va local receptive field orqali fully connected layerga qaraganda kamroq parametr bilan translationga nisbatan barqaror feature chiqaradi.
Convolution amali
Kernel deb ataluvchi kichik weight matritsa input ustida siljib, har joyda weighted sum hisoblaydi. Image’da kernel height, width va input channelni qamraydi; bir nechta kernel turli output channel hosil qiladi. Training gradient descent orqali edge, texture va keyinchalik murakkab shape’ga javob beruvchi weightlarni o‘rganadi.
Stride kernelning har qadamdagi siljishini belgilaydi. Katta stride spatial resolutionni kamaytiradi. Padding input chegarasiga qiymat qo‘shib output o‘lchamini boshqaradi. Dilation kernel elementlari orasini kengaytirib parametr sonini oshirmasdan receptive fieldni kattalashtiradi.
Feature hierarchy
Erta layerlar local edge va rang kontrastini, chuqur layerlar ularning kombinatsiyasidan object part va semantik feature’ni o‘rganishi mumkin. ReLU kabi nonlinear activation bir nechta convolutionni oddiy linear transformga aylanib qolishdan saqlaydi. Pooling local hududni max yoki average bilan qisqartiradi; strided convolution ham downsampling qiladi.
Batch normalization activation statistikalarini normallashtirib trainingni yengillashtiradi. Residual connection layer outputiga inputni qo‘shib, juda chuqur networkda gradient oqimini yaxshilaydi. Dropout ayrim activationlarni vaqtincha o‘chirib regularization beradi, lekin convolution blocklarda uning foydasi arxitekturaga bog‘liq.
Bir va ikki o‘lchamli CNN
1D convolution audio waveform, sensor va token sequence bo‘ylab ishlaydi. Speech processingda temporal kernel phonetic transitionni topadi. 2D CNN image yoki spectrogramdagi vaqt-frequency patternni ko‘radi. 3D convolution video’da vaqt, height va width bo‘yicha local cube’ni tahlil qiladi.
Depthwise separable convolution har channelga alohida spatial filter, so‘ng 1×1 pointwise convolution qo‘llaydi. Bu MobileNet kabi arxitekturalarda hisoblashni kamaytiradi. Grouped convolution channel’larni guruhlarga bo‘ladi. Transposed convolution learnable upsampling uchun generator va segmentation decoderida ishlatiladi.
Asosiy vazifalar
Image classification butun rasm labelini, object detection bounding box va classni, semantic segmentation har pixel classini topadi. CNN face recognition, medical imaging, OCR, remote sensing va industrial inspectionda ishlatiladi. Audio’da keyword spotting, acoustic event classification va vocoder discriminatoriga xizmat qiladi.
Generative modelda CNN generator texture va spatial structure yaratadi. DCGAN convolutional generator-discriminator ishlatadi. U-Net encoder feature’larini decoderga skip connection bilan uzatib, segmentation va diffusion denoisingda local detailni saqlaydi.
Cheklovlar va baholash
Translation equivariance padding, stride va pooling sabab mutlaq emas. CNN rotation yoki scale’ga avtomatik invariant bo‘lmaydi; data augmentation yoki maxsus group-equivariant design kerak. Receptive field nazariy jihatdan katta bo‘lsa ham, amaliy effective field markazga ko‘proq og‘ishi mumkin. Global bog‘lanish uchun attention yoki katta kernel qo‘shiladi.
Accuracy bilan birga subgroup performance, calibration, latency, memory va energy o‘lchanadi. Datasetdagi background correlation modelni object o‘rniga kontekstga tayantirishi mumkin. Saliency map tushuntirish beradi, ammo u causal proof emas. Medical yoki safety-critical CNN outputi domain shift, adversarial perturbation va sensor o‘zgarishiga test qilinadi; human oversight saqlanadi.
Bog‘liq tushunchalar
Convolution, Kernel, Receptive field, Pooling, Residual network, DCGAN, U-Net