Ответ
Преимущества CNN:
- Автоматическое извлечение пространственных признаков: Свёртки самостоятельно учатся обнаруживать иерархические паттерны (края → текстуры → объекты), избавляя от ручного feature engineering для изображений.
- Параметр-эффективность за счёт разделения весов (weight sharing): Один и тот же фильтр применяется ко всей карте признаков, что резко сокращает количество обучаемых параметров по сравнению с полносвязными слоями.
- Инвариантность к небольшим трансформациям: Комбинация свёрток и пулинга обеспечивает устойчивость к малым сдвигам, поворотам и искажениям.
- Оптимизированы для hardware: Операции свёртки эффективно параллелятся на GPU/TPU.
Недостатки CNN:
- Требуют больших размеченных датасетов для обучения с нуля, иначе склонны к переобучению. Часто используют transfer learning.
- Плохая интерпретируемость: Являются "чёрным ящиком", хотя методы вроде Grad-CAM помогают визуализировать важные области.
- Жёсткая индуктивная bias для пространственных данных: Менее эффективны для не имеющих spatial-структуры данных (например, табличных), где полносвязные сети или трансформеры могут быть лучше.
- Потеря позиционной информации при агрессивном пулинге.
Пример архитектуры на PyTorch для классификации изображений:
import torch.nn as nn
import torch.nn.functional as F
class ConvNet(nn.Module):
def __init__(self, num_classes=10):
super().__init__()
self.conv1 = nn.Conv2d(3, 32, kernel_size=3, padding=1)
self.conv2 = nn.Conv2d(32, 64, kernel_size=3, padding=1)
self.pool = nn.MaxPool2d(2, 2)
self.fc1 = nn.Linear(64 * 8 * 8, 128) # Пример для 32x32 изображения
self.fc2 = nn.Linear(128, num_classes)
def forward(self, x):
x = self.pool(F.relu(self.conv1(x))) # -> [batch, 32, 16, 16]
x = self.pool(F.relu(self.conv2(x))) # -> [batch, 64, 8, 8]
x = x.view(-1, 64 * 8 * 8) # Flatten
x = F.relu(self.fc1(x))
x = self.fc2(x)
return x