Какие преимущества и недостатки у свёрточных нейронных сетей (CNN)?

«Какие преимущества и недостатки у свёрточных нейронных сетей (CNN)?» — вопрос из категории Нейронные сети и Deep Learning, который задают на 26% собеседований Data Scientist / ML Инженер. Ниже — развёрнутый ответ с разбором ключевых моментов.

Ответ

Преимущества CNN:

  • Автоматическое извлечение пространственных признаков: Свёртки самостоятельно учатся обнаруживать иерархические паттерны (края → текстуры → объекты), избавляя от ручного feature engineering для изображений.
  • Параметр-эффективность за счёт разделения весов (weight sharing): Один и тот же фильтр применяется ко всей карте признаков, что резко сокращает количество обучаемых параметров по сравнению с полносвязными слоями.
  • Инвариантность к небольшим трансформациям: Комбинация свёрток и пулинга обеспечивает устойчивость к малым сдвигам, поворотам и искажениям.
  • Оптимизированы для hardware: Операции свёртки эффективно параллелятся на GPU/TPU.

Недостатки CNN:

  • Требуют больших размеченных датасетов для обучения с нуля, иначе склонны к переобучению. Часто используют transfer learning.
  • Плохая интерпретируемость: Являются "чёрным ящиком", хотя методы вроде Grad-CAM помогают визуализировать важные области.
  • Жёсткая индуктивная bias для пространственных данных: Менее эффективны для не имеющих spatial-структуры данных (например, табличных), где полносвязные сети или трансформеры могут быть лучше.
  • Потеря позиционной информации при агрессивном пулинге.

Пример архитектуры на PyTorch для классификации изображений:

import torch.nn as nn
import torch.nn.functional as F

class ConvNet(nn.Module):
    def __init__(self, num_classes=10):
        super().__init__()
        self.conv1 = nn.Conv2d(3, 32, kernel_size=3, padding=1)
        self.conv2 = nn.Conv2d(32, 64, kernel_size=3, padding=1)
        self.pool = nn.MaxPool2d(2, 2)
        self.fc1 = nn.Linear(64 * 8 * 8, 128)  # Пример для 32x32 изображения
        self.fc2 = nn.Linear(128, num_classes)

    def forward(self, x):
        x = self.pool(F.relu(self.conv1(x)))  # -> [batch, 32, 16, 16]
        x = self.pool(F.relu(self.conv2(x)))  # -> [batch, 64, 8, 8]
        x = x.view(-1, 64 * 8 * 8)           # Flatten
        x = F.relu(self.fc1(x))
        x = self.fc2(x)
        return x