Какие методы снижения размерности данных вы знаете?

«Какие методы снижения размерности данных вы знаете?» — вопрос из категории Предобработка данных, который задают на 26% собеседований Data Scientist / ML Инженер. Ниже — развёрнутый ответ с разбором ключевых моментов.

Ответ

Методы снижения размерности можно разделить на линейные, нелинейные и основанные на отборе признаков.

Линейные методы:

  • PCA (Principal Component Analysis) — проецирует данные на ортогональные оси (главные компоненты), максимизирующие дисперсию. Эффективен для удаления коррелированных признаков и шума.
    from sklearn.decomposition import PCA
    pca = PCA(n_components=2)
    X_reduced = pca.fit_transform(X)
  • LDA (Linear Discriminant Analysis) — в отличие от PCA, максимизирует разделимость между заранее известными классами, поэтому требует размеченных данных.

Нелинейные методы (часто для визуализации):

  • t-SNE (t-Distributed Stochastic Neighbor Embedding) — сохраняет локальные структуры данных, хорошо подходит для визуализации кластеров в 2D/3D, но вычислительно сложен.
    from sklearn.manifold import TSNE
    tsne = TSNE(n_components=2, perplexity=30)
    X_embedded = tsne.fit_transform(X)
  • UMAP (Uniform Manifold Approximation and Projection) — современная альтернатива t-SNE, часто быстрее и лучше сохраняет глобальную структуру данных.

Нейросетевые и другие подходы:

  • Автокодировщики (Autoencoders) — нейросеть учится сжимать данные в скрытое представление (энкодер), а затем восстанавливать их (декодер). Размерность определяется размером скрытого слоя (bottleneck).
  • Отбор признаков (Feature Selection) — не создает новые признаки, а выбирает наиболее информативные из существующих (например, через ANOVA, взаимную информацию или важность признаков из моделей).