В чём состоит вероятностный смысл регуляризации?

«В чём состоит вероятностный смысл регуляризации?» — вопрос из категории Статистика и теория вероятностей, который задают на 26% собеседований Data Scientist / ML Инженер. Ниже — развёрнутый ответ с разбором ключевых моментов.

Ответ

Вероятностный смысл регуляризации заключается в интерпретации её как априорного распределения (prior) на параметры модели (веса) в рамках байесовского подхода к машинному обучению.

В байесовской линейной регрессии мы ищем не просто точечные оценки весов w, а их апостериорное распределение P(w | X, y). По теореме Байеса:

P(w | X, y) ∝ P(y | X, w) * P(w)

Где:

  • P(y | X, w)правдоподобие (likelihood), которое определяется функцией потерь (например, MSE для нормального шума).
  • P(w)априорное распределение на веса, которое выражает наши убеждения о них до наблюдения данных.

Максимизация апостериорного правдоподобия (MAP) приводит к задаче минимизации, которая в точности соответствует задаче регуляризации:

argmin_w [ Loss(y, Xw) + λ * Penalty(w) ]

Соответствие типов регуляризации и априорных распределений:

  1. L2-регуляризация (Ridge Regression):

    • Априор: Гауссовское (нормальное) распределение с нулевым средним и дисперсией, контролируемой параметром λ.
    • P(w) ~ N(0, 1/λ * I)
    • Смысл: Мы априори считаем, что все веса скорее малы и близки к нулю, но ненулевые. Это стабилизирует решение, борется с мультиколлинеарностью.
  2. L1-регуляризация (Lasso Regression):

    • Априор: Распределение Лапласа с нулевым средним.
    • P(w) ~ Laplace(0, 1/λ)
    • Смысл: Это распределение имеет более тяжёлые «хвосты» и пик в нуле. Оно сильнее «штрафует» малые веса, обнуляя некоторые из них, что приводит к разреженным решениям (отбору признаков).
  3. Elastic Net: Соответствует априорному распределению, являющемуся компромиссом между Лапласом и Гауссом.

Практический вывод: Выбор типа регуляризации — это выбор наших априорных предположений о том, как должны выглядеть «хорошие» параметры модели. L2 подходит, когда мы ожидаем, что все признаки вносят небольшой вклад, а L1 — когда мы подозреваем, что лишь небольшое подмножество признаков действительно важно.