Ответ
Вероятностный смысл регуляризации заключается в интерпретации её как априорного распределения (prior) на параметры модели (веса) в рамках байесовского подхода к машинному обучению.
В байесовской линейной регрессии мы ищем не просто точечные оценки весов w, а их апостериорное распределение P(w | X, y). По теореме Байеса:
P(w | X, y) ∝ P(y | X, w) * P(w)
Где:
P(y | X, w)— правдоподобие (likelihood), которое определяется функцией потерь (например, MSE для нормального шума).P(w)— априорное распределение на веса, которое выражает наши убеждения о них до наблюдения данных.
Максимизация апостериорного правдоподобия (MAP) приводит к задаче минимизации, которая в точности соответствует задаче регуляризации:
argmin_w [ Loss(y, Xw) + λ * Penalty(w) ]
Соответствие типов регуляризации и априорных распределений:
-
L2-регуляризация (Ridge Regression):
- Априор: Гауссовское (нормальное) распределение с нулевым средним и дисперсией, контролируемой параметром
λ. P(w) ~ N(0, 1/λ * I)- Смысл: Мы априори считаем, что все веса скорее малы и близки к нулю, но ненулевые. Это стабилизирует решение, борется с мультиколлинеарностью.
- Априор: Гауссовское (нормальное) распределение с нулевым средним и дисперсией, контролируемой параметром
-
L1-регуляризация (Lasso Regression):
- Априор: Распределение Лапласа с нулевым средним.
P(w) ~ Laplace(0, 1/λ)- Смысл: Это распределение имеет более тяжёлые «хвосты» и пик в нуле. Оно сильнее «штрафует» малые веса, обнуляя некоторые из них, что приводит к разреженным решениям (отбору признаков).
-
Elastic Net: Соответствует априорному распределению, являющемуся компромиссом между Лапласом и Гауссом.
Практический вывод: Выбор типа регуляризации — это выбор наших априорных предположений о том, как должны выглядеть «хорошие» параметры модели. L2 подходит, когда мы ожидаем, что все признаки вносят небольшой вклад, а L1 — когда мы подозреваем, что лишь небольшое подмножество признаков действительно важно.