Ответ
Математическое ожидание (Expected Value) — это средневзвешенное значение случайной величины по всем её возможным исходам, где весами выступают вероятности этих исходов. Это центральная характеристика, вокруг которой распределены значения величины.
Формулы:
- Для дискретной случайной величины:
E[X] = Σ (x_i * p_i), гдеx_i— возможное значение,p_i— его вероятность. - Для непрерывной случайной величины с плотностью вероятности f(x):
E[X] = ∫ x * f(x) dx(интеграл по всей области определения).
Пример расчета для дискретной величины (бросок игрального кубика):
Значения: {1, 2, 3, 4, 5, 6}, каждое с вероятностью 1/6.
E[X] = (1+2+3+4+5+6) * 1/6 = 21 / 6 = 3.5
Основные свойства:
- Линейность:
E[aX + bY + c] = a*E[X] + b*E[Y] + c, где a, b, c — константы. - Для независимых величин:
E[X*Y] = E[X] * E[Y]. - Математическое ожидание может не существовать у распределений с «тяжелыми хвостами» (например, распределение Коши).
Практическое применение в Data Science:
- Оценка среднего: Выборочное среднее — несмещенная оценка математического ожидания генеральной совокупности.
- Функции потерь (Loss Functions): Например, MSE (Mean Squared Error) — это математическое ожидание квадрата ошибки.
- Ожидаемый выигрыш в A/B-тестах и decision theory.
Код для вычисления:
import numpy as np
# Для известного дискретного распределения
values = np.array([10, 20, 30])
probabilities = np.array([0.2, 0.5, 0.3])
expected_value = np.sum(values * probabilities)
print(f"Expected value: {expected_value}") # 10*0.2 + 20*0.5 + 30*0.3 = 21.0
# Оценка мат. ожидания по выборке (эмпирическое среднее)
sample = np.random.normal(loc=5.0, scale=2.0, size=1000) # loc — это и есть теоретическое мат. ожидание
sample_mean = np.mean(sample)
print(f"Sample mean (estimate of E[X]): {sample_mean:.4f}")