Вероятность

Смещение и дисперсия

Оценка — случайная величина, и несмещённость не то же самое, что точность

Шаг 47 из 117 · ~30 мин

Оценка — это случайная величина

Главный сдвиг мышления в этом уроке один: θ^\hat{\theta} не число, а функция от выборки, а выборка случайна. Значит, у оценки есть распределение — по всем выборкам, которые вы могли бы получить, но не получили. Оно называется выборочным распределением, и все дальнейшие понятия — свойства этого распределения, а не вашего конкретного прогона.

  • — насколько центр распределения оценки сдвинут относительно истины;
  • — насколько оценка гуляет от выборки к выборке.

Ни то, ни другое нельзя увидеть на одном прогоне. Вот почему нельзя посмотреть на свой σ^2=0.83\hat{\sigma}^2 = 0.83 и что-то сказать о смещении.

Разложение ошибки

E[(θ^θ)2]=(E[θ^]θ)2+Var(θ^)\htmlData{k=mse}{\mathbb{E}\big[(\hat{\theta} - \theta)^2\big]} = \htmlData{k=bias}{\big(\mathbb{E}[\hat{\theta}] - \theta\big)^2} + \htmlData{k=var}{\operatorname{Var}(\hat{\theta})}

Тождество получается добавлением и вычитанием E[θ^]\mathbb{E}[\hat{\theta}] внутри квадрата; перекрёстный член зануляется, потому что E[θ^E[θ^]]=0\mathbb{E}\big[\hat{\theta} - \mathbb{E}[\hat{\theta}]\big] = 0. Проверить полезно руками — это единственный шаг, и он объясняет, почему в разложении именно два слагаемых и никогда третьего.

Важно, что это не эвристика про «компромисс». Это равенство, и оно говорит: уменьшить ошибку можно двумя разными способами, и оптимальная оценка не обязана быть несмещённой.

Несмещённость не бесплатна

Вернёмся к находке из урока про MLE: σ^MLE2\hat{\sigma}^2_{\text{MLE}} смещена, потому что делит на nn, а не на n1n-1. Естественная реакция — «значит, надо делить на n1n-1». Виджет ниже показывает, чего это стоит.

Обе оценки считаются на одних и тех же выборках из N(0,1)\mathcal{N}(0, 1), так что любая разница вызвана только делителем.

MLE, делитель n несмещённая, делитель n−1 истина σ² = 1
размер выборки n
среднеесмещениест. откл.MSE
MLE, делитель n0.74-0.260.610.44
несмещённая, делитель n−10.986-0.0140.8130.662
Смещение MLE предсказывается теорией: (n−1)/n = 0.75

Виджет открыт на n=4n = 4; прочитайте таблицу. Несмещённая оценка стоит на истине — и шире. По среднеквадратичной ошибке она проигрывает: примерно 0.440.44 против 0.660.66. И проигрывает при любом nn, потому что

MSEMLE=1n2+(n1n)22n1 < 2n1=MSEнесмещ\text{MSE}_{\text{MLE}} = \frac{1}{n^2} + \left(\frac{n-1}{n}\right)^2 \cdot \frac{2}{n-1} \ < \ \frac{2}{n-1} = \text{MSE}_{\text{несмещ}}

Смещённая оценка всегда точнее в этом смысле. Тот же делитель, который сдвигает центр вниз, умножает всю оценку на n1n<1\frac{n-1}{n} < 1 и тем самым сжимает её разброс — и сжатие окупает сдвиг.

Отсюда мораль, которая противоречит первому впечатлению: несмещённость — это свойство, а не цель. Она удобна тем, что усреднение многих независимых оценок сходится к истине, но сама по себе точности не даёт.

Выберите n=40n = 40: гистограммы почти сливаются. Разница между делителями исчезает как 1/n1/n, и спор о nn против n1n-1 имеет смысл только на малых выборках.

Тот же компромисс в моделях

В машинном обучении разложение применяют не к параметру, а к предсказанию. Для квадратичной потери в точке xx:

E[(yf^(x))2]=σ2шум+(E[f^(x)]f(x))2смещение2+Var(f^(x))дисперсия\mathbb{E}\big[(y - \hat{f}(x))^2\big] = \underbrace{\sigma^2}_{\text{шум}} + \underbrace{\big(\mathbb{E}[\hat{f}(x)] - f(x)\big)^2}_{\text{смещение}^2} + \underbrace{\operatorname{Var}(\hat{f}(x))}_{\text{дисперсия}}

Третьего слагаемого в оценке параметра не было — оно появилось, потому что yy само случайно. Первое слагаемое — неустранимая ошибка: никакая модель не предскажет шум, и всякий, кто обещает MSE ниже σ2\sigma^2, ошибается или обманывает.

Читается таблица так:

смещениедисперсия
простая модель (линейная)великомало
богатая модель (глубокая сеть)маловелика
больше данныхне меняетсяпадает
регуляризациярастётпадает
усреднение моделей (bagging)не меняетсяпадает

Две строки стоят внимания. Регуляризация — это осознанный обмен: из урока про MAP она сжимает оценку к prior, что и есть добавление смещения ради уменьшения дисперсии. Ровно та же арифметика, что у делителя n1n\frac{n-1}{n} выше.

Больше данных снижает дисперсию, но не смещение. Если модель принципиально не может выразить нужную функцию, миллион примеров этого не исправит. Поэтому диагностика «underfit против overfit» решает разные задачи: недообучение лечится моделью, переобучение — данными или регуляризацией.

Честная оговорка: у современных больших сетей картина сложнее, чем эта таблица. Наблюдается «двойной спуск», когда ошибка после точки интерполяции снова падает с ростом модели, и простая U-образная кривая перестаёт описывать реальность. Само разложение при этом остаётся верным — оно тождество; неверна лишь привычная догадка, что дисперсия монотонно растёт с числом параметров.

Достаточная статистика

Родственный вопрос: сколько информации о параметре несёт выборка, и можно ли её сжать без потерь.

T(X)T(X) называется достаточной статистикой, если условное распределение выборки при известном TT от параметра не зависит:

p(x1,,xnT(x)=t,θ)=p(x1,,xnT(x)=t)p(x_1, \dots, x_n \mid T(x) = t, \theta) = p(x_1, \dots, x_n \mid T(x) = t)

То есть: узнав TT, вы узнали о θ\theta всё, что было в данных, и остаток выборки уже бесполезен.

Примеры, которые стоит помнить:

  • Бернулли: T=ixiT = \sum_i x_i. Порядок бросков не несёт информации о θ\theta;
  • N(μ,σ2)\mathcal{N}(\mu, \sigma^2): T=(ixi,ixi2)T = \big(\sum_i x_i, \sum_i x_i^2\big). Двух чисел хватает вместо миллиона;
  • Пуассон: T=ixiT = \sum_i x_i.

Заметили закономерность? Это в точности iT(xi)\sum_i T(x_i) из урока про экспоненциальное семейство. Так и есть: экспоненциальное семейство — это ровно те распределения, у которых достаточная статистика имеет фиксированную размерность, не растущую с nn (теорема Питмена–Купмана–Дармуа). Отсюда практический смысл: сопряжённые priors и обучение по агрегатам возможны именно потому, что данные сжимаются в несколько сумм.

У равномерного U[0,θ]U[0, \theta] достаточная статистика — maxixi\max_i x_i, и это как раз пример вне экспоненциального семейства.

Источники

Проверки

0 из 2
  1. Что говорит разложение

    Отметьте все верные утверждения о смещении, дисперсии и ошибке оценки.

  2. Разложить ошибку по определению

    Вам дан список estimates — значения оценки θ^\hat{\theta}, полученные на разных выборках, и истинное значение truth.

    Реализуйте decompose(estimates, truth) — верните список [bias, variance, mse, check]:

    • bias = θ^θ\overline{\hat{\theta}} - \theta, где θ^\overline{\hat{\theta}} — среднее по списку;
    • variance = 1kj(θ^jθ^)2\frac{1}{k}\sum_j (\hat{\theta}_j - \overline{\hat{\theta}})^2 — делитель kk, это разброс вокруг своего среднего;
    • mse = 1kj(θ^jθ)2\frac{1}{k}\sum_j (\hat{\theta}_j - \theta)^2 — разброс вокруг истины;
    • check = bias**2 + variance.

    Последние два числа обязаны совпасть — это и есть тождество разложения, посчитанное двумя путями. Если у вас они разошлись, вы где-то поделили не на то.

    функция decompose

    Загрузка редактора…

    Ctrl/⌘ + Enter