Вероятность
Смещение и дисперсия
Оценка — случайная величина, и несмещённость не то же самое, что точность
Оценка — это случайная величина
Главный сдвиг мышления в этом уроке один: не число, а функция от выборки, а выборка случайна. Значит, у оценки есть распределение — по всем выборкам, которые вы могли бы получить, но не получили. Оно называется выборочным распределением, и все дальнейшие понятия — свойства этого распределения, а не вашего конкретного прогона.
— насколько центр распределения оценки сдвинут относительно истины; — насколько оценка гуляет от выборки к выборке.
Ни то, ни другое нельзя увидеть на одном прогоне. Вот почему нельзя посмотреть на свой и что-то сказать о смещении.
Разложение ошибки
Тождество получается добавлением и вычитанием внутри квадрата; перекрёстный член зануляется, потому что . Проверить полезно руками — это единственный шаг, и он объясняет, почему в разложении именно два слагаемых и никогда третьего.
Важно, что это не эвристика про «компромисс». Это равенство, и оно говорит: уменьшить ошибку можно двумя разными способами, и оптимальная оценка не обязана быть несмещённой.
Несмещённость не бесплатна
Вернёмся к находке из урока про MLE: смещена, потому что делит на , а не на . Естественная реакция — «значит, надо делить на ». Виджет ниже показывает, чего это стоит.
Обе оценки считаются на одних и тех же выборках из , так что любая разница вызвана только делителем.
Виджет открыт на ; прочитайте таблицу. Несмещённая оценка стоит на истине — и шире. По среднеквадратичной ошибке она проигрывает: примерно против . И проигрывает при любом , потому что
Смещённая оценка всегда точнее в этом смысле. Тот же делитель, который сдвигает центр вниз, умножает всю оценку на и тем самым сжимает её разброс — и сжатие окупает сдвиг.
Отсюда мораль, которая противоречит первому впечатлению: несмещённость — это свойство, а не цель. Она удобна тем, что усреднение многих независимых оценок сходится к истине, но сама по себе точности не даёт.
Выберите : гистограммы почти сливаются. Разница между делителями исчезает как , и спор о против имеет смысл только на малых выборках.
Тот же компромисс в моделях
В машинном обучении разложение применяют не к параметру, а к предсказанию. Для квадратичной потери в точке :
Третьего слагаемого в оценке параметра не было — оно появилось, потому что само случайно. Первое слагаемое — неустранимая ошибка: никакая модель не предскажет шум, и всякий, кто обещает MSE ниже , ошибается или обманывает.
Читается таблица так:
| смещение | дисперсия | |
|---|---|---|
| простая модель (линейная) | велико | мало |
| богатая модель (глубокая сеть) | мало | велика |
| больше данных | не меняется | падает |
| регуляризация | растёт | падает |
| усреднение моделей (bagging) | не меняется | падает |
Две строки стоят внимания. Регуляризация — это осознанный обмен: из урока про MAP она сжимает оценку к prior, что и есть добавление смещения ради уменьшения дисперсии. Ровно та же арифметика, что у делителя выше.
Больше данных снижает дисперсию, но не смещение. Если модель принципиально не может выразить нужную функцию, миллион примеров этого не исправит. Поэтому диагностика «underfit против overfit» решает разные задачи: недообучение лечится моделью, переобучение — данными или регуляризацией.
Честная оговорка: у современных больших сетей картина сложнее, чем эта таблица. Наблюдается «двойной спуск», когда ошибка после точки интерполяции снова падает с ростом модели, и простая U-образная кривая перестаёт описывать реальность. Само разложение при этом остаётся верным — оно тождество; неверна лишь привычная догадка, что дисперсия монотонно растёт с числом параметров.
Достаточная статистика
Родственный вопрос: сколько информации о параметре несёт выборка, и можно ли её сжать без потерь.
называется достаточной статистикой, если условное распределение выборки при известном от параметра не зависит:
То есть: узнав , вы узнали о всё, что было в данных, и остаток выборки уже бесполезен.
Примеры, которые стоит помнить:
- Бернулли: . Порядок бросков не несёт информации о ;
- : . Двух чисел хватает вместо миллиона;
- Пуассон: .
Заметили закономерность? Это в точности из урока про экспоненциальное семейство. Так и есть: экспоненциальное семейство — это ровно те распределения, у которых достаточная статистика имеет фиксированную размерность, не растущую с (теорема Питмена–Купмана–Дармуа). Отсюда практический смысл: сопряжённые priors и обучение по агрегатам возможны именно потому, что данные сжимаются в несколько сумм.
У равномерного достаточная статистика — , и это как раз пример вне экспоненциального семейства.
Источники
- Hastie, Tibshirani, Friedman — The Elements of Statistical Learning, гл. 7.3 — Разложение ошибки на смещение и дисперсию
- Bishop — Pattern Recognition and Machine Learning, гл. 3.2 — Bias-variance trade-off на регрессии
Проверки
0 из 2Что говорит разложение
Отметьте все верные утверждения о смещении, дисперсии и ошибке оценки.
Разложить ошибку по определению
Вам дан список
estimates— значения оценки , полученные на разных выборках, и истинное значениеtruth.Реализуйте
decompose(estimates, truth)— верните список[bias, variance, mse, check]:bias= , где — среднее по списку;variance= — делитель , это разброс вокруг своего среднего;mse= — разброс вокруг истины;check=bias**2 + variance.
Последние два числа обязаны совпасть — это и есть тождество разложения, посчитанное двумя путями. Если у вас они разошлись, вы где-то поделили не на то.
Загрузка редактора…
Ctrl/⌘ + Enter