Вероятность
Максимальное правдоподобие
Правдоподобие — функция параметра при фиксированных данных, и логарифм в ней не косметика
Правдоподобие — это не плотность
Одна и та же формула читается двумя способами, и путать их нельзя:
- как плотность: переменная, фиксирован. Интегрируется в единицу;
- как правдоподобие: переменная, фиксирован. Не интегрируется ни во что осмысленное.
Правдоподобие не является распределением над . Именно поэтому пишут и говорят «правдоподобие параметра», а не «вероятность параметра» — вероятностью параметра будет posterior, и для него нужен prior.
MLE
Для iid-выборки правдоподобие — произведение , и логарифм превращает его в сумму. Причины брать логарифм три, и все практические:
- Численная. Произведение тысячи вероятностей underflow’ится в нуль. Проверить легко: у сбалансированной монеты правдоподобие при уже равно на ста наблюдениях и точно нулю чуть больше тысячи.
- Вычислительная. Производная суммы — сумма производных; производная произведения — кошмар.
- Аргмаксимум не меняется. Логарифм монотонен, поэтому максимум там же.
Третий пункт — то, что делает первые два законными. Переключитесь между двумя графиками ниже: пик стоит на одном месте, но у сырого правдоподобия при большой выборке видна только тонкая иголка, а у логарифма — читаемая кривая.
L(θ), нормировано на пик
log L(θ)
- MLE
- 0.7
- log L в пике
- -6.11
Поднимите число наблюдений до сотни: пик становится узким. Это не случайность — кривизна log-правдоподобия в максимуме растёт как , и с ней падает неопределённость оценки. Величина этой кривизны называется информацией Фишера, и она вернётся в блоке 5 в разговоре про natural gradient.
Вывод для Бернулли
где — число успехов, — неудач. Дифференцируем и приравниваем нулю:
Ответ — доля успехов, то есть в точности то, что подсказывает интуиция. Ценность вывода не в ответе, а в том, что механизм тот же для любого распределения.
Вывод для гауссианы
По : производная даёт , откуда — выборочное среднее.
По : получается — и обратите внимание на делитель , а не . MLE дисперсии смещена, и это не ошибка вывода, а свойство метода. Разберём в уроке про смещение.
Но самое важное здесь другое. При фиксированном максимизация log-правдоподобия сводится к
то есть к наименьшим квадратам. Отсюда общий и часто неочевидный факт: MSE — это не произвольный выбор функции потерь, а минус log-правдоподобие при гауссовском шуме постоянной дисперсии. Выбирая MSE, вы принимаете это предположение, знаете вы об этом или нет.
Как узнавать лоссы
Та же логика превращает каждую стандартную функцию потерь в предположение о шуме:
| предположение о данных | минус log-правдоподобие |
|---|---|
| гауссовский шум | MSE |
| Бернулли | бинарная кросс-энтропия |
| категориальное | кросс-энтропия |
| Пуассона | пуассоновский лосс |
| Лаплас (тяжёлые хвосты) | MAE |
Последняя строка полезна практически: MAE устойчивее к выбросам не «потому что модуль», а потому что распределение Лапласа имеет более тяжёлые хвосты и не считает далёкую точку невероятной.
Ограничения MLE
Три, и все встречаются постоянно:
- переобучение. MLE максимизирует правдоподобие данных, а не будущих наблюдений. При богатой модели она подгонит шум;
- вырожденные решения. Ноль успехов из четырёх даёт — «успех невозможен». Проверьте на виджете, выставив , ;
- смещение. Как у выше.
Все три лечатся одним и тем же — добавлением prior, то есть переходом к MAP. Это следующий урок.
Источники
- Bishop — Pattern Recognition and Machine Learning, гл. 1.2.4–1.2.5 — Максимальное правдоподобие, связь с наименьшими квадратами
- Blitzstein, Hwang — Introduction to Probability, гл. 9 — Оценивание параметров
Проверки
0 из 2Что такое правдоподобие
Отметьте все верные утверждения о правдоподобии и об оценке максимального правдоподобия.
MLE для гауссианы
Реализуйте
gaussian_mle(xs)— верните список[mu, var_mle, var_unbiased, nll]для выборкиxs.mu— оценка среднего: ;var_mle— оценка дисперсии по методу максимального правдоподобия, — с делителем ;var_unbiased— та же сумма квадратов, но делённая на ;nll— минус log-правдоподобие в точке :
Сумму квадратов посчитайте один раз и переиспользуйте — все три остальных числа выражаются через неё.
Загрузка редактора…
Ctrl/⌘ + Enter