Вероятность
MAP и байесовский взгляд
Prior, likelihood, posterior, evidence — и почему L2-регуляризация это гауссов prior
Четыре имени в одной формуле
Правило Байеса из урока про условную вероятность, записанное для параметра, — это весь байесовский вывод целиком.
Четыре объекта, и у каждого своя роль:
говорит, какие значения параметра вы считали правдоподобными до данных; — то самое, что MLE максимизирует в одиночку; — распределение над , а не точка. Это то, что байесовский вывод считает ответом; от не зависит и на положение максимума не влияет — но именно он делает posterior распределением, и он же нужен для сравнения моделей.
MAP — это posterior, сжатый до точки
Считать интеграл в знаменателе дорого, а часто и невозможно. MAP отказывается от всего posterior и берёт только его максимум:
Evidence исчез, потому что от не зависит. Осталось log-правдоподобие плюс одно слагаемое — и это слагаемое есть регуляризатор.
Переключите prior в виджете. При десяти наблюдениях MLE и MAP стоят заметно врозь; поднимите и к сотне — метки сходятся. Регуляризация не «делает оценку лучше», она добавляет фиксированное число псевдонаблюдений, и их вес падает по мере роста выборки.
L(θ)·p(θ), нормировано на пик
log L(θ) + log p(θ)
- MLE
- 0.7
- значение в пике
- -6.11
Для Бернулли с prior MAP считается в закрытой форме:
Две подстановки стоит проделать самому. При дробь становится — плоский prior не меняет ничего, потому что добавляет ноль псевдонаблюдений. При получается — то самое сглаживание Лапласа из урока про непрерывные распределения, только теперь понятно, откуда оно берётся.
L2-регуляризация — это гауссов prior
Возьмите регрессию с и prior . Логарифм posterior:
Умножьте на и посмотрите, что получилось:
Это ridge-регрессия, буква в букву, с
Отсюда сразу читаются три вещи, которые иначе приходится запоминать:
- что означает . Отношение дисперсии шума к дисперсии prior. Большая — это либо «данные шумные», либо «я уверен, что веса малы»;
- почему даёт MLE. Широкий prior () ничего не утверждает, и слагаемое исчезает;
- что L1 — тоже prior. Замените гауссов prior на Лапласа , и вместо появится . Разреженность Lasso — следствие того, что у Лапласа пик в нуле острый, а не гладкий.
Общее правило: любой аддитивный регуляризатор — это минус логарифм какого-то prior. Если вы можете написать штраф, вы уже выбрали prior, независимо от того, собирались ли.
Байесовский вывод против точечной оценки
MAP — это ещё не байесовский вывод, а компромисс: одна точка вместо распределения. Разница видна в трёх местах.
| MLE | MAP | полный Байес | |
|---|---|---|---|
| ответ | точка | точка | распределение |
| prior | нет | есть | есть |
| evidence | не нужен | не нужен | нужен |
| неопределённость оценки | нет | нет | есть |
| предсказание |
Последняя строка — то, за что платят интегралом. Полное байесовское предсказание усредняет по всем параметрам с их весами, поэтому знает, что оно чего-то не знает. Точечная оценка выдаёт одно и то же уверенное число и на десяти наблюдениях, и на десяти миллионах.
Есть и неприятная особенность MAP, о которой обычно не говорят: аргмаксимум плотности зависит от параметризации. Перепараметризуйте — и максимум плотности переедет, потому что плотность перевешивается на якобиан (это ровно урок про замену переменных). Среднее posterior так себя не ведёт. MLE от параметризации не зависит, потому что правдоподобие — не плотность по .
Когда prior важен
Не всегда. Правило простое: вес prior измеряется в наблюдениях, и он проигрывает данным линейно по .
- мало данных — prior определяет ответ. Ноль успехов из трёх: MLE говорит «невозможно», MAP с говорит ;
- много данных — posterior концентрируется вокруг MLE, prior не важен (пока он не назначил истинному значению нулевую вероятность — тогда никакое количество данных не поможет);
- много параметров — prior важен снова, потому что данных на параметр мало. Weight decay в сети с миллиардом весов — это именно этот случай.
Последний пункт объясняет, почему регуляризация в глубоком обучении не факультативна: отношение числа наблюдений к числу параметров там такое, что чистый MLE переобучается всегда.
Источники
- Bishop — Pattern Recognition and Machine Learning, гл. 1.2.5–1.2.6, 3.3 — MAP, байесовская линейная регрессия, evidence
- MacKay — Information Theory, Inference, and Learning Algorithms, гл. 28 — Байесовский вывод и сравнение моделей
Проверки
0 из 2Регуляризатор как prior
Отметьте все верные утверждения о MAP, prior и регуляризации.
Ridge как MAP
Одномерная регрессия через начало координат: с и prior .
Реализуйте
ridge_map(xs, ys, noise_var, prior_var)— верните список[w_mle, w_map, lam, shrink], гдеа
shrink— коэффициент сжатия .Формулу MAP выводить не нужно, но стоит понимать, откуда взялось в знаменателе: это производная слагаемого из логарифма prior.
Загрузка редактора…
Ctrl/⌘ + Enter