Вероятность
Экспоненциальное семейство
Почему кросс-энтропия для Бернулли и для категориального — одна формула, а не два изобретения
Общий вид
Почти все знакомые распределения — члены этого семейства: Бернулли, категориальное, биномиальное, Пуассона, нормальное, экспоненциальное, Бета, Дирихле, гамма. Не входят, например, смеси и распределение Стьюдента.
Три части, каждая со своей ролью.
Бернулли: откуда берётся логит
Возьмём и перепишем через экспоненту:
Естественный параметр оказался равен — это логит. А обратное преобразование — сигмоида.
Вот и ответ на вопрос, почему в логистической регрессии стоит именно сигмоида. Не «удобная функция, сжимающая в », а обратное отображение к естественному параметру Бернулли. Для категориального распределения то же вычисление даёт softmax.
Три свойства, которые всё объясняют
Производная log-нормировки даёт среднее:
Отсюда сразу следует, что выпукла (гессиан — ковариационная матрица, а она неотрицательно определена), а значит правдоподобие в естественной параметризации имеет единственный максимум. Именно поэтому логистическая регрессия не имеет локальных минимумов, в отличие от нейросети.
Градиент log-правдоподобия — это «предсказание минус наблюдение»:
Сравните с выводом из блока 2, где градиент кросс-энтропии оказался . Это не совпадение и не удача конкретной выкладки: так устроено всё семейство. Кросс-энтропия для Бернулли, для категориального, для Пуассона — одна формула с разными .
Сопряжённый prior существует всегда и имеет ту же экспоненциальную форму. Отсюда и Бета для Бернулли, и Дирихле для категориального из прошлых уроков.
Softmax как параметризация категориального
Для категориального распределения с исходами естественные параметры — логиты, а обратное преобразование это softmax:
Инвариантность к сдвигу, которую мы видели в блоке 2, теперь получает объяснение: из-за ограничения у распределения свободных параметров, а логитов . Одна степень свободы лишняя — и сдвиг всех логитов её и параметризует.
- сумма
- 1
- наибольшая
- 59.8%
Включите строку якобиана: диагональ и внедиагональные — это в точности ковариационная матрица one-hot вектора. То есть якобиан softmax и есть , и его неотрицательная определённость — та же выпуклость.
Обобщённые линейные модели
Отсюда рецепт, покрывающий половину классической статистики: выберите распределение из семейства, предсказывайте его естественный параметр линейно (), обучайте по максимуму правдоподобия.
| данные | распределение | функция связи | что получилось |
|---|---|---|---|
| да/нет | Бернулли | сигмоида | логистическая регрессия |
| один из | категориальное | softmax | многоклассовая логистическая |
| счётчики | Пуассона | экспонента | пуассоновская регрессия |
| вещественные | нормальное | тождественная | обычная линейная регрессия |
Все четыре — один алгоритм. Функция потерь каждый раз одна и та же (минус log-правдоподобие), градиент каждый раз имеет вид «предсказание минус наблюдение», и оптимизация каждый раз выпукла. Это ровно та экономия, ради которой стоит знать про экспоненциальное семейство: четыре метода превращаются в один с параметром.
Источники
- Bishop — Pattern Recognition and Machine Learning, гл. 2.4 — Экспоненциальное семейство, достаточные статистики, сопряжённость
- Murphy — Probabilistic Machine Learning, гл. 3.4 — Exponential family, natural parameters, GLM
Проверки
0 из 2Естественные параметры и функции связи
Отметьте все верные утверждения про экспоненциальное семейство.
Функции связи и обратные к ним
Реализуйте
link(family, value, inverse)— переход между естественным параметром и средним для трёх семейств.При
inverse = falseнужно перевести среднее в естественный параметр, приinverse = true— обратно:семейство среднее → η η → среднее "bernoulli""poisson""normal"Для неизвестного семейства верните
null(в PythonNone). Дляbernoulliвне и дляpoissonпри неположительном среднем логарифм не определён — тоже вернитеnull.Обратите внимание, что у нормального распределения связь тождественная: обычная линейная регрессия — это GLM, у которого функция связи ничего не делает.
Загрузка редактора…
Ctrl/⌘ + Enter