Вероятность
Ожидание и его линейность
Линейность работает всегда, а E[g(X)] = g(E[X]) — почти никогда
Определение
Одна и та же конструкция: значение, взвешенное вероятностью. Именно за этим в блоке 2 нужен был интеграл — сумма с непрерывным индексом.
Ожидание — не «типичное значение» и не то, что вы увидите. У броска кубика , а выпасть не может. Правильное прочтение — центр масс распределения: точка, в которой картинка уравновешивается.
Существует оно не всегда: у распределения Коши интеграл расходится, и ожидания нет. На практике это встречается редко, но объясняет, почему в теории всюду оговорка «если ожидание существует».
Линейность — главное свойство
Стоит отметить, насколько это необычно. Почти все остальные удобные тождества требуют независимости: требует, дисперсия суммы требует. Линейность — нет.
Типичный приём, который она даёт: сложную величину разложить в сумму простых. Например, ожидаемое число совпадений в задаче о шляпах считается как сумма индикаторов, каждый с ожиданием , — итого , независимо от . Совместное распределение индикаторов при этом чудовищно, и оно не понадобилось.
E[g(X)] ≠ g(E[X])
Подстановка среднего внутрь функции — самая частая ошибка в вероятностных выкладках. Правильная формула:
то есть преобразуются значения, а веса остаются теми же.
Для выпуклых функций расхождение имеет определённый знак: . Это неравенство Йенсена, и ему посвящён отдельный урок в блоке 4 — из него получается ELBO. Пока достаточно знать направление.
Практический пример: усреднять логарифмы и логарифмировать среднее — разные вещи, и именно поэтому перплексия языковой модели считается как экспонента среднего логарифма, а не как среднее самих вероятностей.
Дисперсия через ожидания
Второе равенство — рабочая формула, и она же прямое следствие линейности: раскройте квадрат и примените её. Заодно из неотрицательности дисперсии сразу следует — тот же Йенсен для .
Вычислять дисперсию по формуле в коде — плохая идея, когда величины большие: два близких числа вычитаются, и значащие цифры сокращаются. Это catastrophic cancellation, знакомое из блока 2. Численные библиотеки используют алгоритм Уэлфорда — один проход и никакого вычитания больших величин.
Подвигайте параметры и сравните среднее с формой распределения. У экспоненциального среднее заметно правее пика — асимметрия сдвигает центр масс:
плотность p(x)
F(x) = P(X ≤ x)
- E[X]
- 1
- Var(X)
- 1
- P(X ≤ x)
- 0.918
Случай стоит рассмотреть отдельно: среднее равно , а плотность именно там минимальна — распределение U-образное, вещество собрано у краёв. Центр масс не обязан лежать там, где много вероятности.
Закон полного ожидания
Внутреннее ожидание берётся по при фиксированном и является функцией от , то есть само случайной величиной. Внешнее усредняет её по .
Читается как «разбей на случаи и усредни»: посчитай среднее в каждом сценарии, потом усредни по вероятностям сценариев. Это прямой аналог формулы полной вероятности, и техника та же — свести задачу к более простым, обусловившись на чём-нибудь.
Похожая формула для дисперсии:
Это разложение дисперсии на «внутригрупповую» и «межгрупповую», и именно оно стоит за разложением на смещение и разброс в следующих уроках.
Ожидание в машинном обучении
Почти каждая функция потерь — это ожидание:
и оценивается оно средним по батчу. Отсюда два факта, к которым мы вернёмся:
- батч даёт несмещённую оценку лосса и его градиента — по линейности;
- дисперсия этой оценки падает как по размеру батча, а не как .
Первый факт делает SGD законным, второй объясняет, почему увеличение батча даёт убывающую отдачу. Обоим будет посвящён урок в блоке 5.
Источники
- Blitzstein, Hwang — Introduction to Probability, гл. 4 — Ожидание, линейность, закон полного ожидания
- Deisenroth, Faisal, Ong — Mathematics for Machine Learning, гл. 6.4 — Средние значения и ожидания
Проверки
0 из 2Что можно, а что нельзя
Отметьте все утверждения, верные для любых случайных величин и (без предположения независимости).
E[g(X)] против g(E[X])
Реализуйте
moments(masses)— верните список[E[X], E[X²], (E[X])², Var(X)]для дискретной величины.masses— список пар[значение, вероятность].Формулы:
Обратите внимание, что считается преобразованием значений при тех же весах — возводится в квадрат , а не . Именно в этом и состоит разница между и .
Для пустого списка верните
[0, 0, 0, 0].Загрузка редактора…
Ctrl/⌘ + Enter