Вероятность

Ожидание и его линейность

Линейность работает всегда, а E[g(X)] = g(E[X]) — почти никогда

Шаг 38 из 117 · ~30 мин

Определение

E[X]=xxp(x)(дискретный случай),E[X]=xp(x)dx(непрерывный)E[X] = \sum_x x\,p(x) \quad \text{(дискретный случай)}, \qquad E[X] = \int x\,p(x)\,dx \quad \text{(непрерывный)}

Одна и та же конструкция: значение, взвешенное вероятностью. Именно за этим в блоке 2 нужен был интеграл — сумма с непрерывным индексом.

Ожидание — не «типичное значение» и не то, что вы увидите. У броска кубика E[X]=3.5E[X] = 3.5, а выпасть 3.53.5 не может. Правильное прочтение — центр масс распределения: точка, в которой картинка уравновешивается.

Существует оно не всегда: у распределения Коши интеграл расходится, и ожидания нет. На практике это встречается редко, но объясняет, почему в теории всюду оговорка «если ожидание существует».

Линейность — главное свойство

E[aX+bY+c]=aE[X]+bE[Y]+c\htmlData{k=lin}{E[aX + bY + c] = a\,E[X] + b\,E[Y] + c}

выполняется всегда — для любых случайных величин, зависимых или нет, и это делает её самым мощным инструментом во всей элементарной теории вероятностей. Никаких предположений.

Стоит отметить, насколько это необычно. Почти все остальные удобные тождества требуют независимости: E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] требует, дисперсия суммы требует. Линейность — нет.

Типичный приём, который она даёт: сложную величину разложить в сумму простых. Например, ожидаемое число совпадений в задаче о шляпах считается как сумма nn индикаторов, каждый с ожиданием 1/n1/n, — итого 11, независимо от nn. Совместное распределение индикаторов при этом чудовищно, и оно не понадобилось.

E[g(X)] ≠ g(E[X])

E[X2](E[X])2,E ⁣[1X]1E[X],E[logX]logE[X]E[X^2] \ne (E[X])^2, \qquad E\!\left[\frac{1}{X}\right] \ne \frac{1}{E[X]}, \qquad E[\log X] \ne \log E[X]

Подстановка среднего внутрь функции — самая частая ошибка в вероятностных выкладках. Правильная формула:

E[g(X)]=xg(x)p(x)E[g(X)] = \sum_x g(x)\,p(x)

то есть преобразуются значения, а веса остаются теми же.

Для выпуклых функций расхождение имеет определённый знак: E[g(X)]g(E[X])E[g(X)] \ge g(E[X]). Это неравенство Йенсена, и ему посвящён отдельный урок в блоке 4 — из него получается ELBO. Пока достаточно знать направление.

Практический пример: усреднять логарифмы и логарифмировать среднее — разные вещи, и именно поэтому перплексия языковой модели считается как экспонента среднего логарифма, а не как среднее самих вероятностей.

Дисперсия через ожидания

Var(X)=E[(XE[X])2]=E[X2](E[X])2\operatorname{Var}(X) = E[(X - E[X])^2] = E[X^2] - (E[X])^2

Второе равенство — рабочая формула, и она же прямое следствие линейности: раскройте квадрат и примените её. Заодно из неотрицательности дисперсии сразу следует E[X2](E[X])2E[X^2] \ge (E[X])^2 — тот же Йенсен для g(x)=x2g(x) = x^2.

Вычислять дисперсию по формуле E[X2](E[X])2E[X^2] - (E[X])^2 в коде — плохая идея, когда величины большие: два близких числа вычитаются, и значащие цифры сокращаются. Это catastrophic cancellation, знакомое из блока 2. Численные библиотеки используют алгоритм Уэлфорда — один проход и никакого вычитания больших величин.

Подвигайте параметры и сравните среднее с формой распределения. У экспоненциального среднее заметно правее пика — асимметрия сдвигает центр масс:

λ 1

плотность p(x)

F(x) = P(X ≤ x)

отметка x 2.5
E[X]
1
Var(X)
1
P(X ≤ x)
0.918
Пик плотности в нуле, а среднее равно 1/λ — правее. У асимметричных распределений среднее и мода не совпадают, и «типичное значение» перестаёт быть однозначным понятием.

Случай α=β=0.5\alpha = \beta = 0.5 стоит рассмотреть отдельно: среднее равно 0.50.5, а плотность именно там минимальна — распределение U-образное, вещество собрано у краёв. Центр масс не обязан лежать там, где много вероятности.

Закон полного ожидания

E[X]=E[E[XY]]E[X] = E\bigl[E[X \mid Y]\bigr]

Внутреннее ожидание берётся по XX при фиксированном YY и является функцией от YY, то есть само случайной величиной. Внешнее усредняет её по YY.

Читается как «разбей на случаи и усредни»: посчитай среднее в каждом сценарии, потом усредни по вероятностям сценариев. Это прямой аналог формулы полной вероятности, и техника та же — свести задачу к более простым, обусловившись на чём-нибудь.

Похожая формула для дисперсии:

Var(X)=E[Var(XY)]+Var(E[XY])\operatorname{Var}(X) = E[\operatorname{Var}(X \mid Y)] + \operatorname{Var}(E[X \mid Y])

Это разложение дисперсии на «внутригрупповую» и «межгрупповую», и именно оно стоит за разложением на смещение и разброс в следующих уроках.

Ожидание в машинном обучении

Почти каждая функция потерь — это ожидание:

L(θ)=E(x,y)D[(fθ(x),y)]L(\theta) = E_{(\mathbf{x}, y) \sim \mathcal{D}}\bigl[\ell(f_\theta(\mathbf{x}), y)\bigr]

и оценивается оно средним по батчу. Отсюда два факта, к которым мы вернёмся:

  • батч даёт несмещённую оценку лосса и его градиента — по линейности;
  • дисперсия этой оценки падает как 1/B1/B по размеру батча, а не как 1/B21/B^2.

Первый факт делает SGD законным, второй объясняет, почему увеличение батча даёт убывающую отдачу. Обоим будет посвящён урок в блоке 5.

Источники

Проверки

0 из 2
  1. Что можно, а что нельзя

    Отметьте все утверждения, верные для любых случайных величин XX и YY (без предположения независимости).

  2. E[g(X)] против g(E[X])

    Реализуйте moments(masses) — верните список [E[X], E[X²], (E[X])², Var(X)] для дискретной величины.

    masses — список пар [значение, вероятность].

    Формулы:

    E[X]=xxp(x),E[X2]=xx2p(x),Var(X)=E[X2](E[X])2E[X] = \sum_x x\,p(x), \qquad E[X^2] = \sum_x x^2\,p(x), \qquad \operatorname{Var}(X) = E[X^2] - (E[X])^2

    Обратите внимание, что E[X2]E[X^2] считается преобразованием значений при тех же весах — возводится в квадрат xx, а не p(x)p(x). Именно в этом и состоит разница между E[g(X)]E[g(X)] и g(E[X])g(E[X]).

    Для пустого списка верните [0, 0, 0, 0].

    функция moments

    Загрузка редактора…

    Ctrl/⌘ + Enter