Вероятность

Непрерывные распределения

Равномерное, нормальное, экспоненциальное, плюс Бета и Дирихле как сопряжённые

Шаг 41 из 117 · ~30 мин

Равномерное

p(x)=1ba  на [a,b],E[X]=a+b2,Var(X)=(ba)212p(x) = \frac{1}{b-a} \ \text{ на } [a,b], \qquad E[X] = \frac{a+b}{2}, \qquad \operatorname{Var}(X) = \frac{(b-a)^2}{12}

Простейшее и самое полезное как строительный блок: генератор случайных чисел выдаёт U(0,1)U(0,1), а из него получают всё остальное. Метод обратной CDF из урока про сэмплирование опирается именно на это.

Множитель 1/121/12 в дисперсии обычно вызывает недоумение. Он берётся из интеграла 1/21/2t2dt=1/12\int_{-1/2}^{1/2} t^2\,dt = 1/12 — просто константа геометрии отрезка.

Нормальное

p(x)=1σ2πexp ⁣((xμ)22σ2)p(x) = \htmlData{k=norm}{\frac{1}{\sigma\sqrt{2\pi}}}\,\exp\!\left(\htmlData{k=exp}{-\frac{(x-\mu)^2}{2\sigma^2}}\right)

Всё содержание — в : квадрат отклонения от центра, отнесённый к дисперсии. — техническая константа, и в выкладках её почти всегда прячут в \propto.

Три причины, по которым нормальное распределение доминирует:

  1. ЦПТ: суммы независимых величин сходятся к нему почти независимо от того, что суммируется. Урок про предельные теоремы — об этом.
  2. Замкнутость: сумма гауссиан гауссовская, маргинал гауссианы гауссовский, условное распределение гауссианы гауссовское. Ни одно другое семейство не так удобно.
  3. Максимум энтропии при заданной дисперсии — то есть это наименее информативное предположение, если известен только разброс. Вернёмся к этому в блоке 4.

Правило 2σ2\sigma / 3σ3\sigma: внутри двух стандартных отклонений лежит около 95.4%95.4\% вероятности, внутри трёх — около 99.7%99.7\%. Проверьте отметкой на виджете: поставьте μ=0\mu = 0, σ=1\sigma = 1 и найдите x=2x = 2 — CDF даст примерно 0.9770.977, то есть 2.3%2.3\% в правом хвосте.

Экспоненциальное

p(x)=λeλx (x0),E[X]=1λ,Var(X)=1λ2p(x) = \lambda e^{-\lambda x} \ (x \ge 0), \qquad E[X] = \frac{1}{\lambda}, \qquad \operatorname{Var}(X) = \frac{1}{\lambda^2}

Время до события при постоянной интенсивности — непрерывный напарник распределения Пуассона. Отличительное свойство — отсутствие памяти:

P(X>s+tX>s)=P(X>t)P(X > s + t \mid X > s) = P(X > t)

Прождав час, вы не приблизились к событию: остаточное время распределено так же, как исходное. Это единственное непрерывное распределение с таким свойством, и именно оно делает экспоненциальное удобным в моделях отказов и в марковских процессах — а также подозрительным как модель реального ожидания, где память обычно есть.

Бета и Дирихле — обзорно

Бета живёт на [0,1][0,1], а значит годится как распределение самой вероятности:

p(x)xα1(1x)β1,E[X]=αα+βp(x) \propto x^{\alpha-1}(1-x)^{\beta-1}, \qquad E[X] = \frac{\alpha}{\alpha+\beta}

Она сопряжена к Бернулли: если prior это Beta(α,β)\text{Beta}(\alpha, \beta), а наблюдали ss успехов и ff неудач, то posterior это Beta(α+s,β+f)\text{Beta}(\alpha + s, \beta + f). Обновление сводится к прибавлению счётчиков — никаких интегралов.

Отсюда и трактовка параметров как «псевдонаблюдений»: Beta(1,1)\text{Beta}(1,1) равномерно и означает «ничего не знаю», Beta(2,2)\text{Beta}(2,2) — «видел по одному исходу каждого вида». Сглаживание Лапласа (прибавить единицу к счётчикам) — это буквально Beta(1,1)\text{Beta}(1,1) prior, и в уроке про MAP мы это увидим.

Дирихле — обобщение на KK исходов, сопряжённое к категориальному. Ту же роль играет в тематических моделях и всюду, где нужно распределение над вектором вероятностей.

μ 0
σ 1

плотность p(x)

F(x) = P(X ≤ x)

отметка x 0
E[X]
0
Var(X)
1
P(X ≤ x)
0.5
Поставьте μ = 0, σ = 1 и отметку на x = 2: CDF покажет около 0.977. Внутри ±2σ лежит примерно 95.4% вероятности, по 2.3% в каждом хвосте.

Поэкспериментируйте с Бета: начните с α=β=1\alpha = \beta = 1 (плоское) и увеличивайте α\alpha — распределение съезжает вправо и сужается. Так выглядит накопление свидетельств в пользу успеха.

Сводка

распределениеносительсреднеедисперсия
U(a,b)U(a,b)[a,b][a,b]a+b2\frac{a+b}{2}(ba)212\frac{(b-a)^2}{12}
N(μ,σ2)\mathcal{N}(\mu,\sigma^2)R\Rμ\muσ2\sigma^2
Exp(λ)\text{Exp}(\lambda)[0,)[0,\infty)1λ\frac{1}{\lambda}1λ2\frac{1}{\lambda^2}
Beta(α,β)\text{Beta}(\alpha,\beta)[0,1][0,1]αα+β\frac{\alpha}{\alpha+\beta}αβ(α+β)2(α+β+1)\frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}

Носитель — это то, на что стоит смотреть первым при выборе распределения. Модель, приписывающая ненулевую вероятность отрицательному времени ожидания, неверна вне зависимости от того, насколько хорошо она подогнана.

Источники

  • Blitzstein, Hwang — Introduction to Probability, гл. 5 — Непрерывные распределения, нормальное, экспоненциальное
  • Bishop — Pattern Recognition and Machine Learning, гл. 2.2–2.3 — Бета и Дирихле как сопряжённые приоры, гауссиана

Проверки

0 из 2
  1. Свойства непрерывных семейств

    Отметьте все верные утверждения.

  2. Байесовское обновление Бета-Бернулли

    Реализуйте beta_update(alpha, beta, successes, failures) — верните список [alpha_post, beta_post, mean_prior, mean_post].

    Сопряжённость Бета к Бернулли означает, что обновление это сложение:

    Beta(α,β)  s успехов, f неудач  Beta(α+s, β+f)\text{Beta}(\alpha, \beta) \ \xrightarrow{\ s \text{ успехов},\ f \text{ неудач}\ } \ \text{Beta}(\alpha + s,\ \beta + f)

    Среднее Бета-распределения равно αα+β\dfrac{\alpha}{\alpha + \beta} — посчитайте его до и после обновления.

    Задача арифметически тривиальна, и это намеренно: смысл в том, чтобы увидеть на числах, как prior соревнуется с данными. Обратите внимание в объяснении, что происходит, когда наблюдений мало, а параметры prior велики.

    функция beta_update

    Загрузка редактора…

    Ctrl/⌘ + Enter