Вероятность

Многомерная гауссиана

Одна формула, в которой всё содержание — квадратичная форма от обратной ковариации

Шаг 42 из 117 · ~30 мин

Плотность

p(x)=1(2π)d/2Σ1/2exp ⁣(12(xμ)Σ1(xμ))p(\mathbf{x}) = \htmlData{k=norm}{\frac{1}{(2\pi)^{d/2}|\Sigma|^{1/2}}}\exp\!\left(-\tfrac{1}{2}\htmlData{k=maha}{(\mathbf{x}-\boldsymbol{\mu})^\top\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu})}\right)

Всё содержание — в . от x\mathbf{x} не зависит и в выкладках почти всегда прячется в \propto.

Квадратичная форма (xμ)Σ1(xμ)(\mathbf{x}-\boldsymbol{\mu})^\top\Sigma^{-1}(\mathbf{x}-\boldsymbol{\mu}) называется квадратом расстояния Махаланобиса. Это буквально скалярное произведение из блока 1 с заменённой метрикой: вместо x,y\langle x, y\rangle взято xΣ1y\mathbf{x}^\top\Sigma^{-1}\mathbf{y}. Гауссиана — это «шар» в этой метрике, и изолинии её плотности суть эллипсы, оси которых — собственные векторы Σ\Sigma.

Требование к Σ\Sigma: положительная определённость. Иначе Σ1\Sigma^{-1} не существует, Σ=0|\Sigma| = 0, и нормировка разваливается. Вырожденная гауссиана живёт в подпространстве и требует псевдообратной — тот же приём, что в блоке 1.

σₓ 1
σᵥ 0.6
ρ 0.5
sd(X)
1

Замкнутость — причина всеобщей любви

Гауссовское семейство замкнуто относительно всех операций, которые обычно нужны:

операциярезультат
маргинализация p(x)dx2\int p(\mathbf{x}) \, dx_2снова гауссиана, просто выбросьте строки и столбцы Σ\Sigma
обусловливание p(x1x2)p(\mathbf{x}_1 \mid \mathbf{x}_2)снова гауссиана, формулы ниже
сумма независимыхгауссиана с μ1+μ2\mu_1+\mu_2 и Σ1+Σ2\Sigma_1+\Sigma_2
линейное преобразование Ax+bA\mathbf{x} + \mathbf{b}гауссиана с Aμ+bA\boldsymbol{\mu}+\mathbf{b} и AΣAA\Sigma A^\top

Маргинализация особенно приятна: чтобы выбросить переменную, достаточно вычеркнуть соответствующие строку и столбец. Никаких интегралов — при том что в общем случае маргинализация это неберущийся интеграл, из-за которого существует весь блок 4.

Последняя строка — та, которой пользуются в репараметризации: μ+Lε\boldsymbol{\mu} + L\boldsymbol{\varepsilon} с εN(0,I)\boldsymbol{\varepsilon} \sim \mathcal{N}(0, I) и LL=ΣLL^\top = \Sigma даёт ровно N(μ,Σ)\mathcal{N}(\boldsymbol{\mu}, \Sigma). Разложение Холецкого LL — это «корень» из ковариационной матрицы.

Условное распределение

Разбьём вектор на две части. Тогда

μ12=μ1+Σ12Σ221(x2μ2),Σ12=Σ11Σ12Σ221Σ21\boldsymbol{\mu}_{1|2} = \boldsymbol{\mu}_1 + \Sigma_{12}\Sigma_{22}^{-1}(\mathbf{x}_2 - \boldsymbol{\mu}_2), \qquad \Sigma_{1|2} = \Sigma_{11} - \Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}

Три наблюдения, те же, что в двумерном случае из прошлого урока, но теперь в общем виде:

  • условное среднее линейно по наблюдённому x2\mathbf{x}_2 — отсюда линейная регрессия как условное ожидание гауссианы;
  • условная ковариация не зависит от x2\mathbf{x}_2 вовсе. Какое бы значение вы ни узнали, неопределённость падает одинаково;
  • вычитаемое Σ12Σ221Σ21\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21} неотрицательно определено: обусловливание никогда не увеличивает разброс.

Выражение Σ11Σ12Σ221Σ21\Sigma_{11} - \Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21} называется дополнением Шура. Оно же появится в гауссовских процессах, в фильтре Калмана и в блочном обращении матриц.

Где это работает

  • гауссовские процессы: предсказание — это условное распределение гауссианы, и формула выше буквально и есть GP-регрессия;
  • фильтр Калмана: чередование обусловливания (наблюдение) и линейного преобразования (динамика) — замкнутость гарантирует, что всё остаётся гауссовским;
  • VAE: и prior, и приближённый posterior берут гауссовскими ровно потому, что KL между двумя гауссианами считается в закрытой форме;
  • диффузия: прямой процесс добавляет гауссовский шум, и сумма гауссиан снова гауссиана — поэтому переход за tt шагов известен аналитически, без итераций.

Последний пункт стоит отметить: именно замкнутость относительно суммирования позволяет в DDPM прыгнуть сразу к произвольному шагу tt, а не идти по одному.

Источники

Проверки

0 из 2
  1. Замкнутость гауссовского семейства

    Пусть xN(μ,Σ)\mathbf{x} \sim \mathcal{N}(\boldsymbol{\mu}, \Sigma). Отметьте все верные утверждения.

  2. Условное распределение двумерной гауссианы

    Реализуйте conditional(sigma_x, sigma_y, rho, y) — параметры условного распределения XY=yX \mid Y = y для центрированной двумерной гауссианы.

    Верните список [условное среднее, условное стандартное отклонение]:

    E[XY=y]=ρσXσYy,sd(XY=y)=σX1ρ2E[X \mid Y=y] = \rho\,\frac{\sigma_X}{\sigma_Y}\,y, \qquad \operatorname{sd}(X \mid Y=y) = \sigma_X\sqrt{1-\rho^2}

    Обратите внимание, что второе выражение от y не зависит вовсе — это и есть главный факт урока. Если у вас в него попало y, формула перепутана.

    При ρ=1|\rho| = 1 условное отклонение равно нулю: зная YY, вы знаете XX точно.

    функция conditional

    Загрузка редактора…

    Ctrl/⌘ + Enter