Вероятность

Дисперсия, ковариация и ковариационная матрица

Ковариационная матрица симметрична и неотрицательно определена — а значит к ней применимо всё из блока 1

Шаг 39 из 117 · ~30 мин

Дисперсия: разброс в квадрате единиц

Var(X)=E[(Xμ)2],sd(X)=Var(X)\operatorname{Var}(X) = E[(X - \mu)^2], \qquad \operatorname{sd}(X) = \sqrt{\operatorname{Var}(X)}

Дисперсия измеряется в квадрате единиц исходной величины, поэтому для интерпретации берут корень. Отсюда и разное поведение при масштабировании:

Var(aX+b)=a2Var(X),sd(aX+b)=asd(X)\operatorname{Var}(aX + b) = a^2\operatorname{Var}(X), \qquad \operatorname{sd}(aX + b) = |a|\operatorname{sd}(X)

Сдвиг bb не влияет ни на то, ни на другое — разброс не зависит от того, где находится центр.

Ковариация

Cov(X,Y)=E[(XμX)(YμY)]=E[XY]E[X]E[Y]\htmlData{k=cov}{\operatorname{Cov}(X, Y) = E[(X - \mu_X)(Y - \mu_Y)]} = \htmlData{k=work}{E[XY] - E[X]E[Y]}

Знак говорит о направлении связи: положительная ковариация означает, что величины отклоняются от своих средних в одну сторону. Дисперсия — частный случай: Var(X)=Cov(X,X)\operatorname{Var}(X) = \operatorname{Cov}(X, X).

Теперь дисперсия суммы в общем виде:

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)\operatorname{Var}(X + Y) = \operatorname{Var}(X) + \operatorname{Var}(Y) + 2\operatorname{Cov}(X, Y)

Знакомое «дисперсии складываются» — это частный случай при нулевой ковариации. Стоит запомнить именно общую формулу: перекрёстный член исчезает только при некоррелированности.

Корреляция: ковариация без единиц

ρ(X,Y)=Cov(X,Y)sd(X)sd(Y)[1,1]\rho(X, Y) = \frac{\operatorname{Cov}(X, Y)}{\operatorname{sd}(X)\operatorname{sd}(Y)} \in [-1, 1]

Сравните с косинусом угла из блока 1: cosθ=x,y/(xy)\cos\theta = \langle x, y\rangle / (\|x\|\|y\|). Это та же формула, и не по аналогии. Ковариация — это скалярное произведение на пространстве центрированных случайных величин, дисперсия — квадрат нормы, а ограничение ρ1|\rho| \le 1 есть неравенство Коши–Буняковского. Некоррелированность буквально означает ортогональность.

Отсюда и предел: ρ=1|\rho| = 1 достигается ровно при линейной зависимости — то есть когда векторы коллинеарны.

Некоррелированность — не независимость

Корреляция видит только линейную связь. Классический контрпример: XX симметрична относительно нуля, Y=X2Y = X^2. Тогда

Cov(X,X2)=E[X3]E[X]E[X2]=00=0\operatorname{Cov}(X, X^2) = E[X^3] - E[X]E[X^2] = 0 - 0 = 0

потому что у симметричного распределения все нечётные моменты нулевые. Величины некоррелированы и при этом связаны настолько жёстко, насколько возможно: зная XX, вы знаете YY точно.

Независимость влечёт некоррелированность, обратное неверно. Единственное исключение — совместно гауссовский случай: для него нулевая корреляция действительно даёт независимость. Именно поэтому в гауссовских моделях позволяют себе не различать эти понятия, а вне них — нельзя.

Ковариационная матрица

Для вектора XRn\mathbf{X} \in \R^n:

Σij=Cov(Xi,Xj),Σ=E[(Xμ)(Xμ)]\Sigma_{ij} = \operatorname{Cov}(X_i, X_j), \qquad \Sigma = E\bigl[(\mathbf{X} - \boldsymbol{\mu})(\mathbf{X} - \boldsymbol{\mu})^\top\bigr]

Два свойства, из которых следует всё остальное:

  • симметричность, потому что Cov(Xi,Xj)=Cov(Xj,Xi)\operatorname{Cov}(X_i, X_j) = \operatorname{Cov}(X_j, X_i);
  • неотрицательная определённость: для любого a\mathbf{a} верно aΣa=Var(aX)0\mathbf{a}^\top\Sigma\mathbf{a} = \operatorname{Var}(\mathbf{a}^\top\mathbf{X}) \ge 0, ведь дисперсия не бывает отрицательной.

Второе — самый короткий вывод определённости, какой есть, и он объясняет, почему она возникает: квадратичная форма от Σ\Sigma это дисперсия проекции.

А значит применимо всё из блока 1: спектральная теорема даёт ортонормированный базис собственных векторов, собственные значения неотрицательны, и матрица раскладывается как Σ=QΛQ\Sigma = Q\Lambda Q^\top. Собственные векторы — главные оси разброса, то есть PCA; собственные значения — дисперсии вдоль них.

Изолинии двумерной гауссианы — это в точности эллипсы, оси которых суть собственные векторы Σ\Sigma. Пунктирные линии на картинке — они и есть:

σₓ 1
σᵥ 0.7
ρ 0.6
sd(X)
1

Что стоит проверить на виджете:

  1. Выставьте ρ=0\rho = 0: эллипс встанет по осям, Σ\Sigma станет диагональной.
  2. Включите условное распределение и подвигайте срез. Красная кривая ездит вместе с ним, а её ширина не меняется — условная дисперсия от положения среза не зависит.
  3. Сравните ширину условной кривой с маргинальной (зелёной). Условная всегда уже: знание YY уменьшает неопределённость в XX.
  4. Доведите ρ\rho почти до единицы: эллипс превратится в отрезок, а условная кривая станет очень узкой.

Условное распределение гауссианы

Формулы, которые виджет и показывает (при нулевых средних):

E[XY=y]=ρσXσYy,Var(XY=y)=σX2(1ρ2)E[X \mid Y = y] = \rho\,\frac{\sigma_X}{\sigma_Y}\,y, \qquad \operatorname{Var}(X \mid Y = y) = \sigma_X^2\,(1 - \rho^2)

Три наблюдения, каждое из которых существенно:

  • условное распределение снова гауссовское — семейство замкнуто относительно обусловливания, и именно это делает гауссовские модели удобными;
  • условное среднее линейно по yy — отсюда линейная регрессия как условное ожидание;
  • условная дисперсия не зависит от yy. Уменьшение неопределённости одинаково, какое бы значение вы ни узнали, — и множитель (1ρ2)(1-\rho^2) показывает, насколько.

Последний пункт объясняет, почему ρ2\rho^2 называют долей объяснённой дисперсии: при ρ=0.6\rho = 0.6 остаётся 10.36=64%1 - 0.36 = 64\% исходной дисперсии.

Источники

Проверки

0 из 2
  1. Ковариация и корреляция

    Отметьте все верные утверждения.

  2. Ковариационная матрица выборки

    Реализуйте covariance(rows) — выборочную ковариационную матрицу.

    rows — список наблюдений, каждое наблюдение это список признаков одинаковой длины. Нужно вернуть матрицу d×dd \times d, где

    Σij=1n1k=1n(xi(k)xˉi)(xj(k)xˉj)\Sigma_{ij} = \frac{1}{n-1}\sum_{k=1}^{n} (x^{(k)}_i - \bar{x}_i)(x^{(k)}_j - \bar{x}_j)

    Делитель n − 1, а не n: это несмещённая оценка, и почему именно так — будет в уроке про смещение оценки. Пока достаточно того, что так делают библиотеки по умолчанию.

    Требования:

    • центрируйте данные: вычтите среднее каждого признака. Пропустив это, получите матрицу вторых моментов, а не ковариаций;
    • при n < 2 верните null (в Python None) — по одному наблюдению разброс не оценить.

    Результат обязан быть симметричным, а на диагонали стоять выборочные дисперсии. Это две бесплатные проверки вашего кода.

    функция covariance

    Загрузка редактора…

    Ctrl/⌘ + Enter