Вероятность

Независимость и условная независимость

Независимость — это «наблюдение не меняет мнения», а условная независимость лежит под всей вероятностной моделью в ML

Шаг 36 из 117 · ~30 мин

Три эквивалентных определения

События AA и BB независимы, если

P(AB)=P(A)P(B)\htmlData{k=joint}{P(A \cap B)} = \htmlData{k=product}{P(A)\,P(B)}

Равносильно (при P(B)>0P(B) > 0): P(AB)=P(A)P(A \mid B) = P(A). И это формулировка, которую стоит держать главной: знание о BB не меняет мнения об AA.

Симметричность видна из первой формы: если BB ничего не сообщает об AA, то и AA ничего не сообщает о BB. Через условные вероятности это неочевидно, через произведение — сразу.

Проверьте на квадрате из прошлого урока: выставьте чувствительность и частоту ложных срабатываний равными. Тест перестанет различать больных и здоровых, и posterior совпадёт с prior при любом его значении:

H и E: 0.2 ¬H и E: 0.3
P(H) 0.4
P(E|H) 0.5
P(E|¬H) 0.5
P(H)
0.4
P(E)
0.5
P(H|E)
0.4

Условные вероятности совпали: P(E|H) = P(E|¬H) = P(E). Наблюдение E независимо от H, и posterior равен prior — подвигайте prior и убедитесь, что равенство держится при любом его значении.

Разведите ползунки — и posterior немедленно поедет. Независимость это в точности равенство двух условных вероятностей; любое расхождение делает наблюдение информативным.

Что независимость не означает

Три ложных ассоциации, каждая из которых встречается регулярно.

Не «несовместность». Несовместные события (AB=A \cap B = \varnothing) как раз максимально зависимы: узнав AA, вы точно знаете, что BB не произошло. Независимые события обязаны пересекаться, если оба имеют положительную вероятность — их пересечение равно P(A)P(B)>0P(A)P(B) > 0.

Не «отсутствие причинной связи». Независимость — утверждение о числах в конкретном распределении. Зависимость не означает причинности, а независимость не означает её отсутствия: причины могут маскироваться, гася друг друга.

Не «попарная независимость даёт независимость в совокупности». Для трёх и более событий требуется, чтобы произведение работало для всех подмножеств. Бывают события попарно независимые, но не независимые втроём — классический пример с двумя монетами и событием «результаты совпали».

Условная независимость

AA и BB условно независимы при данном CC, если

P(ABC)=P(AC)P(BC)P(A \cap B \mid C) = P(A \mid C)\,P(B \mid C)

Читается так: зная CC, наблюдение BB ничего не добавляет об AA. Вся информация, которую BB несёт об AA, уже содержалась в CC.

Это понятие важнее безусловной независимости, потому что почти все вероятностные модели в машинном обучении построены на нём:

  • naive Bayes: признаки условно независимы при данном классе. Отсюда P(xy)=iP(xiy)P(\mathbf{x} \mid y) = \prod_i P(x_i \mid y) — произведение вместо неподъёмного совместного распределения;
  • скрытые марковские модели и модели состояний: будущее условно независимо от прошлого при данном настоящем. Это и есть марковское свойство;
  • графические модели: стрелки на диаграмме кодируют ровно набор условных независимостей, и ничего больше;
  • диффузия: каждый шаг зависит только от предыдущего — та же марковость.

Ни одно не следует из другого

Оба направления неверны, и оба контрпримера полезно помнить.

Условная независимость не влечёт безусловную. Пусть CC — «человек курит», AA — «кашель», BB — «жёлтые пальцы». При фиксированном CC эти симптомы независимы, но без него — заметно связаны, потому что оба указывают на курение. Общая причина создаёт зависимость.

Безусловная не влечёт условную. Два независимых броска монеты, CC — «сумма чётна». Без CC броски независимы; зная CC, первый бросок полностью определяет второй. Обусловливание на общем следствии создаёт зависимость — этот эффект называют collider bias или explaining away.

Второй случай стоит понять до конца, потому что он объясняет, почему в графических моделях направление стрелок имеет значение, а не только их наличие.

Независимость случайных величин

Для величин определение то же, но требуется для всех значений сразу:

p(x,y)=p(x)p(y)для всех x,yp(x, y) = p(x)\,p(y) \quad \text{для всех } x, y

Практические следствия, которыми будем пользоваться постоянно:

  • E[XY]=E[X]E[Y]E[XY] = E[X]E[Y] (в обратную сторону неверно);
  • Var(X+Y)=Var(X)+Var(Y)\operatorname{Var}(X + Y) = \operatorname{Var}(X) + \operatorname{Var}(Y);
  • плотность выборки ip(xi)\prod_i p(x_i) — отсюда берётся log-правдоподобие как сумма, а с ней и все MLE-выводы.

Аббревиатура iid — independent and identically distributed — означает ровно эти два условия: элементы выборки независимы и взяты из одного распределения. На этом предположении стоит вся классическая теория обучения, и нарушается оно постоянно (временные ряды, распределённый сбор данных, дубликаты в корпусе). Знать, что предположение сделано, полезнее, чем верить в него.

Источники

  • Blitzstein, Hwang — Introduction to Probability, гл. 2.5 — Независимость, условная независимость, парадоксы
  • Koller, Friedman — Probabilistic Graphical Models, гл. 3.1 — Условная независимость как основа графических моделей

Проверки

0 из 2
  1. Что означает независимость

    Отметьте все верные утверждения.

  2. Проверка независимости по таблице

    Реализуйте independent(joint) — проверьте, независимы ли две дискретные величины по их совместному распределению.

    joint — таблица вероятностей списком строк: joint[i][j] это P(X=i,Y=j)P(X = i, Y = j). Величины независимы, когда для всех пар

    P(X=i,Y=j)=P(X=i)P(Y=j)P(X=i, Y=j) = P(X=i)\,P(Y=j)

    где маргинальные получаются суммированием: P(X=i)P(X=i) — сумма строки ii, P(Y=j)P(Y=j) — сумма столбца jj.

    Верните true или false (в Python True/False). Сравнивайте с допуском 1e-9: таблицы содержат дроби, и точного равенства ждать нельзя.

    Это упражнение на маргинализацию не меньше, чем на независимость: суммирование по одной оси — операция, которая будет встречаться до конца курса.

    функция independent

    Загрузка редактора…

    Ctrl/⌘ + Enter