Теория информации

Взаимная информация

Сколько знание одной величины говорит о другой — и почему это KL от независимости

Шаг 58 из 117 · ~30 мин

Три определения одной величины

I(X;Y)=H(X)+H(Y)H(X,Y)=KL(p(x,y)p(x)p(y))\htmlData{k=mi}{I(X;Y)} = H(X) + H(Y) - H(X,Y) = \htmlData{k=kl}{\text{KL}\big(p(x,y) \,\big\|\, p(x)p(y)\big)}

Три эквивалентные записи, и все три полезны:

  • H(X)+H(Y)H(X,Y)H(X) + H(Y) - H(X,Y) — «сколько неопределённости учтено дважды», если считать величины по отдельности;
  • H(Y)H(YX)H(Y) - H(Y \mid X) — насколько знание XX сокращает неопределённость YY;
  • — насколько реальность расходится с гипотезой независимости.

Третья запись — самая содержательная, потому что из неё сразу следуют оба ключевых свойства. I0I \ge 0 — потому что любая KL неотрицательна. А I=0I = 0 тогда и только тогда, когда XX и YY независимы — потому что KL обращается в нуль только при совпадении распределений, а совпадение здесь и есть определение независимости.

То есть «независимость» и «нулевая взаимная информация» — не связанные факты, а одно и то же утверждение, записанное дважды.

На решётке

Виджет показывает совместное распределение рядом с произведением его маргинальных. Независимость — это состояние, когда две картинки совпадают.

совместное p(x, y)

y=0y=1
x=00.40.1
x=10.10.4

если бы были независимы

y=0y=1
x=00.250.25
x=10.250.25
x=0 · y=0 0.4
x=0 · y=1 0.1
x=1 · y=0 0.1
x=1 · y=1 0.4
H(X)
1
H(Y)
1
H(X, Y)
1.7219
I(X; Y)
0.2781 бит
H(Y | X)
0.7219

Три состояния стоит пройти кнопками:

  • независимые: решётки совпадают, I=0I = 0, а H(X,Y)=H(X)+H(Y)=2H(X,Y) = H(X) + H(Y) = 2 бита. Энтропии складываются ровно тогда, когда информации не разделяют;
  • YY определён XX: I=1I = 1 бит, H(X,Y)=1H(X,Y) = 1 бит. Совместная энтропия равна энтропии одной величины — вторая ничего не добавляет;
  • частичная связь ([[4,1],[1,4]][[4,1],[1,4]]): I=0.278I = 0.278 бита. Знание XX сокращает неопределённость YY примерно на четверть бита, но не устраняет её.

Границы и что из них следует

0  I(X;Y)  min(H(X), H(Y))0 \ \le \ I(X;Y) \ \le \ \min\big(H(X),\ H(Y)\big)

Верхняя граница достигается, когда одна величина определяет другую. Отсюда важное практическое ограничение: взаимная информация ограничена энтропией своих аргументов. Дискретная метка из десяти классов несёт не более log210=3.32\log_2 10 = 3.32 бита, сколько бы информации ни было в изображении.

Полезные тождества, все — переписывания одного:

тождествочитается как
I(X;Y)=H(Y)H(YX)I(X;Y) = H(Y) - H(Y\mid X)сокращение неопределённости YY
I(X;X)=H(X)I(X;X) = H(X)величина знает о себе всё
H(X,Y)=H(X)+H(YX)H(X,Y) = H(X) + H(Y\mid X)цепное правило
I(X;Y)=0    XYI(X;Y) = 0 \iff X \perp Yнезависимость

Второе стоит отметить: энтропия — это взаимная информация величины с собой, откуда её второе имя, «собственная информация».

Чем MI отличается от корреляции

Это главная причина, по которой её вообще используют.

корреляция ρ\rhoвзаимная информация
ловитлинейную связьлюбую зависимость
=0= 0 означаетнет линейной связинезависимость
инвариантна клинейным преобразованиямлюбым обратимым

Классический пример: Y=X2Y = X^2 при XN(0,1)X \sim \mathcal{N}(0,1). Корреляция равна нулю — связь идеально нелинейна и симметрична. Взаимная информация велика: зная XX, вы знаете YY полностью.

Третья строка — то, за что MI ценят в представлениях. Она не зависит от того, в каких координатах записаны величины: якобианы в KL сокращаются (это урок 180 блока 3). Поэтому II измеряет связь между величинами, а не между их конкретными кодировками, и осмысленна для сравнения слоёв сети, у которых масштабы активаций разные.

Почему её трудно оценивать

Честная оговорка, без которой урок был бы вредным. По выборке взаимная информация оценивается плохо:

  • оценки по гистограммам смещены вверх, и смещение растёт с числом бинов. На конечной выборке независимые величины почти всегда дают I^>0\hat{I} > 0;
  • в непрерывном случае II может быть бесконечной (например, при Y=XY = X), поэтому «оценить II» иногда некорректно поставленная задача;
  • вариационные оценки (MINE, InfoNCE) дают нижние границы, и их дисперсия растёт экспоненциально с величиной самой II.

Отсюда практическое правило: взаимная информация — превосходный инструмент для рассуждений и рискованный для измерений. Утверждения вида «в этом слое 2.72.7 бита информации о метке» стоит читать со скидкой на метод оценки. Контрастивное обучение, кстати, работает несмотря на это: InfoNCE — плохая оценка II, но хорошая функция потерь, и это разные требования.

Источники

  • Cover, Thomas — Elements of Information Theory, гл. 2.3–2.5 — Взаимная информация, условная энтропия, цепное правило
  • Poole и др. — On Variational Bounds of Mutual Information — Почему MI трудно оценивать и что с этим делают

Проверки

0 из 2
  1. Свойства взаимной информации

    Отметьте все верные утверждения о взаимной информации.

  2. Взаимная информация на решётке

    Дана таблица ненормированных весов weights — совместное распределение двух дискретных величин, строки это XX, столбцы это YY. Нормируйте и верните [h_x, h_y, h_xy, mi, h_y_given_x] в битах:

    • h_x, h_y — энтропии маргинальных;
    • h_xy — энтропия совместного (по всем ячейкам сразу);
    • mi = H(X)+H(Y)H(X,Y)H(X) + H(Y) - H(X,Y);
    • h_y_given_x = H(X,Y)H(X)H(X,Y) - H(X).

    Ячейки с нулевой вероятностью пропускайте, соглашение 0log0=00\log 0 = 0.

    Три тождества, которыми стоит проверить себя, — все обязаны выполняться до последней цифры: H(X,Y)=H(X)+H(YX)H(X,Y) = H(X) + H(Y\mid X), затем I=H(Y)H(YX)I = H(Y) - H(Y\mid X), и наконец I=ijpijlog2pijpipjI = \sum_{ij} p_{ij}\log_2\frac{p_{ij}}{p_i p_j} — то есть KL совместного от произведения маргинальных.

    функция mi_facts

    Загрузка редактора…

    Ctrl/⌘ + Enter