Вероятность
Словарь теории меры
Почти наверное, носитель, dP/dQ — что эти слова означают на практике и зачем их знать
Зачем вообще
Теория меры нужна не для того, чтобы переписать вероятность строго. Она нужна, потому что без неё часть утверждений в статьях по машинному обучению просто не читается: « и имеют общий носитель», «сходится почти наверное», «». Это не украшения — в каждом случае за словом стоит условие, при нарушении которого формула перестаёт работать.
Цель урока скромная: не построить теорию, а перевести шесть выражений на язык, на котором с ними можно работать.
у непрерывной величины
Самый частый камень преткновения. Если непрерывна, то — и это не значит «невозможно».
Разрешается противоречие тем, что «невозможно» и «имеет нулевую вероятность» — разные утверждения. Невозможное событие — пустое множество. А вот отрезок содержит несчётно много точек, и если бы каждая имела вероятность , сумма превысила бы единицу для любого . Значит, каждая обязана иметь ноль, хотя одна из них непременно случится.
Увидеть разницу можно на CDF: у дискретной величины она лестница, и высота скачка в точке равна ; у непрерывной — непрерывная кривая, и скачков нет вовсе. Переключайте семейства в виджете и следите за нижним графиком.
вероятности P(X = k)
F(x) = P(X ≤ x) — есть ли скачки?
- среднее
- 0.35
- дисперсия
- 0.227
- P(X ≤ x)
- 0.65
Практическое следствие, которое вылезает в коде: непрерывная модель никогда не выдаёт «вероятность наблюдения». Вопрос «какова вероятность, что моя модель предсказала именно » некорректен; корректен вопрос о плотности в точке или о вероятности интервала. Отсюда и то, что log-likelihood непрерывной модели бывает положительным (мы это видели на MSE), тогда как у дискретной он всегда отрицателен.
Почти наверное
Три места, где это слово несёт смысл:
- ЗБЧ: почти наверное. Существуют последовательности бросков, где среднее не сходится (например, все орлы) — их множество непусто, но его мера равна нулю;
- функции равны п.в.: две плотности, различающиеся в одной точке, задают одно и то же распределение. Поэтому плотность определена не однозначно, а с точностью до множества нулевой меры;
- ReLU дифференцируема п.в.: излом в нуле — одна точка, и вероятность попасть в неё ровно нулевая. Это и есть строгое оправдание того, что автоград назначает произвольно и ничего не ломается.
Носитель
Условие «носитель содержит носитель » встречается постоянно, и всегда по одной причине: если там, где , то отношение там не определено, а .
| задача | что требуется |
|---|---|
| importance sampling | , иначе оценка смещена |
| , иначе бесконечность | |
| off-policy RL | , иначе отношение неопределено |
| нормализующие потоки | преобразование обратимо на носителе |
Отсюда сугубо практическое правило: предложение всегда шире цели. Гауссиана с запасом по , распределение с тяжёлыми хвостами, политика с -шумом — всё это способы обеспечить покрытие носителя, и все они стоят части эффективности. Обратная ошибка бесплатной не бывает.
Производная Радона–Никодима
— это «отношение плотностей», записанное так, чтобы не выбирать базовую меру. Когда обе меры имеют плотности относительно одной и той же базовой (обычно Лебега или счётной), это буквально
Существует эта производная тогда, когда абсолютно непрерывна относительно (), то есть — тот же самый разговор про носитель, произнесённый на языке мер.
Где вы это уже видели, не зная названия:
- вес importance sampling — это ;
- — блок 4;
- отношение вероятностей политик в PPO — тоже она;
- логарифм этого отношения в normalizing flows складывается по слоям.
То есть одно понятие обслуживает четыре разных сюжета курса, и запись через означает лишь «отношение мер, без привязки к тому, чем мы их измеряем».
Измеримое множество и борелевские
Два слова, которые встречаются в формулировках теорем и почти никогда — в выводах. Знать их стоит ровно настолько, чтобы фраза не останавливала чтение.
-алгебра — это набор подмножеств , которому мы согласились приписывать вероятность: он содержит само и замкнут относительно дополнения и счётного объединения. Элементы и называются измеримыми множествами, они же события. Слово «счётного» здесь несёт всю нагрузку: именно оно позволяет говорить о пределах последовательностей событий — а без пределов нет ни ЗБЧ, ни сходимости почти наверное из этого урока.
Борелевская -алгебра на — наименьшая -алгебра, содержащая все интервалы; её элементы и есть борелевские множества. Практически это значит: любой интервал, любое открытое и любое замкнутое множество, любое их счётное объединение или пересечение — борелевское. Придумать неборелевское множество, не привлекая аксиому выбора, нельзя, и это ровно то, что имеется в виду, когда теорему формулируют «для всякого борелевского »: оговорка есть, но исключить она может лишь то, что вы всё равно никогда не напишете.
Здесь же становится понятно, зачем в блоке 0 отдельно разбирался прообраз. Случайная величина — это функция , измеримая в том смысле, что
То есть требование ровно одно: у вопроса «попало ли в » обязана быть вероятность. Запись , с которой начинается CDF, законна именно поэтому — борелевский, значит его прообраз измерим. Никакая функция, встречающаяся в машинном обучении, этого условия не нарушает.
Чего мы не делаем
Ради честности: построение меры Лебега, интеграл Лебега и доказательства теорем о сходимости здесь не понадобятся, и мы их пропускаем сознательно. Стоит знать только, зачем эта техника существует — чтобы «вероятность» была определена согласованно на бесконечных пространствах и чтобы не возникало множеств, которым нельзя приписать меру (парадокс Банаха–Тарского — про это). Ни одна конструкция машинного обучения не требует работать с этим напрямую; требуется ровно словарь этого урока.
Источники
- Williams — Probability with Martingales, гл. 1–2 — Мера, измеримость, почти наверное
- Blitzstein, Hwang — Introduction to Probability, гл. 5.1–5.2 — Непрерывные величины и почему P(X = x) = 0
Проверки
0 из 2Что означают эти слова
Отметьте все верные утверждения.
Носитель решает, определена ли KL
Даны два распределения на одном конечном наборе исходов — списки
pиq, каждый суммируется в единицу.Реализуйте
kl_diagnostics(p, q)— верните[uncovered_pq, uncovered_qp, kl_pq, kl_qp]:uncovered_pq— сколько исходов, где , но . Это в точности нарушение условия ;uncovered_qp— то же в обратную сторону;kl_pq= , где слагаемые с пропускаются (соглашение ). Еслиuncovered_pqбольше нуля, верните-1.0;kl_qp— то же с переставленными аргументами, и та же оговорка про-1.0.
Сентинель
-1.0однозначен, потому что KL никогда не бывает отрицательной — это неравенство Гиббса, и оно же лучшая проверка вашей реализации.Загрузка редактора…
Ctrl/⌘ + Enter