Вероятность
Предельные теоремы
ЗБЧ, ЦПТ и неравенства концентрации — что именно они обещают и чего не обещают
Два разных утверждения
Закон больших чисел и центральная предельная теорема говорят о одном и том же выборочном среднем, но отвечают на разные вопросы. Их постоянно путают, потому что оба «про то, что среднее сходится».
отвечает куда: среднее сходится к ожиданию. Утверждение о пределе и только о нём; отвечает как быстро и какой формы отклонение: масштаб , форма — гауссова, независимо от того, из какого распределения пришли данные.
Второе — сильнее и удивительнее. Форма предельного распределения не зависит от исходного: сумма многих независимых слагаемых забывает, откуда они, и оставляет от них только и . Именно поэтому гауссиана встречается везде, где что-то складывается.
Множитель здесь не украшение. Без него левая часть сошлась бы к нулю (это и есть ЗБЧ), а с ним предел нетривиален — то есть ровно тот масштаб, на котором отклонение видно. Это тот же , что был в уроке про Монте-Карло, и теперь понятно, откуда он: он не про метод, а про суммы.
Кривая наивной оценки в виджете — иллюстрация обоих утверждений сразу: она сходится (ЗБЧ), и её колебания сжимаются как , а не как (ЦПТ). Поставьте , чтобы попаданий было много, и увеличьте .
- попаданий
- 291 / 2000
- выборочное среднее · оценка
- 1.455e-1
- выборочное среднее · ст. ошибка
- 7.89e-3
Чего требует ЗБЧ
Условие одно и его легко потерять: ожидание должно существовать. Если нет, никакой сходимости не будет — не медленной, а никакой.
Классический контрпример — распределение Коши. У него нет ожидания (интеграл расходится), и выборочное среднее независимых наблюдений Коши само распределено как Коши — с теми же параметрами, что одно наблюдение. Усреднение не даёт ровно ничего.
Проверяется это численно и выглядит убедительно:
| | доля прогонов с | максимум | |---|---|---| | | | | | | | | | | | | | | | |
Доля не падает, а держится ровно на половине — и это не шум, а точное значение . Десять тысяч наблюдений знают о центре не больше, чем одно.
Практическая мораль: тяжёлые хвосты ломают не точность, а сам метод. Если у величины, которую вы усредняете, дисперсия бесконечна или ожидания нет, средние значения по батчам — не оценка, а случайные числа. Это реальная причина градиентного клипования.
Насколько быстро работает ЦПТ
«При можно считать нормальным» — фольклор, а не теорема. Скорость сходимости зависит от асимметрии исходного распределения. Для , у которого асимметрия равна :
| предел ЦПТ |
При ошибка ещё почти , а при — около . Сходимость есть, но она медленная (теорема Берри–Эссеена даёт скорость , а не экспоненциальную), и в хвостах хуже, чем в центре. Считать -значение по нормальной аппроксимации на трёх десятках наблюдений — плохая идея.
Неравенства концентрации
ЦПТ — приближение, а не оценка: она не даёт границы, верной при конкретном . Для границ есть неравенства, и их три уровня.
Маркова — для неотрицательной величины: . Требует только ожидания, и оттого слаба:
| для | граница Маркова | |
|---|---|---|
Разрыв растёт: на граница завышена в две тысячи раз. Зато она верна всегда.
Чебышёва — используем ещё и дисперсию: . Убывает полиномиально.
Хёфдинга — для среднего ограниченных независимых величин:
Убывает экспоненциально по , и это качественный скачок. Сравним все три на выборочном среднем монеты:
| точно | Чебышёв | Хёфдинг | ЦПТ (приближение) | ||
|---|---|---|---|---|---|
Читается так. При малых и малых обе границы вырождаются в бесполезное «не больше единицы». При Чебышёв всё ещё даёт — в шестьдесят раз хуже истины, — а Хёфдинг подбирается к . ЦПТ ближе всех, но она не граница: её значение может оказаться и ниже истинного, что для гарантии недопустимо.
Отсюда разделение труда, которое стоит запомнить:
- нужна гарантия (bound на риск, PAC-оценка, дифференциальная приватность) — Хёфдинг и его родня, ценой пессимизма;
- нужна оценка (доверительный интервал, стандартная ошибка, размер выборки для A/B-теста) — ЦПТ, ценой того, что это приближение.
Условие Хёфдинга — ограниченность величин — тоже не формальность. Для неограниченных нужны субгауссовы или субэкспоненциальные предположения, и в анализе SGD в блоке 5 именно они и будут стоять в условиях теорем о сходимости.
Источники
- Blitzstein, Hwang — Introduction to Probability, гл. 10 — ЗБЧ, ЦПТ, неравенства
- Boucheron, Lugosi, Massart — Concentration Inequalities, гл. 2 — Хёфдинг и субгауссовы хвосты
Проверки
0 из 2Что обещают предельные теоремы
Отметьте все верные утверждения о ЗБЧ, ЦПТ и неравенствах концентрации.
Чебышёв против Хёфдинга
Оцениваем вероятность успеха монеты по броскам. Величины лежат в , их дисперсия не превосходит .
Реализуйте
concentration(n, eps, delta)— верните список[chebyshev, hoeffding, n_chebyshev, n_hoeffding]:chebyshev= — граница Чебышёва на ;hoeffding= ;n_chebyshev= — сколько сэмплов нужно, чтобы граница Чебышёва не превосходила ;n_hoeffding= — то же для Хёфдинга.
Последние два получаются приравниванием соответствующей границы к и решением относительно . Округлять не нужно — верните вещественные числа.
Загрузка редактора…
Ctrl/⌘ + Enter