Обучение с подкреплением и выравнивание

Модели мира

Выучить среду и планировать в ней — где это выигрывает и чем платит

Шаг 116 из 117 · ~26 мин

Вернуть модель

Уроки 030–040 показали, что с моделью среды задача решается прямо. Уроки 050 и далее обходились без неё, потому что она неизвестна. Третий вариант: выучить её.

zt=eϕ(ot),zt+1fϕ(zt,at),r^t=gϕ(zt)z_t = e_\phi(o_t),\qquad \htmlData{k=latent}{z_{t+1}} \sim \htmlData{k=dyn}{f_\phi(z_t, a_t)},\qquad \hat{r}_t = g_\phi(z_t)

Ключевое решение — предсказывать не наблюдение, а . Причина практическая: предсказывать изображение целиком дорого и в основном бессмысленно — большая часть пикселей к задаче не относится. RSSM в Dreamer делает именно это, и делит состояние на детерминированную и стохастическую части: первая несёт память, вторая — неопределённость.

Что это даёт

преимуществопочему
эффективность по даннымодна траектория обучает модель, а модель порождает сколько угодно
планированиеможно перебрать варианты, не трогая среду
переносмодель среды не зависит от награды: сменилась задача — политика новая, модель та же
безопасностьошибки происходят в воображении

Третья строка часто оказывается решающей. Модель динамики учит физику, а не цель; при смене цели её не нужно переучивать. Ценностные методы и градиент политики так не умеют — у них цель вшита в то, что они выучили.

Чем платит

Ошибки модели накапливаются. Прогноз на шаг вперёд точен, на пятьдесят — обычно нет. Планирование в неточной модели даёт планы, оптимальные для несуществующей среды, и это главный режим отказа.

Оптимизатор эксплуатирует модель. Ровно та же беда, что с выученной наградой в уроке 130: планировщик найдёт места, где модель ошибочно обещает многое. Отсюда ансамбли моделей — план оценивают по нескольким, и расхождение между ними служит признаком того, что доверять здесь нельзя.

Сложность. Вместо одной сети — три или четыре, плюс планировщик, плюс их взаимодействие.

Два способа использовать модель

подходкакцена
планирование (CEM, MPC)на каждом шаге перебрать последовательности действий, взять лучшуюдорого в момент действия
обучение политики в воображениигенерировать траектории моделью и учить на них обычный RLдёшево в момент действия

Первый способ не требует обучения политики вовсе: перебрали, сделали первый шаг плана, на следующем шаге пересчитали. CEM делает это итеративно — сэмплирует последовательности, оставляет лучшие, подтягивает к ним распределение, повторяет. Это то же самое, что было в блоке 3 (урок 170), только в пространстве планов.

Второй способ и есть Dreamer: модель порождает воображаемые траектории, actor-critic из уроков 070–080 учится на них. Реальная среда нужна только чтобы улучшать модель.

Горизонт планирования

Число, определяющее всё. Слишком короткий горизонт — близорукие планы; слишком длинный — накопленная ошибка модели превращает план в фантазию. Разумный выбор связан с тем, насколько быстро расходятся прогнозы ансамбля: планировать стоит настолько далеко, насколько модели ещё согласны между собой.

Полезно сопоставить с 11γ\frac{1}{1-\gamma} из урока 010. Там горизонт задавал задачу, здесь — предел доверия к модели, и это разные величины. Обычно второй заметно короче первого, и это нормально: короткий план плюс функция ценности на его конце покрывают длинный горизонт задачи.

0.620.730.861-0.110.73-1-0.11-0.110.62-0.11-0.11-0.11-0.11

терминал стена

дисконт γ 0.9
глубина плана 3
цена шага -0.04
горизонт 1/(1−γ)
10
значение старта
-0.108
изменение за проход
7.0e-1
проходов до сходимости
7
Число проходов здесь читается как глубина планирования: при одном проходе агент видит на шаг вперёд, при пяти — на пять. Обратите внимание, что стрелки в дальних клетках становятся осмысленными только когда глубина достигает расстояния до цели. Это и есть близорукость короткого плана — и то, что чинится функцией ценности на конце горизонта.

Итог

  • Модель мира возвращает то, что отняли уроки 050 и далее, но выученной, а не заданной.
  • Предсказывают латентное состояние, а не наблюдение: пиксели в основном не относятся к делу.
  • Главные выигрыши — эффективность по данным и независимость модели от награды.
  • Главный отказ — накопление ошибки и её эксплуатация планировщиком; лечится ансамблями.
  • Использовать модель можно планированием или обучением политики в воображении.
  • Горизонт планирования ограничен доверием к модели и обычно короче горизонта задачи.

Источники

Проверки

0 из 2
  1. Выученная среда

    Отметьте все верные утверждения о моделях мира.

  2. Накопление ошибки модели

    Пусть модель ошибается на ε\varepsilon за один шаг, а динамика растягивает уже имеющееся расхождение с коэффициентом LL (липшицева константа). Тогда накопленная за hh шагов ошибка ограничена суммой геометрической прогрессии.

    Реализуйте model_error(eps, lipschitz, horizon, gamma) — верните [accumulated, task_horizon, discount_weight, error_per_weight]:

    • accumulated = εLh1L1\varepsilon\dfrac{L^h - 1}{L - 1}, а при L=1L = 1 — просто εh\varepsilon h (обработайте этот случай отдельно, иначе получите деление на нуль);
    • task_horizon = 11γ\dfrac{1}{1-\gamma};
    • discount_weight = k=0h1γk\sum_{k=0}^{h-1}\gamma^k — суммарный вес шагов плана в дисконтированном возврате;
    • error_per_weight = accumulated / discount_weight — накопленная ошибка на единицу полезного веса плана.

    Последняя величина и есть то, что стоит минимизировать при выборе глубины: она растёт с горизонтом из-за первого множителя и падает из-за второго.

    функция model_error

    Загрузка редактора…

    Ctrl/⌘ + Enter