Обучение с подкреплением и выравнивание
Преимущество и GAE
Непрерывное семейство между TD и Монте-Карло, задаваемое одним числом
Между двумя крайностями
Урок 050 показал два способа оценить возврат: полный наблюдённый (Монте-Карло, несмещён, шумен) и одношаговый с бутстрэппингом (TD, смещён, спокоен). Между ними есть непрерывное семейство:
При это TD, при — Монте-Карло. Вопрос «какое » не имеет хорошего ответа, и GAE решает его иначе: взять все сразу, с экспоненциальными весами.
Что приятно: считается это одним обратным проходом по эпизоду, рекуррентно.
Никаких сумм по — одна строка кода.
Крайние случаи и то, что между
Возьмём и :
| что это | ||
|---|---|---|
| ровно , то есть TD | ||
| почти TD | ||
| рабочее значение | ||
| сумма всех , то есть Монте-Карло |
Заметьте, что при ответ равен первой невязке, а при — их дисконтированной сумме . Оба предела проверяются подстановкой в формулу.
| при | горизонт |
|---|---|
| шага | |
| шага | |
| шага |
То есть — не абстрактный коэффициент, а ответ на вопрос «на сколько шагов вперёд мы доверяем наблюдениям, прежде чем положиться на ». Именно поэтому рабочие значения лежат около : десятки шагов обычно достаточно, чтобы увидеть последствия действия, и мало, чтобы набрать шум всего эпизода.
Два дисконта, а не один
Тонкость, которую стоит различать. В GAE фактически два параметра дисконтирования:
| что делает | |
|---|---|
| задаёт задачу: какие последствия вообще важны | |
| задаёт оценку: как далеко доверять выборке |
Смешивать их не стоит: менять нельзя, не меняя того, что оптимизируется (урок 010), а — можно свободно, это чисто статистический выбор. На практике обе ручки крутят вместе, и это источник путаницы: ухудшение при означает другую задачу, а при — другой компромисс смещения и дисперсии в той же задаче.
рука вероятность
- ожидаемая награда
- 1.985
- дисперсия градиента
- 0.0296
- смещение оценки
- 3.6e-3
- базовая линия
- 1.985
Вес равен награде минус ожидаемая награда — то есть ровно преимущество.
Что даёт преимущество вместо возврата
Собирая уроки 020, 070 и этот, получаем цепочку замен, каждая из которых снижает дисперсию:
| вес в градиенте | недостаток |
|---|---|
| , весь эпизод | награды до момента не относятся к делу |
| , reward-to-go | абсолютный уровень награды добавляет шум |
| шум всей оставшейся траектории | |
| смещение из-за неточной |
Последняя строка честно называет цену. GAE смещён при , и смещение тем больше, чем хуже . Отсюда практическое следствие: качество критика определяет, какое можно себе позволить. С плохо обученной малое вредно, потому что вся оценка опирается на неё; с хорошей — выгодно.
Итог
- Между TD и Монте-Карло лежит семейство -шаговых оценок; GAE усредняет их с весами .
- Считается одним обратным проходом: .
- даёт TD, — Монте-Карло; проверяется подстановкой.
- Эффективный горизонт оценки равен — это и есть смысл .
- задаёт задачу, — оценку; путать их нельзя.
- Смещение GAE зависит от качества критика, и это ограничивает выбор .
Источники
- Schulman и др. — High-Dimensional Continuous Control Using Generalized Advantage Estimation — GAE, вывод и эксперименты
- Sutton, Barto — Reinforcement Learning, An Introduction — Глава 12, следы приемлемости и TD(λ)
Проверки
0 из 2Что задаёт λ
Отметьте все верные утверждения о GAE.
Обратный проход GAE
Реализуйте
gae(rewards, values, gamma, lam). Спискиrewardsиvaluesимеют одинаковую длину ; ценность за концом эпизода считайте нулевой. Верните[first_delta, first_advantage, last_advantage, effective_horizon]:- , где — верните ;
first_advantageиlast_advantage— значения и , посчитанные обратной рекуррентностью с ;effective_horizon= .
Проверить себя можно так:
last_advantageвсегда равно — за последним шагом суммировать нечего, и на него не влияет.Загрузка редактора…
Ctrl/⌘ + Enter