Обучение с подкреплением и выравнивание
Максимально энтропийное RL
Добавить энтропию в цель — и получить ту же формулу, что стоит за выравниванием
Изменить цель, а не алгоритм
До сих пор энтропия появлялась как бонус, добавляемый вручную, чтобы политика не схлопывалась. Максимально энтропийное RL делает её частью постановки:
Зачем это нужно:
| причина | что даёт |
|---|---|
| исследование | политика не схлопывается на одном действии |
| устойчивость | при равноценных действиях сохраняются оба |
| робастность | политика готова к небольшим изменениям среды |
| гладкость задачи | оптимум единственный и меняется непрерывно по параметрам |
Последняя строка недооценена. Без энтропии оптимальная политика детерминирована и меняется скачком, когда два действия меняются местами по ценности. С энтропией она меняется плавно, и оптимизация становится куда лучше себя ведущей.
Решение в замкнутой форме
Для одного состояния задача решается точно. Максимизировать при условии нормировки — это задача на условный экстремум (блок 5, урок 110), и ответ:
Оптимальная политика — softmax по ценностям с температурой . Не приближение, не эвристика — точное решение задачи с энтропийным членом.
Отсюда сразу видны пределы:
| политика | |
|---|---|
| жадная, детерминированная | |
| softmax по | |
| равномерная |
И значение оптимума тоже известно: — «мягкий максимум» вместо обычного. Отсюда и название soft actor-critic: в уравнении Беллмана заменяется на logsumexp.
Обобщение: тяга к опорной политике
Заменим энтропию на расхождение с некоторой опорной политикой :
При равномерной это в точности предыдущая задача (с точностью до константы). В общем случае решение такое же по форме:
То есть опорная политика перевзвешивается экспонентой награды. Не заменяется — перевзвешивается, и это существенно: действия, которым приписывала нулевую вероятность, останутся нулевыми при любой награде.
Проверьте оба предела и тождество с логарифмом нормировки.
действие вероятность
- ожидаемая награда
- 1.3755
- KL(π*‖π_ref)
- 0.2322
- значение цели
- 1.1433
- β·log Z
- 1.1433
Тождество, на которое стоит обратить внимание: значение оптимума равно , где . Виджет считает его двумя независимыми способами — по определению цели и через нормировку — и они совпадают при любом . Урок 140 обратит это равенство и получит из него DPO.
Почему это в блоке про выравнивание
Формула и есть цель RLHF (урок 130). Смысл там читается буквально: взять предобученную модель и перевзвесить её тем, что нравится людям, не позволяя уходить далеко.
Стоит заметить, что выбор именно KL, а не другого расхождения, здесь не случаен и не эстетичен: с KL задача имеет решение в замкнутой форме. С любым другим расхождением её пришлось бы решать численно, и вся конструкция DPO не появилась бы.
Итог
- Энтропия в цели — часть постановки, а не бонус; задаёт обменный курс.
- Оптимум — softmax по ценностям с температурой ; это точное решение.
- в уравнении Беллмана заменяется на logsumexp — отсюда «soft».
- Обобщение с опорной политикой даёт : перевзвешивание, а не замена.
- Значение оптимума равно , и это тождество лежит в основе DPO.
Источники
- Haarnoja и др. — Soft Actor-Critic — Максимально энтропийная постановка и её алгоритм
- Levine — Reinforcement Learning and Control as Probabilistic Inference — Связь с выводом в графических моделях
Проверки
0 из 2Энтропия в цели
Отметьте все верные утверждения о максимально энтропийной постановке.
Оптимум KL-регуляризованной задачи
Реализуйте
kl_optimum(reference, rewards, beta)— верните[first_probability, expected_reward, divergence, objective_via_log_z]:- оптимальная политика ; верните . Считайте через логарифмы со сдвигом на максимум — при малых экспонента иначе переполнится (блок 6, урок 060);
expected_reward= ;divergence= ;objective_via_log_z= .
Последнее число обязано равняться — то есть значению самой цели. Посчитайте его другим путём, через нормировку, и сверьте: это и есть тождество, из которого в уроке 140 выводится DPO.
Загрузка редактора…
Ctrl/⌘ + Enter