Обучение с подкреплением и выравнивание
RLHF
Обучение по предпочтениям — модель Брэдли–Терри и KL-регуляризованная цель
Проблема: награды нет
Урок 010 закончился замечанием, что награда задаёт задачу целиком. Для «полезного и безвредного ответа» написать её невозможно — не потому, что трудно, а потому, что мы сами не знаем, чего хотим, в виде функции.
Зато сравнивать мы умеем: из двух ответов человек уверенно называет лучший. Отсюда конвейер из трёх шагов, и каждый решает свою задачу.
| шаг | что делает |
|---|---|
| SFT | дообучение на примерах — задаёт формат и базовое поведение |
| модель награды | превращает сравнения в скалярную функцию |
| RL | оптимизирует награду, не уходя далеко от SFT |
Из сравнений в награду
Модель Брэдли–Терри: вероятность предпочесть ответу — сигмоида разности их скрытых качеств.
Обучается это обычным максимальным правдоподобием (блок 3, урок 120): минимизируем по парам «победитель–проигравший».
Важное следствие из вида формулы: наблюдаема только
Цель RL
Максимизируем выученную награду, штрафуя уход от SFT-модели:
Это в точности задача урока 120, и её решение известно: .
Зачем нужен KL-член — три причины, и все три существенны:
- Награда выучена, а не задана. Она верна лишь там, где были данные, и оптимизатор с удовольствием найдёт места, где она ошибочно велика;
- Модель уже умеет говорить. Уход далеко от ломает беглость, которая стоила всего предобучения;
- Оценка off-policy. Как в уроке 090, при расхождении политик данные перестают говорить о новой политике.
Покрутите и посмотрите, как оптимум движется между опорной политикой и жадной по награде.
ответ вероятность
- средняя награда
- 1.6393
- KL от SFT
- 0.7094
- значение цели
- 1.2846
- β·log Z
- 1.2846
Что ломается
Overoptimisation. Награда — обученная модель, значит у неё есть ошибки. Оптимизация загоняет политику ровно в те области, где награда ошибочно велика. Характерная картина: измеренная награда растёт, а оценки людей после некоторого момента падают. Отсюда правило — следить за истинной метрикой, а не за оптимизируемой (закон Гудхарта в чистом виде).
Потеря разнообразия. KL-штраф удерживает от ухода, но при малом политика всё равно схлопывается на нескольких высоко оценённых ответах. Виджет показывает это буквально.
Смещения в разметке. Модель награды выучивает то, что нравится разметчикам, включая длину ответа, уверенный тон и форматирование. Известный эффект — систематическое удлинение ответов, при котором никакого улучшения по существу нет.
Сложность конвейера. Три модели одновременно (политика, награда, опорная), PPO со всеми его деталями из урока 110, генерация внутри цикла обучения. Именно эта сложность и мотивировала DPO.
Итог
- Награду для «хорошего ответа» написать нельзя, а сравнивать ответы можно.
- Брэдли–Терри превращает сравнения в скалярную награду; определена она с точностью до константы.
- Цель RL — та же KL-регуляризованная задача из урока 120, с решением .
- KL-член нужен по трём независимым причинам, и ни одна не косметическая.
- Основные режимы отказа: overoptimisation, потеря разнообразия, смещения разметки.
Источники
- Christiano и др. — Deep Reinforcement Learning from Human Preferences — Обучение награды по сравнениям
- Ouyang и др. — Training Language Models to Follow Instructions (InstructGPT) — Полный конвейер RLHF для языковых моделей
- Gao, Schulman, Hilton — Scaling Laws for Reward Model Overoptimisation — Что происходит при чрезмерной оптимизации выученной награды
Проверки
0 из 2Конвейер и его слабые места
Отметьте все верные утверждения о RLHF.
Модель Брэдли–Терри
Реализуйте
bradley_terry(reward_win, reward_lose)— верните[probability, loss, gradient_win, margin]:probability= , где — вероятность, которую модель приписывает наблюдённому предпочтению;loss= ;gradient_win= . Проделайте дифференцирование: производная сигмоиды даёт ;margin= .
Проверить себя можно двумя способами: при равных наградах вероятность равна , а потери — ; и производная по проигравшему всегда равна минус производной по победителю, потому что в формулу входит только разность.
Загрузка редактора…
Ctrl/⌘ + Enter