Обучение с подкреплением и выравнивание

RLHF

Обучение по предпочтениям — модель Брэдли–Терри и KL-регуляризованная цель

Шаг 114 из 117 · ~28 мин

Проблема: награды нет

Урок 010 закончился замечанием, что награда задаёт задачу целиком. Для «полезного и безвредного ответа» написать её невозможно — не потому, что трудно, а потому, что мы сами не знаем, чего хотим, в виде функции.

Зато сравнивать мы умеем: из двух ответов человек уверенно называет лучший. Отсюда конвейер из трёх шагов, и каждый решает свою задачу.

шагчто делает
SFTдообучение на примерах — задаёт формат и базовое поведение
модель наградыпревращает сравнения в скалярную функцию
RLоптимизирует награду, не уходя далеко от SFT

Из сравнений в награду

Модель Брэдли–Терри: вероятность предпочесть y1y_1 ответу y2y_2 — сигмоида разности их скрытых качеств.

P(y1y2x)=σ(r(x,y1)r(x,y2))P(y_1 \succ y_2 \mid x) = \sigma\big(\htmlData{k=diff}{r(x,y_1) - r(x,y_2)}\big)

Обучается это обычным максимальным правдоподобием (блок 3, урок 120): минимизируем logσ(rwrl)-\log\sigma(r_w - r_l) по парам «победитель–проигравший».

Важное следствие из вида формулы: наблюдаема только . Награда определена с точностью до константы — прибавьте ко всем ответам одно и то же число, и ни одна вероятность не изменится. Это ровно та неоднозначность, которую в уроке 070 убирала базовая линия, и здесь она возникает не как удобство, а как свойство данных.

Цель RL

Максимизируем выученную награду, штрафуя уход от SFT-модели:

maxπ Eyπ[r(x,y)]βKL(ππref)\max_\pi\ \mathbb{E}_{y\sim\pi}\big[r(x,y)\big] - \beta\,\mathrm{KL}\big(\pi \,\|\, \pi_{\text{ref}}\big)

Это в точности задача урока 120, и её решение известно: π(y)πref(y)er(x,y)/β\pi^*(y) \propto \pi_{\text{ref}}(y)\,e^{r(x,y)/\beta}.

Зачем нужен KL-член — три причины, и все три существенны:

  1. Награда выучена, а не задана. Она верна лишь там, где были данные, и оптимизатор с удовольствием найдёт места, где она ошибочно велика;
  2. Модель уже умеет говорить. Уход далеко от πref\pi_{\text{ref}} ломает беглость, которая стоила всего предобучения;
  3. Оценка off-policy. Как в уроке 090, при расхождении политик данные перестают говорить о новой политике.

Покрутите β\beta и посмотрите, как оптимум движется между опорной политикой и жадной по награде.

ответ 1ответ 2ответ 3ответ 4

ответ вероятность

SFT-модель после RLHF
коэффициент β 0.5
средняя награда
1.6393
KL от SFT
0.7094
значение цели
1.2846
β·log Z
1.2846
Четвёртый ответ имеет отрицательную награду и вероятность 0.05 у SFT-модели — посмотрите, как быстро он исчезает. Третий, наоборот, редок у SFT (0.15), но выгоден: при малых β он захватывает почти всю массу. Именно это и делает RLHF — перераспределяет вероятность, не создавая новых ответов.

Что ломается

Overoptimisation. Награда — обученная модель, значит у неё есть ошибки. Оптимизация загоняет политику ровно в те области, где награда ошибочно велика. Характерная картина: измеренная награда растёт, а оценки людей после некоторого момента падают. Отсюда правило — следить за истинной метрикой, а не за оптимизируемой (закон Гудхарта в чистом виде).

Потеря разнообразия. KL-штраф удерживает от ухода, но при малом β\beta политика всё равно схлопывается на нескольких высоко оценённых ответах. Виджет показывает это буквально.

Смещения в разметке. Модель награды выучивает то, что нравится разметчикам, включая длину ответа, уверенный тон и форматирование. Известный эффект — систематическое удлинение ответов, при котором никакого улучшения по существу нет.

Сложность конвейера. Три модели одновременно (политика, награда, опорная), PPO со всеми его деталями из урока 110, генерация внутри цикла обучения. Именно эта сложность и мотивировала DPO.

Итог

  • Награду для «хорошего ответа» написать нельзя, а сравнивать ответы можно.
  • Брэдли–Терри превращает сравнения в скалярную награду; определена она с точностью до константы.
  • Цель RL — та же KL-регуляризованная задача из урока 120, с решением ππrefer/β\pi^*\propto\pi_{\text{ref}}e^{r/\beta}.
  • KL-член нужен по трём независимым причинам, и ни одна не косметическая.
  • Основные режимы отказа: overoptimisation, потеря разнообразия, смещения разметки.

Источники

Проверки

0 из 2
  1. Конвейер и его слабые места

    Отметьте все верные утверждения о RLHF.

  2. Модель Брэдли–Терри

    Реализуйте bradley_terry(reward_win, reward_lose) — верните [probability, loss, gradient_win, margin]:

    • probability = σ(rwrl)\sigma(r_w - r_l), где σ(z)=1/(1+ez)\sigma(z) = 1/(1+e^{-z}) — вероятность, которую модель приписывает наблюдённому предпочтению;
    • loss = log(probability)-\log(\texttt{probability});
    • gradient_win = lossrw\dfrac{\partial\, \texttt{loss}}{\partial r_w}. Проделайте дифференцирование: производная сигмоиды даёт (1probability)-(1 - \texttt{probability});
    • margin = rwrlr_w - r_l.

    Проверить себя можно двумя способами: при равных наградах вероятность равна 0.50.5, а потери — ln2=0.693\ln 2 = 0.693; и производная по проигравшему всегда равна минус производной по победителю, потому что в формулу входит только разность.

    функция bradley_terry

    Загрузка редактора…

    Ctrl/⌘ + Enter