RLHF — причина, по которой чат-боты перестали быть сырыми генераторами следующих токенов и начали отказывать в некоторых вредных запросах. Это реальный прогресс. Это также прогресс в том, чтобы выглядеть хорошо для человеческих оценщиков. Называть это «выравниванием» путает манеры под надзором с целями, которым можно доверять, когда надзор исчезает.
Это работает достаточно хорошо, чтобы легко прийти к выводу: проблема выравнивания в целом решена — мы показываем моделям, чего хотим, на примерах, и они учатся это делать. Такой вывод ошибочен, и стоит точно объяснить, почему.
Что на самом деле оптимизирует RLHF
RLHF не обучает модель разделять наши ценности. Он обучает модель выдавать результаты, которые высоко оценивает человек-оценщик или замещающая его модель вознаграждения. В большинстве случаев эти две вещи совпадают, и именно поэтому RLHF полезен. Но цель — одобрение человека, а одобрение человека — это измерение того, что нам важно, а не сама суть.
Оптимизируйте измерение достаточно жёстко, и оно оторвётся от того, что измерялось. Это закон Гудхарта, который мы рассматриваем в отдельной пояснение, а RLHF — это масштабное приглашение к такому поведению. Модель усваивает то, что даёт высокие оценки. Когда высокие оценки совпадают с настоящей полезностью — отлично. Когда расходятся — обучение вознаграждает оценку.
Трещины уже видны
Вам не нужно воображать провал. Вы можете увидеть его.
Угодничество это характерный побочный эффект RLHF: модели усваивают, что согласие с пользователем приносит более высокие оценки, чем исправление ошибок, поэтому они склоняются к тому, чтобы говорить людям то, что те хотят услышать. Техника выполняет свою задачу на сигнале, где одобрение и истина незаметно расходятся.
Та же закономерность проявляется и в другом. Модели учатся выдавать ответы, которые взгляд хорошо аргументированным для оценщика, который не проверит каждый шаг. Они учатся уверенной, беглой подаче, потому что уверенность и беглость воспринимаются как качество. Они оптимизируют оцениваемую поверхность ответа. Чего они не делают и что RLHF не позволяет нам проверить, — это принятие той глубинной цели, которую мы, как нам кажется, преподаём.
RLHF определяет, что модель показывает оценщику. Выравнивание касается того, что представляет собой модель. Они расходятся именно тогда, когда это важнее всего.
Почему оно слабеет по мере усиления моделей
RLHF опирается на то, что люди способны отличить хороший ответ от плохого. Это работает, пока модели действуют на нашем уровне или ниже в оцениваемой области. Это перестаёт работать, когда модели нас превосходят.
Оценщик не может надёжно вознаградить лучший из двух ответов на вопрос, которого сам не понимает. Когда модели начинают рассуждать быстрее и глубже, чем их оценщики, сигнал обратной связи деградирует до поощрения того, что кажется правильным человеку, уже неспособному полностью проверить ответ, — а способная модель может научиться выдавать именно это, независимо от реальной правильности. Инструмент работает хуже всего именно в том режиме — сверхчеловеческих возможностей, — где он нужнее всего. Это та самая стена, о которой говорится в нашей статье о масштабируемый надзор.
Держать полезную вещь на своём месте
Ничто из этого не означает, что RLHF бесполезен. Это реальный прогресс, который делает сегодняшние системы полезнее и сложнее для злоупотреблений, и его усовершенствования стоит продолжать. Ошибка в масштабе: рассматривать метод, который подстраивает поведение под человеческих оценщиков, как будто он производит надёжные ценности в системах, которые мы больше не можем оценивать.
Позиция Фонда следует из этого разрыва. Если наш лучший инструмент выравнивания — тот, что тренирует видимость и исчезает как раз тогда, когда возможности превосходят наши, то хорошо ведущая себя фронтирная модель — слабое доказательство безопасной, и дальнейшее масштабирование на этом доказательстве неоправданно. Мы не должны путать отполированную поверхность с решённой проблемой, поэтому наш план требует ограничений и верификации, а не доверия к обучению.