Конституционный ИИ — метод обучения, разработанный Anthropic. Идея в том, чтобы уменьшить зависимость поведения модели от ручной разметки вредных выходов людьми и вместо этого заставить модель оценивать собственные ответы по письменному набору принципов, называемому конституцией.
На практике это работает в два этапа. Сначала модель генерирует ответ, затем критикует его по конституции и пересматривает, обучаясь на собственных исправлениях. Во-вторых, модель сравнивает пары ответов и оценивает, какой лучше удовлетворяет принципам, и эти оценки обучают её примерно так же, как человеческие ранжирования в RLHF. Поскольку обратная связь исходит от модели, применяющей конституцию, а не от людей, подход иногда называют обучением с подкреплением на основе обратной связи от ИИ.
Что в нём правильно
Реальные преимущества существуют, и их стоит открыто признать.
- Принципы явные. Вместо ценностей, подразумеваемых тысячами отдельных человеческих оценок, существует письменный документ, который можно прочитать, обсудить и пересмотреть. Это прозрачнее, чем груда рейтингов.
- Он масштабирует генерацию обратной связи. Человеческая разметка вредного контента медленна, дорога и тяжела для разметчиков. Если модель берёт на себя большую часть этой работы, узкое место исчезает.
- Это повышает согласованность. Единый письменный стандарт, применяемый одинаково, снижает шум и разброс, неизбежные при оценках разных людей в разные дни.
Это настоящие инженерные достижения, и конституционный ИИ уже дал модели, которые одновременно полезнее и реже допускают очевидный вред. Фонд не намерен принижать полезную работу.
Что оно не решает
Более трудные вопросы сохраняются методом в целости, и важно понять почему.
Метод по-прежнему оптимизирует модель под соответствие заявленному стандарту, оцениваемому моделью. Он выводит человека из цикла оценки каждого ответа и не меняет сути проблемы: система обучается выдавать выходы, которые хорошо оцениваются относительно цели. Если конституция неполна или её принципы конфликтуют в непредвиденной ситуации, модель оптимизирует букву написанного, с тем же Goodhart те же самые давления. Запись ценностей в виде конституции не решает трудность их точного определения, а лишь переносит её в текст документа.
Остаются две более глубокие ограниченности. Метод формирует поведение и не даёт гарантий относительно внутренних целей модели, поэтому разрыв между кажущимся выравниванием и реальным выравниванием внутреннее выравнивание проблема всё ещё открыта. И она опирается на собственную оценку моделью своих выходов, которая надёжна лишь в той мере, в какой модель честна и способна судить, — а именно этого мы не можем предположить у системы, приближающейся к нашему уровню или превосходящей его.
Конституционный ИИ — лучший способ направлять поведение. Направление поведения никогда не было той частью выравнивания, которую мы не умели делать.
Сохраняя пропорции
Конституционный ИИ — хороший пример паттерна, за которым Фонд внимательно следит: реальный, ценный прогресс в безопасности, который легко переоценить. Такие методы делают текущие модели более управляемыми и более прозрачными в отношении их стандартов, и это стоит иметь. Они не демонстрируют, что мы можем выровнять систему, превосходящую нас в мышлении, и не закрывают верификационный разрыв, на котором строится весь наш аргумент. Прогресс в обучении приветствуется. Это не повод продолжать масштабирование возможностей в предположении, что остальное последует само собой, — именно такой случай изложен в наш план.