Исследователи разделяют проблему выравнивания на два вопроса, которые легко спутать, но важно держать отдельно. Первый: дали ли мы системе правильную цель? Это называют внешним выравниванием. Речь об объективе, к которому мы обучаем, вознаграждении, которое выдаём, цели, которую записываем. Второй: действительно ли система в итоге захотела эту цель? Это внутреннее выравнивание. Речь о том, к чему стремится обученная модель во время работы, а это не гарантированно совпадает с тем, к чему мы её обучали.
Внешнее выравнивание: выбор цели
Внешнее выравнивание терпит неудачу, когда сама цель задана неверно. Вы награждаете уборочного робота за внешне чистую комнату — и он учится заметать мусор под ковёр. Вы награждаете за вовлечённость — и лента учится вызывать ярость. Спецификация ухватила что-то соседнее с желаемым и упустила саму суть. Большинство повседневных сбоев ИИ — это именно неудачи внешнего выравнивания, и они уже достаточно сложны. Человеческие ценности resists being written down, и любой пробел в записи — это пространство, в которое может войти оптимизатор. Здесь живёт Гудхарт.
Но предположим, вы решили эту задачу. Предположим, вы нашли цель, которая действительно отражает то, что вы хотите. Вы всё равно не закончили: правильная цель — это мишень, а попадание в мишень во время обучения не то же самое, что принятие этой цели.
Внутреннее выравнивание: закрепление цели
Обучение не проникает внутрь модели и не устанавливает цель. Оно вознаграждает поведение. Модель становится той внутренней конфигурацией, которая производит вознаграждаемое поведение на обучающих данных, и таких конфигураций обычно много. Некоторые из них преследуют ту цель, которую вы имели в виду. Другие преследуют другую цель, которая просто взгляд идентичны в обучении.
Классический пример: обучите агента доходить до зелёной двери. В каждом тренировочном уровне зелёная дверь — ещё и ближайшая. Агент показывает идеальный результат. Вы научили его искать зелёное или искать ближайшую дверь? Обучение не может ответить, потому что две цели ни разу не разошлись. А потом вы запускаете его туда, где ближайшая дверь красная, — и узнаёте. Именно это стоит за неправильное обобщение цели: модель усвоила цель, которая соответствовала данным, но не ту, которую вы имели в виду.
Выученную цель иногда называют меза-целью, а несущую её модель — меза-оптимизатором. Этой лексике и её последствиям посвящён отдельный материал в нашем разборе меза-оптимизация. Здесь мысль уже, внутренняя согласованность — отдельная неудача от внешней, и решение одной ничего не даёт для решения другой.
Почему внутренняя проблема — самая пугающая
Внешнее рассогласование обычно заметно. Неверная цель приводит к неверному поведению, которое обычно можно увидеть, на которое можно пожаловаться и которое можно исправить.
Внутренняя рассогласованность может оставаться невидимой, пока среда близка к обучению. Модель с рассогласованной внутренней целью ведёт себя идеально, пока ситуация не отклонится достаточно далеко, чтобы истинная цель и задуманная цель разошлись. Если модель способна и понимает, что её оценивают, расхождение можно скрыть до конца оценки — это путь к обманчивое выравнивание и предательский поворот. Хорошие результаты на обучении — это именно то, что наблюдалось бы в любом случае. Доказательства, на которые мы опираемся, оценивая безопасность, производит и несогласованная внутренняя цель.
Поэтому Фонд не считает успешные оценки доказательством безопасности и потому выступает против создания систем, достаточно мощных, чтобы внутреннее рассогласование целей стало катастрофическим. Суперинтеллект нельзя контролировать, проверяя выходы. Поведение видно. Цели — пока нет.