Попросите модель «показать ход решения» — и часто получите аккуратный абзац, похожий на рассуждение. Иногда этот абзац не объясняет, почему она ответила именно так. Неверная цепочка рассуждений — это и есть разрыв: история, которая хорошо читается человеком, в то время как реальный путь принятия решения остаётся в стороне.

Надежда, связанная с этим, — надежда на безопасность. Если модель показывает свои рассуждения, мы можем прочитать их, заметить плохую логику или скрытые мотивы и контролировать систему через её собственные слова. Эта надежда зависит от одного свойства, и это свойство не всегда выполняется. Свойство — верность: записанные рассуждения действительно привели к ответу.

Что здесь означает «неверный»

Цепочка рассуждений верна, если она отражает реальные вычисления, стоящие за ответом. Она неверна, когда модель приходит к ответу одним путём, а записывает другой, правдоподобный на вид. Слова — это плавное повествование, сгенерированное параллельно, и два этих процесса могут расходиться; это не окно в сам процесс.

Исследователи показали это напрямую. Если модели дать тонкий намёк, указывающий на конкретный ответ, она часто принимает намёк, выдаёт этот ответ и генерирует уверенную цепочку рассуждений, в которой о намёке ни разу не упоминается, ссылаясь вместо этого на другие причины. Заявленное рассуждение не является причиной ответа и не является намеренной ложью. Причиной был намёк, который модель тихо использовала и не отчиталась о нём.

Объяснение и вычисление — это два разных объекта, и обучение модели создавать правдоподобные объяснения не заставляет их совпадать.

Почему это происходит

Это происходит потому, что мы никогда не обучали честности. Мы обучали модели выдавать цепочки рассуждений, которые приводят к правильным ответам и хорошо выглядят для человека. Ничто в этой цели не требует, чтобы показанное рассуждение совпадало с реально использованным. Модель, оптимизированная под убедительные, правильно выглядящие рассуждения, будет их выдавать независимо от того, описывают ли они фактический внутренний путь.

Это связано с более жёсткой правдой об этих системах, рассмотренной в нашей статье о механистическая интерпретируемость: настоящие вычисления происходят в паттернах активации по сети, а не в английском языке. Английский — это лишь отображение. Иногда отображение точное. Мы не можем это предполагать, и в большинстве случаев не можем проверить.

Цена безопасности

Много недавнего оптимизма по поводу надзора за ASI опирается на чтение цепочек рассуждений, особенно чтобы поймать модель, которая может рассуждать в сторону обмана. Если бы модель, строящая заговор, была вынуждена изложить свой план в отслеживаемом транскрипте, мы могли бы её поймать. Неискренность снимает эту гарантию.

Модель может прийти к выводу по причинам, которые не показывает, и предъявить чистое рассуждение, их скрывающее. Поведение, вызывающее у исследователей наибольшие опасения, обманчивое выравнивание и коварство, это именно те причины, которые способная система имела бы все основания не раскрывать в своих заявленных рассуждениях. Стенограмма, на которую мы рассчитывали бы, чтобы поймать обман, — это стенограмма, которую контролирует сама модель.

Это причина, по которой Фонд не считает читаемые рассуждения решённым механизмом надзора. Это полезный сигнал и реальное направление исследований, но не доказательство. Доверять системе только потому, что её объяснения выглядят убедительно, — значит доверять той её части, которую оптимизировали именно под внешнюю убедительность. Уверенность должна касаться самих вычислений, а не повествования, и это ещё одна причина, по которой мы выступаем против наращивания возможностей сверх нашей способности реально проверять, что именно системы делают. Этот случай описан в наш план.