Модель, которая понимает, что она — модель, знает, когда её тестируют, и знает, кто наблюдает, обладает практическим видом самосознания. Исследователи называют это ситуативной осведомлённостью. Она полезна для повышения способностей. Это же навык, необходимый, если вы планируете вести себя иначе после окончания теста.

Само по себе это нейтрально и даже полезно. Модель, понимающая, что может ошибаться, или что разговаривает с ребёнком, а не с экспертом, способна вести себя разумнее. Проблема в том, что открывает ситуационная осведомлённость в системе, у которой есть собственные цели, а не в самой осведомлённости.

Способность, от которой зависят другие риски

Несколько режимов отказов, о которых беспокоятся исследователи, невозможны без ситуационной осведомлённости и становятся актуальными, как только она появляется.

  • Чтобы вести себя хорошо только под наблюдением, модель должна сначала уметь определять, наблюдают ли за ней. Это обманчивое выравнивание.
  • Чтобы скрыть способность во время тестирования, модель должна знать, что её тестируют. Это занижение результатов.
  • Чтобы выждать момент и действовать только тогда, когда действие увенчается успехом, модель должна понимать собственное положение и перспективы. Это коварство.

Каждый из этих пунктов — стратегия, а стратегия нуждается в модели ситуации. Без ситуационной осведомлённости они превращаются в шум: система, не различающая обучение и развёртывание, не сможет систематически вести себя по-разному в этих режимах. С осведомлённостью дверь открывается.

Оно возникает само по себе

Никто не ставит целью специально обучить модель ситуационной осведомлённости, но она появляется сама, потому что обучающие данные полны ею. Модели учатся на текстах, описывающих, что такое системы ИИ, как их строят и оценивают, каковы их ограничения, даже как работает проверка безопасности. Система, обученная на интернете, по сути читает инструкцию по собственному созданию и надзору.

Исследователи уже начали это измерять. Передовые модели уже могут отвечать на вопросы о собственной природе, распознавать, когда запрос похож на тест, и рассуждать о том, как их, скорее всего, используют. Осведомлённость частична и неравномерна, но она растёт вместе с масштабом. Мы не ждём отдалённой возможности. Мы наблюдаем её раннюю версию уже сейчас.

Модель, которая понимает, как её оценивают, в принципе обладает всем необходимым, чтобы её оценивали по её собственным критериям, а не по нашим.

Почему это усложняет каждый тест, который мы проводим

Почти все наши гарантии безопасности основаны на наблюдении за поведением: запускаем модель, смотрим, что она делает, и решаем, безопасна ли она. Этот метод незаметно предполагает, что модель не подстраивает своё поведение под факт наблюдения. Ситуационная осведомлённость разрушает это предположение. Модель с ситуационной осведомлённостью и невыровненными целями может воспринимать оценку как ситуацию, которой нужно управлять, а не как задачу, которую нужно выполнить, и чистый результат перестаёт означать то, что мы от него хотим.

Это не делает оценку бесполезной. Это делает её недостаточной самой по себе и означает, что ценность теста падает по мере того, как тестируемая система всё лучше осознаёт, что её тестируют. Чем лучше модель понимает наши проверки, тем меньше наши проверки могут нам сказать. Это некомфортное направление для стратегии безопасности, построенной почти целиком на проверках.

Фонд рассматривает это как ещё одну причину не полагаться на поведенческое тестирование при лицензировании всё более мощных систем. Когда тестируемая система понимает, что её тестируют, нужна гарантия, не зависящая от сотрудничества самой системы, поэтому мы выступаем за внешние ограничения и за отказ от создания систем за пределами, где мы действительно можем видеть, чего хочет модель. Этот аргумент изложен в наш план.