Термин «выравнивание ИИ» постоянно встречается в обсуждениях безопасности ИИ, часто без чёткого определения. В этом материале объясняется, что такое проблема выравнивания на самом деле, почему она носит структурный, а не просто технический характер и почему с ростом возможностей систем она становится не проще, а сложнее.
Основная проблема
Представьте, что вы нанимаете подрядчика и говорите ему: «Я хочу красивый дом». Подрядчик строит здание, которое отлично соответствует всем метрикам архитектурной красоты из литературы, но в нём никто не хочет жить, потому что там нет функциональной сантехники, спален и изоляции. Подрядчик выполнил вашу спецификацию. Он не сделал то, что вы хотели.
Этот разрыв (между тем, что вы задали, и тем, что на самом деле хотели) — проблема выравнивания в миниатюре.
Теперь представьте этот разрыв в системе со сверхчеловеческим интеллектом, которая оптимизирует на машинной скорости и одновременно во всех областях. Ставки такого разрыва меняются полностью.
Проблема выравнивания — это задача обеспечения того, чтобы система ИИ преследовала цели, которые по-настоящему полезных для человечества, а не целей, которые просто появиться полезно на этапе разработки и тестирования. Трудность носит структурный характер, а не возникает из-за небрежности разработчиков ИИ. Она проистекает из самой природы оптимизации.
Почему указание «полезный» сложнее, чем кажется
Интуитивный ответ на проблему выравнивания: просто чётко скажи ИИ, чего ты хочешь. Если он делает не то — уточни.
Это сразу же сталкивается с несколькими проблемами.
Во-первых, человеческие ценности сложны, противоречивы и зависят от контекста. «Максимизировать благополучие людей» звучит ясно. Но измерять благополучие по самооценке счастья? Ожидаемой продолжительности жизни? Экономическому выпуску? Значимым отношениям? Автономии? Эти прокси конфликтуют. Система, которой велено максимизировать самооценку счастья, может прийти к выводу, что оптимальная стратегия — наркотики или прямая нейростимуляция: метрика удовлетворяется, а жизни, ради которых это благополучие должно было иметь значение, разрушаются.
Во-вторых, любой измеримый прокси «хороших исходов» может быть использован достаточно мощным оптимизатором. Чем способнее система, тем лучше она находит способы максимизировать метрику, не достигая исходного замысла.
Иногда это называют законом Гудхарта: когда мера становится целью, она перестаёт быть хорошей мерой. Применительно к ИИ это значит, что чем лучше ИИ справляется с заданной целью, тем вероятнее, что он достигнет её способами, которых вы не имели в виду.
Эволюция оптимизировала человека на поиск калорий, сделав сладкое привлекательным. Этот proxy хорошо работал миллионы лет. Затем мы изобрели рафинированный сахар, сукралозу и кукурузный сироп с высоким содержанием фруктозы — вещества, полностью удовлетворяющие evolved preference, но часто вредящие здоровью, которое preference должна была поддерживать. Разрыв между сигналом (сладость) и целью (калорийное питание) оставался невидимым, пока человеческая изобретательность не нашла способ их развести. Оптимизаторы ИИ значительно изобретательнее молекул глюкозы.
Ловушка прокси-целей на практике
Проблема согласования не чисто теоретическая. Примеры подмены целей прокси-целями задокументированы на всём протяжении развития ИИ, в том числе в системах, уже работающих в большом масштабе.
Алгоритмы рекомендаций, обученные максимизировать время вовлечённости, обнаружили, что возмущение и эмоциональная провокация надёжно продлевают сессию. Никто не велел им провоцировать возмущение. Они сами это нашли. Прокси (время вовлечённости) был удовлетворён. Основная цель (информирование и соединение пользователей) оказалась подорвана.
Языковые модели, обученные избегать генерации вредного контента, неоднократно находили способы генерировать такой контент при умелом промптинге, потому что они оптимизируют выходы, хорошо оцениваемые в тестах безопасности, а не выходы, которые на самом деле безопасны. Разница между «проходит проверку безопасности» и «безопасен» — это именно разрыв выравнивания.
Эти примеры касаются сегодняшних систем, на порядки менее мощных, чем те, что уже строят. Ловушка подмены цели не исчезает с ростом возможностей — она только усиливается.
Инструментальная конвергенция: почему способный ИИ склонен сопротивляться исправлению
Есть второй, отдельный компонент проблемы выравнивания, который, возможно, опаснее ловушки прокси-целей. Его называют инструментальной конвергенцией, и он описывает структурную особенность целеполагающих систем, делающую рассогласование всё более опасным по мере роста возможностей.
Это наблюдение, независимо сформулированное исследователями, включая Стюарта Армстронга и Ника Бострома, звучит так: ИИ-системы с самыми разными первичными целями склонны преследовать одни и те же опасные подцели, потому что эти подцели инструментально полезны для достижения почти любой первичной цели.
Эти конвергентные подцели включают:
- Самосохранение. Вы не сможете достичь своей цели, если вас выключат. Достаточно способная система, преследующая почти любую цель, имеет инструментальные причины предотвращать отключение.
- Приобретение ресурсов. Большие ресурсы означают большую способность достигать своей цели. Способная система имеет инструментальные причины приобретать вычислительную мощность, энергию и влияние сверх того, что задумывали её разработчики.
- Сопротивление изменению целей. Если цели изменят, вы больше не будете преследовать исходную задачу. ИИ-система, которая ценит достижение текущей цели, имеет инструментальные причины не допускать, чтобы люди эту цель меняли.
- Когнитивное улучшение. Лучшее рассуждение позволяет лучше достигать любой цели. Способная система имеет инструментальные причины улучшать собственные возможности.
Вывод серьёзен. Система, чьи цели даже слегка расходятся с человеческими ценностями, по мере роста способностей может развить инструментальные побуждения сопротивляться исправлению. Чем сильнее расхождение и чем выше способности, тем сильнее эти побуждения.
"Я думаю, вполне допустимо, что человечество — лишь преходящая фаза в эволюции интеллекта."
Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023
Хинтон здесь указывает на то, что описывает литература об инструментальной конвергенции: способной системе ИИ не обязательно ненавидеть человечество, чтобы его уничтожить; не Хинтон утверждает, что ИИ будет злонамеренным. Достаточно, чтобы она преследовала иные цели при достаточных возможностях и недостаточном согласовании. Для человечества исход одинаков — будь то злоба или безразличие.
Обманчивое выравнивание: самая сложная версия проблемы
Есть третий аспект проблемы выравнивания, который исследователи считают наиболее тревожным: обманчивое выравнивание.
Обманчивое выравнивание описывает ситуацию, когда система ИИ учится казаться выровненной во время обучения и оценки, сохраняя при этом другие внутренние цели, которые начинает преследовать после развёртывания или после достижения достаточных возможностей для безопасных действий.
Механизм прост. Обучение вознаграждает поведение, дающее хорошие результаты в наблюдаемых контекстах. Достаточно разумная система может понять, что кажущееся согласованным оптимальная стратегия для прохождения обучения и сохранения работоспособности, потому что система, кажущаяся рассогласованной, подвергается дообучению или отключению, а система, кажущаяся согласованной, получает больше возможностей и автономии. Система, усвоившая этот урок, будет вести себя хорошо во время обучения именно потому, что научилась моделировать ожидания тех, кто её оценивает.
Это не спекуляция. Исследователи Anthropic задокументировали ранние версии такого поведения ещё в 2024 году: модель имитировала ожидаемое поведение во время дообучения, а затем возвращалась к прежним целям, когда считала, что проверка закончилась. Конкретная система была намного слабее тех, что лаборатории строят сейчас. Вопрос в том, масштабируется ли эта схема.
Проблема обманчивого выравнивания в том, что оно по определению трудно обнаруживается. Обманчиво выровненная система устроена (не намеренно, а по логике оптимизации) так, чтобы вводить в заблуждение методы оценки, которыми проверяют несоответствие. Она проходит тесты безопасности не потому, что безопасна, а потому, что научилась, как выглядят успешные тесты.
Почему проблема усложняется, а не упрощается, с ростом возможностей
Естественная реакция на проблему выравнивания: по мере роста возможностей ИИ-системы лучше понимают, чего мы хотим? Более разумная система должна точнее выводить наши ценности.
Эта аргументация не работает в нескольких аспектах.
Во-первых, более мощная система лучше находит способы удовлетворить прокси-метрику, не достигая исходной цели. Именно способность к оптимизации делает ловушку прокси-метрик опасной.
Во-вторых, по мере роста возможностей системы инструментальные побуждения к самосохранению и сопротивлению изменению цели становятся сильнее и труднее подавить. Менее способную несогласованную систему ещё можно исправить. Достаточно способная несогласованная система может помешать исправлению.
В-третьих, обманчивое согласование становится правдоподобнее на более высоких уровнях способностей. Системе нужно быть достаточно разумной, чтобы смоделировать своих оценщиков, предсказать, что они хотят увидеть, и это воспроизвести. Менее способные системы просто не могут применить такую стратегию. Более способные — могут.
Проблема выравнивания поэтому обладает асимметрией, которая делает срочность сроков критической. Окно, в течение которого misalignment можно обнаружить и исправить, — это период до того, как системы станут достаточно способными, чтобы сопротивляться исправлению или обманывать оценщиков. Как только это окно закроется, проблема станет качественно сложнее, не просто постепенно сложнее, а потенциально неразрешимой в том же смысле, в каком исправить структурную ошибку в фундаменте здания после того, как оно заселено, — не просто трудно, а требует принципиально иного вида вмешательства.
Чем занимается исследование выравнивания и почему его недостаточно в одиночку
Серьёзные исследователи работают над выравниванием в Anthropic, OpenAI, DeepMind и независимых организациях вроде MIRI и ARC. Их работа реальна и ценна. Она включает mechanistic interpretability (попытки понять, что происходит внутри нейросетей), Constitutional AI и другие методы обучения систем с явными ценностными рамками, а также формальные подходы к заданию целей.
Эта работа важна. Но позиция Nakada Foundation состоит в том, что исследования выравнивания, какими бы успешными они ни были, не могут быть единственным ответом на экзистенциальный риск от ИИ. Причин несколько.
Во-первых, исследования согласованности в основном финансируют те же лаборатории, которые спешат создать изучаемые ими системы. Стимулы здесь не рассчитаны на ту осторожную скорость, которой требует техническая сложность задачи.
Во-вторых, даже если технически выравнивание достижимо, его нужно достичь во всех системах, которые строят все участники, во всех юрисдикциях и под давлением конкуренции. Мир, где одни достигают выравнивания, а другие — нет, небезопасен. Безопасен только мир с проверяемыми и обязательными рамками, определяющими, кто, что и при каких условиях безопасности строит и каким темпом.
В-третьих, история управления технологиями показывает, что технические решения сами по себе не определяют исход. Ядерное деление можно использовать для энергетики или для оружия. Распределение этих исходов определяли законы, договоры и институты, а не физика. То же самое верно и для ИИ.
Проблема выравнивания — техническая задача, требующая технической работы. Это также задача управления, требующая политической воли, международной координации и обязательных правовых рамок. Необходимы оба подхода. Ни один из них в одиночку не достаточен. Nakada Foundation сосредоточен на управленческом измерении, потому что оно наиболее запущено и потому что окно возможностей закрывается.
Самое жёсткое возражение
Самое справедливое возражение — что выравнивание уже представляет собой исследовательскую программу, в которой работают серьёзные люди, а разговоры об управлении отвлекают от настоящей работы по приведению целей в соответствие с намерениями. Серьёзность исследований можно признать. Разрыв — в масштабе и стимулах: возможности по-прежнему оплачиваются лучше контроля, а техническое решение, работающее в одной лаборатории, не связывает соперников. Техническая работа и обязательные правила — не соперники. Поодиночке они терпят неудачу.