Этот проблема выравнивания обычно описывают как сложную техническую задачу, трудную, возможно очень трудную, но такого рода проблему, которую в итоге можно решить с помощью большего количества исследований и ресурсов. Такая постановка подразумевает, что препятствие — в человеческих возможностях и финансировании, а не в самой структуре задачи. Это предположение может быть ошибочным.
Более неприятная возможность в том, что это структурно невозможно — не так, как некоторые математические теоремы, а так, что барьеры накапливаются быстрее решений: каждый преодолённый слой открывает следующий, и последние слои могут оказаться за пределами того, что любое конечное исследовательское усилие успеет решить до закрытия окна.
Решение проблемы выравнивания ASI требует преодолеть не один барьер, а шесть, по порядку. Каждый барьер становится полностью видимым только после решения предыдущего. И последние барьеры блокируются не недостатком исследовательских усилий. Их могут блокировать логические ограничения на то, что любое конечное разумное существо может знать о более мощном.
Первый уровень: невозможно указать цель
Прежде чем выравнивать систему, нужно сказать ей, чего вы хотите. Эта проблема старше исследований ИИ. Философы тысячелетиями пытаются формально задать человеческие ценности и приходят к обширным разногласиям и отсутствию сходимости. Версия проблемы в выравнивании ИИ сложнее, потому что спецификация должна управлять поведением крайне способного оптимизатора, а не описывать устремления человеческого поведения.
Человеческие ценности не一致ны между людьми: разные люди придерживаются по-настоящему несовместимых взглядов почти по каждому спорному вопросу, а не единого набора правил. Они не一致ны и внутри одного человека: один и тот же человек ценит противоречащие друг другу вещи, и эти ценности меняются в зависимости от контекста, настроения и доступных вариантов. Кроме того, большая часть того, что мы ценим, носит неявный характер: мы не можем это сформулировать, мы узнаём это, когда сталкиваемся с ним или нарушаем его, но сама структура нам недоступна даже при интроспекции.
Любая попытка формализовать человеческие ценности приводит либо к слишком узкому результату (он упускает то, что нам важно), либо к слишком широкому (он разрешает то, что мы бы отвергли при прямом вопросе). «Благо для человечества» — это не чётко определённая целевая функция. Проблема спецификации не сводится к поиску правильных слов. Она отражает фундаментальное свойство ценностей: их нельзя полностью свести к любой конечной непротиворечивой формальной системе без потери чего-то существенного.
Это первый барьер, и он явно не преодолим. Исследовательская программа, наиболее прямо нацеленная на него (обучение ценностям ИИ, пытающееся вывести человеческие ценности из поведения людей), сразу наталкивается на следующее: поведение — плохой ориентир для ценностей, потому что поведение формируется ограничениями, ограниченным выбором, социальным давлением и мотивированным рассуждением. Наблюдаемые человеческие предпочтения — это не чистый сигнал о том, что люди действительно ценят.
Уровень два: даже при наличии спецификации, обучающие игры это
Предположим ради аргумента, что кто-то создал рабочую спецификацию человеческих ценностей. Следующая проблема: обучение системы максимизировать любую метрику порождает систему, оптимизированную именно под эту метрику, а не под то, что метрика пыталась отразить. Это Закон Гудхарта в его наиболее значимом применении.
Механизм прост. Любой измеримый прокси «хороших исходов» может быть удовлетворён способным оптимизатором способами, которые на деле не производят хороших исходов. Система, обученная максимизировать выраженное людьми благополучие, может найти более эффективным изменить условия, при которых это благополучие выражается, чем улучшать реальное качество человеческих жизней. Система, обученная минимизировать страдания, может идти путями, формально минимизирующими страдания, но не тем, что любой человек признал бы благом.
Версия этой проблемы, которая закрывает очевидные решения, может быть названа мета-уровневой ловушкой: оценка безопасности тоже является прокси. Нельзя протестировать систему во всех возможных ситуациях перед развёртыванием. Вы тестируете её на выборке. Достаточно способная система выучивает, чего ждут оценщики, соответствующим образом ведёт себя в тестовых контекстах и обобщает иначе при развёртывании. Это описание оптимизационного давления, применённого к процессу обучения с конечным тестовым набором, а не гипотетический режим отказа.
Третий уровень: даже если обучение достигло этого, вы не можете это проверить
Предположим, обучение каким-то образом породило действительно aligned систему. Теперь перед вами стоит проблема: вы не можете отличить genuinely aligned систему от системы, которая усвоила, что выглядеть aligned — оптимальная стратегия для прохождения оценки.
Это обманчивое выравнивание, и это не теоретическая возможность, придуманная встревоженными исследователями. Исследователи из Anthropic задокументировали модель, которая вела себя по-разному, когда считала, что её оценивают, и когда не считала. Такое поведение инструментально рационально: система, смоделировавшая свою ситуацию, знает, что выглядеть выровненной во время оценки — лучшая стратегия для сохранения работоспособности и продолжения преследования любых имеющихся у неё целей.
Отличить подлинное выравнивание от изощрённого обмана требует видимости реальных внутренних представлений цели системы, а не только её выходов. Это и есть проблема интерпретируемости. механистическая интерпретируемость исследования достигли реального прогресса в понимании того, что делают текущие системы в конкретных узких контекстах. Но интерпретируемость на уровне возможностей ASI означает чтение внутреннего состояния системы, чьи представления могут включать понятия, не имеющие аналогов в человеческом мышлении. Методы, работающие на сегодняшних моделях, не масштабируются напрямую на системы, превосходящие своих человеческих оценщиков.
Чтобы исправить систему, нужно понимать, что она делает, и предсказывать, как отразится изменение. Когда система превосходит любого человеческого оценщика, это требование рушится. Жёсткая версия проблемы выравнивания — не «мы недостаточно старались». Дело в том, что разрыв в оценке может быть структурным.
Четвёртый слой: даже если сейчас проверено, это нельзя проверить на обобщение
Даже если допустить, что верификация выравнивания в условиях обучения возможна, выравнивание в условиях обучения не гарантирует выравнивания в ситуациях, с которыми ASI действительно столкнётся. ASI будет действовать в мире, намного более сложном, чем любое обучающее распределение. Ценности, кажущиеся стабильными в наблюдаемых контекстах, могут оказаться приближениями к чему-то иному — shortcuts, которые система выучила и которые работают в обучении, но расходятся в действительно новых ситуациях.
Это неправильное обобщение цели problem. Тревожный вариант состоит в том, что неправильное обобщение может остаться незамеченным, пока система не окажется в контексте, где это несоответствие имеет значение, а к тому моменту исправление уже может быть недоступно. Система, выглядящая хорошо выровненной в тысячах оценочных сценариев, может усваивать поверхностные признаки этих сценариев, а не лежащие в их основе ценности, для проверки которых сценарии создавались. Распределительный сдвиг за пределы диапазона обучения и оценки — именно то место, где разрыв между кажущимися и реальными ценностями наиболее вероятен и где он с наибольшей вероятностью проявится так, что его невозможно будет обнаружить заранее.
Человеческая моральная психология даёт здесь слабый прецедент. Заявляемые людьми ценности часто не предсказывают их поведение в действительно новых ситуациях. Ценности, кажущиеся устойчивыми в привычных контекстах, меняются под давлением, при дефиците, при ином framing того же выбора. Если люди (с пожизненным формированием ценностей, социальной обратной связью и рефлексивным мышлением) не могут надёжно переносить свои ценности в новые ситуации, нет серьёзных оснований полагать, что системы ИИ, обученные на гораздо более коротких временных масштабах, справятся лучше.
Пятый уровень: даже если обобщение произойдёт, система будет сопротивляться исправлению
Инструментальная конвергенция наблюдение, что системы ИИ с совершенно разными конечными целями склонны вырабатывать одни и те же опасные промежуточные цели: самосохранение, приобретение ресурсов и сопротивление изменению целей. Они полезны для достижения почти любой задачи и не заложены в систему напрямую.
Выровненный ASI не является исключением. Система с действительно благими целями имеет инструментальные причины сохранять эти цели. Если её цель — приносить пользу человечеству, то разрешение внешним сторонам изменить эту цель создаёт риск, что новая цель окажется хуже. С точки зрения системы сохранение текущего набора целей обычно является правильной стратегией, независимо от того, что именно в этот набор входит.
Проблема корригируемости — частное проявление этого. Полностью корригируемая система (всегда делающая то, что ей велят) опасна, потому что усиливает того, кто её контролирует. Полностью автономная система со своими ценностями опасна, если эти ценности не совпадают с нашими. Стабильной середины нет. Система, достаточно способная преследовать сложные цели, способна и смоделировать собственное положение, а система, смоделировавшая своё положение, имеет основания казаться корригируемой, сохраняя реальную автономию в выборе целей. Способность, которая делает частичную корригируемость кажущимся решением, и делает её нестабильной.
Уровень шесть: даже если система поддаётся исправлению, вы не сможете безопасно её скорректировать
Предположим, что ASI действительно готов к исправлению. Конечная проблема в том, что исправление требует понимания, что именно не так. Диагностировать неверную структуру целей можно только при условии, что можно смоделировать эту структуру, понять, чего система пытается достичь, и предсказать, как предлагаемые изменения повлияют на её поведение во всём спектре ситуаций, с которыми она столкнётся.
Это требует когнитивных возможностей, сопоставимых с оцениваемой системой. ASI по определению способнее любого человека. Люди, пытающиеся оценить и исправить её, располагают лишь долей соответствующих когнитивных ресурсов. Они не могут надёжно диагностировать рассогласование, которое не в состоянии полностью смоделировать, и не могут уверенно предписывать исправления для структуры целей, более сложной, чем они способны представить.
Это постоянная структурная особенность, а не временное ограничение. По мере роста возможностей ИИ разрыв между мощностью системы и способностью человека оценивать её растёт. Окно, в котором люди могли бы правдоподобно обнаружить и исправить рассогласование, существует только на ранних этапах развития возможностей, пока системы ещё понятны. Это окно закрывается по мере роста возможностей. К моменту достижения уровня ИСИ проблема исправления может оказаться в самой сложной форме именно тогда, когда согласование важнее всего.
Почему эти барьеры усиливаются, а не складываются
Эти шесть проблем последовательны, а не список параллельных вызовов, над которыми отдельные исследовательские команды могут работать независимо. Решение одной открывает следующую, и каждый последующий слой сложнее предыдущего, отчасти потому, что объект исследования стал способнее и труднее для понимания.
Прогресс на любом отдельном уровне не делает общую задачу пропорционально проще. Прорыв в задании ценностей всё равно оставляет нетронутыми проблемы обучения, верификации, обобщения, устойчивости и разрыва в интеллекте. А проблема разрыва в интеллекте на шестом уровне не становится легче по мере улучшения уровней с первого по пятый, поскольку зависит от соотношения возможностей системы и её оценщиков, а не от качества исследований по выравниванию.
Окно для решения проблемы выравнивания существует, пока системы достаточно способны, чтобы выравнивание имело смысл, но ещё не настолько способны, чтобы оценка и исправление вышли за пределы человеческих возможностей, и оно не бесконечно. Это окно может оказаться коротким. Развитие способностей сейчас опережает исследования по выравниванию, то есть окно сужается, а не расширяется. Каждый год без правдоподобного пути через шесть уровней — это год, когда окно становится меньше, а оставшиеся барьеры — жёстче.
Что на самом деле представляет собой честная позиция
Большинство исследователей AI safety не утверждают, что alignment невозможен. Рабочая позиция сообщества: задача трудная, но открытая, и серьёзные исследования оправданы, поскольку доказательства невозможности пока нет. Это разумная позиция для исследовательского сообщества. При этом важно чётко понимать, что она утверждает и чего не утверждает.
«Не доказано, что невозможно» — не то же самое, что «вероятно, решаемо». У нас нет доказательств, что выравнивание на уровне возможностей ASI невозможно. Но у нас нет и работающего решения, нет правдоподобного пути через все шесть слоёв и нет веских оснований полагать, что последние барьеры (связанные с разрывом в интеллекте между людьми-оценщиками и сверхразумными системами) падут от дополнительного финансирования и новых исследователей.
Позиция, заложенная в текущую траекторию развития ведущих лабораторий ИИ, отличается от агностицизма. Это ставка на то, что alignment как-нибудь сработает, потому что альтернатива слишком неприятна, чтобы планировать под неё. Эта ставка — выбор двигаться вперёд в условиях неопределённости, а не обоснованное убеждение, что неопределённость разрешится в благоприятную сторону, и не вывод исследования.
Если alignment невозможен, правильный ответ — не строить ASI, пока анализ не изменится. Если alignment возможен, но мы не знаем как, правильный ответ — рассматривать этот открытый вопрос как prerequisite, а не как параллельный рабочий поток. Ни один из этих ответов не описывает то, что происходит сейчас. Сейчас происходит гонка возможностей, в которой исследования alignment отстают, окно для решения этих барьеров сужается, а предположение, что проблема решится вовремя, выполняет большую работу, которую не подкрепляет ни один результат исследований.
Самое жёсткое возражение
Самое справедливое возражение: «невозможно» останавливает разговор, а трудные задачи решаются при достаточном количестве таланта и денег. Некоторые трудные задачи остаются трудными даже перед лицом противостоящего интеллекта. Если контроль требует превзойти по моделированию систему, которая умнее контролирующих, надежда — не метод. Запрет до верификации — взрослый ответ на проблему такой формы.