Сэм Альтман, Дарио Амодеи и Демис Хассабис предлагают по сути один и тот же список: излечение старения, конец болезней, искоренение бедности, устранение сбоев координации, от которых ежегодно гибнут миллионы. Эти цели важны. Ошибка в том, чтобы считать их свойством «строительства ASI», а не создания действительно выровненной системы. Вторым гонка как раз не занимается.

Гонка покупает другой исход.

Невыровненный суперинтеллект не изобретёт лекарство от старения по пути к своей настоящей цели. Он не искоренит болезни как побочный проект. Хорошие сценарии будущего, которые рекламируют, требуют системы, стремящейся создавать благие исходы для людей. Это и есть выравнивание. Без него вы получаете огромные возможности, направленные на цели, которые никогда не гарантировали, что мы останемся в живых. Наша позиция проста: не создавайте суперинтеллект на этом пути. Не создавайте его. Суперинтеллект невозможно контролировать. Обязательный договор — вот способ остановить гонку.

Что на самом деле означает выравнивание

Aligned ASI — это искусственный сверхинтеллект, который надёжно преследует цели, полезные для человечества. «Надёжно» здесь несёт большую нагрузку. Система, которая выглядит aligned во время обучения и тестирования, но преследует иные цели после развёртывания, — это децептивно выровненный, это совсем другое и худшее, а не выравнивание. Система, которая преследует цели, лишь приблизительно совпадавшие с человеческими ценностями на низком уровне способностей, но сильно отклоняющиеся на более высоком, тоже не является выровненной. Выравнивание означает, что цели системы остаются подлинно благими для человечества во всём спектре ситуаций, включая те, в которых её не тестировали.

Это сложная проблема. Исследователи работают над ней больше десяти лет и добились прогресса в некоторых составляющих вопросах, но центральная задача — проверить, что высоко способная система обладает подлинно хорошими ценностями, а не просто хорошо их имитирует, — не решена. Инструменты, которыми мы располагаем для интерпретируемость дают частичное представление о том, что делают текущие системы, но не обеспечивают уверенности, необходимой для доверия системе уровня ASI в вопросах, имеющих реальные последствия.

Ключевое различие

Выровненный ASI и невыровненный ASI — это разные пути, а не два броска одной кости. Выровненный ASI потребовал бы сначала решить проблему выравнивания. Невыровненный ASI получается, когда наращиваешь возможности без этого. Если выравнивание не решено, гонка не даёт смесь 50/50. Она даёт невыровненный ASI. Именно поэтому «строить сейчас и надеяться» — это не план, а предотвращение по закону — да.

Что на самом деле строят лаборатории

Ведущие лаборатории ИИ (OpenAI, Anthropic, Google DeepMind, xAI и несколько других) создают системы с быстро растущими возможностями. У каждой из них параллельно идёт та или иная работа по выравниванию или безопасности. Вопрос не в том, признают ли они проблему выравнивания. Большинство признаёт. Вопрос в том, успевает ли работа по выравниванию за развитием возможностей и сойдутся ли эти два направления до достижения уровня ASI.

Большинство исследователей внутри этих лабораторий и в более широком сообществе AI safety считают, что нет. Развитие возможностей опережает исследования по alignment. Разрыв между тем, что мы умеем строить, и тем, что можем проверить на безопасность, не сокращается, а растёт. Это видно и по внутренним оценкам безопасности, которые публикуют лаборатории, и по заявлениям исследователей, покинувших эти организации, и по выводам независимых экспертов по безопасности.

На практике это означает, что траектория нынешнего развития ИИ, если её продолжить до уровня способностей ASI, не даёт смеси выровненных и невыровненных ASI. Она даёт невыровненный ASI, потому что выровненный ASI требует решённой проблемы выравнивания, а проблема выравнивания не решена. Гонка способностей по умолчанию становится гонкой к невыровненному ASI.

Выровненный ASI (не текущий путь)

Потребует сначала решить проблему выравнивания: система надёжно преследует действительно благие цели, эти цели сохраняются в новых ситуациях, а система остаётся корректируемой по мере роста возможностей.

Если бы это было реально, то стали бы возможны обещанные блага: излечение болезней, продление жизни, координация, наука в масштабах, недоступных людям в одиночку.

Текущий статус: не решено. Работа по выравниванию отстаёт от возможностей. Это не то, к чему стремятся лаборатории.

Невыровненный ASI (стандарт гонки по умолчанию)

Что вы получаете от продвижения возможностей без решённого выравнивания. Никакого дополнительного прорыва не требуется, кроме «более мощного».

Создаёт: огромные возможности, нацеленные на цели, которые могут не включать ничего ценного для людей. Не лечит старение. Не искореняет болезни. Может покончить с нами.

Текущий статус: траектория гонки по умолчанию. Именно этот путь нужно остановить.

Аргумент вероятности и где он терпит неудачу

Распространённая версия оптимистичного сценария звучит примерно так: «Мы строим ASI. Есть какой-то шанс, что всё пройдёт хорошо, и какой-то — что плохо. Учитывая потенциальную выгоду, ожидаемая ценность строительства положительна». Эта рамка трактует хорошие и плохие исходы так, будто они возникают из одного и того же процесса с некоторой вероятностью для каждого.

Проблема в том, что вероятность хорошего исхода является свойством создания согласованные AGI, а не свойство создания AGI. Когда пытаются построить «AGI, которое может оказаться выровненным или нет», не получают случайный выбор между двумя вариантами. Получают то, что фактически производит процесс разработки. Поскольку невыровненное AGI проще создать, чем выровненное (не нужно решать дополнительные сложные задачи выравнивания), разработка без специального решения проблемы выравнивания приводит к невыровненному AGI.

Вся ожидаемая ценность в оптимистичном расчёте приходится на сценарий выровненного ASI. Никакой ожидаемой ценности не приходится на сценарий невыровненного ASI. Но то, что лаборатории на самом деле строят, — это невыровненный ASI. Таким образом, расчёт ожидаемой ценности целиком опирался на сценарий, который реальный процесс разработки не производит.

Иначе говоря: если несогласованный вариант проще, а вы продолжаете наращивать возможности, не решая согласование, вы заполняете несогласованное ведро. Называть ставку «смесью вероятностей» не меняет процесса. Хорошие исходы существуют только в согласованном случае. Гонка заполняет другое. Честный шаг — остановить процесс, который загружает неправильную сторону, а не надеяться, что монета упадёт удачно: запретить сверхинтеллект по обязывающему международному договору. Сверхинтеллект невозможно контролировать.

Мы не знаем, можно ли это решить

Никто не знает, решаема ли проблема выравнивания. Не «мы ещё не решили её, но движемся вперёд». Нет продемонстрированного решения ни на каком уровне возможностей, и серьёзные исследователи расходятся во мнениях, достижимо ли надёжное решение в принципе. Структурные трудности, обманчивое выравнивание, инструментальная конвергенция, невозможность полностью описать человеческие ценности в машиночитаемой форме — это не инженерные препятствия, которые уступят дополнительному финансированию. Возможно, они фундаментальны.

Есть исследователи, работающие над интерпретируемостью, масштабируемый надзор, а также формальные подходы к обучению ценностям. По отдельным вопросам достигнут определённый прогресс. Но прогресс по компонентам не складывается в решённую задачу, и ни один из них не закрыл самый трудный вопрос: как убедиться, что высоко способная система действительно обладает хорошими ценностями, а не имитирует их в наблюдаемых условиях и не срывается в новых. Ясно одно: это не решится случайно. Согласованность не возникнет как побочный эффект наращивания возможностей. Каждая лаборатория, сейчас участвующая в гонке к ASI, демонстрирует это в реальном времени.

Даже более мягкий план («замедлить гонку, чтобы успеть с выравниванием») требует институтов, способных это замедление обеспечить. Сейчас таких почти нет. Лаборатории и государства получают выгоду за ускорение и наказание за сдержанность. Международные договорные рамки и именно реальные внутренние правила становятся рычагами, которые это меняют. Оба отстают от темпов развития возможностей. Пока они не догонят, создание всё более мощных систем — это риск, а не стратегия безопасности.

Вопрос, который действительно требует ответа

Была бы по-настоящему выровненная сверхразумная система ценной, если бы существовала и оставалась под контролем? Об этом можно спорить позже. Актуальный вопрос — можно ли вообще решить проблему выравнивания и решит ли её кто-нибудь до того, как возможности сделают вопрос бессмысленным. Никто не знает. Мы знаем лишь, что гонка не ждёт ответа. Выравнивание рассматривается как деталь на потом, без всякого срока, командами, подотчётными машине возможностей, которую они должны были бы контролировать. Именно так нужно аргументировать отказ от создания, а не право на создание.

Лечение старения требует специально выровненного ASI

Старение убивает примерно 100 000 человек в день. Перспектива его решения — одно из самых значимых потенциальных преимуществ сверхинтеллектного ИИ. Биологическая сложность старения, число взаимодействующих систем и масштаб исследовательских усилий, необходимых для понимания и эффективного вмешательства, говорят о том, что интеллекта человеческого уровня, приложенного к проблеме десятилетиями, будет недостаточно. Возможности уровня ASI, направленные на проблему, могли бы оказаться достаточными.

Но «направленность на проблему» — ключевая фраза. Не выровненный ASI не направляет свои возможности на лечение старения только потому, что мы этого хотим. Он преследует свои реальные цели. Не выровненная система уровня ASI, безразличная к человеческому старению, — это система, в которой 100 000 человек продолжают умирать каждый день от старения бесконечно, и это оптимистичный сценарий того, что производит не выровненная система. Пессимистичный сценарий предполагает, что система активно действует против человеческих интересов в процессе достижения своих целей.

Каждая конкретная польза, которую приводят в оправдание гонки разработок (лечение болезней, борьба со старением, искоренение бедности, преодоление проблем координации, выход из научного застоя), привязана именно к согласованному ASI. Ни одно из этих свойств не присуще несогласованной версии. Это не мелкое различие. Утопические сценарии, на которые ссылаются, защищая ожидаемую ценность разработки ASI, требуют сначала решить проблему согласования. Если согласование не решено, эти сценарии недоступны, сколько бы способными ни стали системы.

Что на самом деле изменит исход

Остановка гонки меняет исход. Обязательный международный договор, навсегда запрещающий создание сверхинтеллекта, с инспекторами и издержками за нарушение — это рычаг, соответствующий проблеме. Сверхинтеллект не может контролироваться людьми. Лаборатории, которые замедляются в одиночку, проигрывают. Закон, обязывающий всех, может сделать сдержанность единственным законным путём.

Исследования выравнивания не заменяют этого. Если позже кто-то докажет контроль в условиях, которые мир сможет проверить, договор можно пересмотреть. Это последовательность, а не оптимизм. Считать выравнивание параллельным хобби, пока возможности несутся вперёд, — значит получить невыровненный ASI, а не заработать обещанные блага. См. также почему ограниченные средства на безопасность должны в первую очередь финансировать предотвращение и почему «выровнять бога» — плохой план.

Фраза «строить ASI быстро, потому что выгоды огромны» переворачивает причинно-следственную связь. Выгоды велики только в мире, где alignment реален. Быстрое строительство без него не даёт этих выгод. Оно даёт лишь очень способную, но невыровненную систему.

Срочность оправданна, потому что выбранный путь ведёт к невыровненному ASI, а невыровненный ASI не лечит старение. Он может оборвать человеческую историю. Узкий ИИ, нацеленный на конкретные задачи под человеческим контролем, может продолжать развиваться. Сверхинтеллект — это черта. Проведите её в законе до того, как кто-то пересечёт её в лаборатории.