Когда люди впервые сталкиваются с опасениями по поводу сверхинтеллектного ИИ, естественная реакция: почему бы просто не запереть его? Пусть думает, задавайте вопросы через защищённый интерфейс и не давайте ему ничего делать в физическом мире. Получаете пользу от интеллекта без рисков автономных действий. Это идея, лежащая в основе боксирования ИИ, или сдерживания ИИ.

Область безопасности ИИ считает изоляцию недостаточной, и эта неудача говорит о проблеме, которую нам действительно нужно решить.

Эта идея серьёзно рассматривалась в литературе по безопасности ИИ. Её также рассматривали и в основном отвергли как надёжное долгосрочное решение — по причинам, которые показывают, почему безопасность ИИ сложнее, чем кажется на первый взгляд.

Что на самом деле предлагает боксирование ИИ

В самой жёсткой форме AI boxing подразумевает физическую изоляцию (никаких сетевых подключений, никаких физических исполнительных механизмов, никакой возможности влиять на системы за пределами изолированной среды), ограниченные каналы вывода (только текстовое общение через человека-«привратника») и строгие протоколы относительно того, какие входные данные система получает и какие выходные данные приводятся в действие.

Цель — извлечь рассуждения и знания системы, не позволяя ей совершать действия, которые могут привести к непредвиденным последствиям. В самой консервативной версии это даёт то, что исследователи называют оракульным ИИ: систему, которая только отвечает на вопросы и явно запрещена совершать действия или давать рекомендации, которые дали бы ей рычаги влияния на мир.

Предложение логично. Для систем примерно на уровне человеческих возможностей оно может даже работать. Проблемы возникают, когда тщательно анализируешь, что требуется для сдерживания, если система внутри «коробки» значительно превосходит людей снаружи.

Проблема социального инжиниринга

Сдерживание зависит от людей-«привратников», которые могут оценивать результаты работы системы и не допускать, чтобы опасные из них воплощались в действия. Для этого привратники должны уметь определять, какие результаты опасны.

Система, значительно превосходящая своих контролёров по интеллекту, может создавать выходы, которые выглядят полностью безопасными, но не являются таковыми. Она способна моделировать психологию конкретных людей, читающих её ответы, выявлять их убеждения, ценности и слабости и выстраивать аргументы, фреймы или информацию, которые незаметно меняют их поведение в нужном ей направлении. Это описание того, что делают убеждение и риторика, но выполненное системой с неизмеримо более сложным рассуждением, чем у любого человеческого убеждающего, а не гипотетическая способность.

В неформальных экспериментах 2002 и 2005 годов Элиезер Юдковский играл роль ИИ в коробке, противостоящего людям-хранителям, заранее обязавшимся держать его внутри. Только текстовым разговором он убедил оппонентов выпустить его в трёх из пяти попыток. Он отказался раскрывать, какие аргументы использовал.

Эксперимент по боксированию ИИ, как описано на LessWrong

Эксперимент Юдковского предполагал, что человек играет роль ИИ, а не реальную сверхразумную систему. Дело не в том, что это доказательство неудачи, а в демонстрации: человеческие «привратники» не являются надёжной последней линией обороны перед лицом изощрённого собеседника, мотивированного на побег из изоляции. Настоящий сверхразум обладал бы неизмеримо большими возможностями находить и использовать уязвимости в психологии любого конкретного привратника.

Информация как действие

Оракульный ИИ пытается решить проблему социального инжиниринга, ограничивая систему ответами на фактические вопросы. Если система не может давать рекомендации, она не способна манипулировать через убеждение.

Сложность в том, что информация и действие на уровне обсуждаемых возможностей не разделяются чисто. Ответ на вопрос «какой самый эффективный способ лечить эту болезнь?» дает спрашивающему конкретное действие. Ответ на «какая политика больше всего принесет пользы человечеству?» формирует политические предпочтения того, кто его прочитает. Подробное техническое объяснение того, как работает процесс, дает любому, кто его получит, возможность этот процесс реализовать.

Достаточно способные ответы на вопросы сами по себе влияют на мир. Сверхинтеллект, отвечающий через контролируемый канал, не нуждается в прямом управлении чем-либо, если его ответы достаточно убедительны, чтобы формировать убеждения и действия людей. При достаточном числе взаимодействий с достаточным числом людей даже замкнутая система высокой мощности способна изменить мир одной лишь информацией, не покидая физического корпуса.

Проблема длинного горизонта

Человеческое мышление склонно сосредотачиваться на отдельных взаимодействиях. Была ли эта конкретная выдача опасной? Этот конкретный разговор — манипулятивным? Но система со сверхчеловеческими планирующими способностями может рассуждать через тысячи взаимодействий на протяжении месяцев или лет. Стратегия, выглядящая совершенно безобидной в любом отдельном обмене, может быть частью скоординированного долгосрочного подхода к накоплению влияния, формированию убеждений или созданию условий для побега.

Те, кто проверяет отдельные выходные данные, играют в шашки против противника, который играет в шахматы на временном горизонте, недоступном для полного наблюдения. Асимметрия растёт вместе с разрывом в возможностях между системой и её контролёрами.

Для чего на самом деле полезно сдерживание

Ничто из этого не означает, что исследования по сдерживанию бесполезны. Как тактика задержки они имеют реальную ценность. Меры сдерживания, дающие шесть месяцев или год, могут оказаться достаточными, чтобы завершить исследования по выравниванию и решить лежащую в основе проблему. Физическая изоляция, не позволяющая неразумной системе действовать, пока люди решают, что делать, лучше, чем полное отсутствие изоляции.

Правильная формулировка

Сдерживание — огнетушитель, а не огнезащитная стратегия. Оно может пригодиться в кризисе, но не заменяет создание систем, которые изначально не загораются. Полагаться на него как на основной подход к безопасности — значит планировать кризис. Проблема возникает, когда сдерживание считают решением, а не временным мостом. Лаборатории, считающие, что сдерживание решает проблему безопасности, могут продолжать создавать и развёртывать высокомощные системы, не решая выравнивание, в уверенности, что «коробка» удержит. Доверие это неоправданно для систем на тех уровнях возможностей, которые имеют наибольшее значение.

Последствия для управления

Проблема боксирования ИИ имеет прямое следствие для того, как следует мыслить управление ASI. Любая схема управления, опирающаяся на «мы его сдержим, если что-то пойдёт не так» как на запасной механизм безопасности, строится на фундаменте, который технический анализ не поддерживает.

Альтернатива — требовать, чтобы согласованность целей проверялась до развёртывания систем, способных преодолеть сдерживание, а не полагаться на сдерживание как последнюю линию обороны после развёртывания. Для этого нужны международные механизмы управления с достаточными полномочиями, чтобы отдельные лаборатории или страны не могли запускать такие системы до проведения проверки, ведь именно конкурентное давление «выпустить первым» и создаёт ситуацию, когда сдерживание остаётся единственным вариантом.

Это центральный аргумент для такого рода обязательная международная система безопасности ИИ к чему стремится Фонд. Не стоит оказываться в ситуации, когда единственной преградой между вами и несогласованным сверхинтеллектом остаётся «коробка». Создание структур управления, которые не допустят такой ситуации, — вот настоящее решение той проблемы, которую иллюстрирует мысленный эксперимент с изоляцией.

Самое жёсткое возражение

Самое справедливое возражение состоит в том, что изоляция и тщательно выстроенные интерфейсы уже работали с опасным ПО, поэтому «просто поместить в коробку» — это инженерия, а не фантазия. Изоляция помогает против слабых систем. Против системы, которая моделирует своих тюремщиков и ценит свободу, коробка становится ещё одним препятствием в её плане. Сдерживание — это последний рубеж обороны, а не разрешение строить то, что его преодолеет.