"Стратегия суперинтеллекта" вышла в марте 2025 года с авторским составом, рассчитанным на серьёзное восприятие в Вашингтоне: Дэн Хендрикс, директор Центра по безопасности ИИ; Эрик Шмидт, бывший CEO Google; и Александр Ван, основатель Scale AI. Цель была вывести суперинтеллект из научной литературы в язык национальной безопасности, и по этому критерию она удалась. Уже через несколько недель текст обсуждали специалисты по контролю над вооружениями, его проигрывали в мозговых центрах и цитировали в показаниях перед Конгрессом.
Аналогия — самое интересное в этом, а также проблема.
В центре — тщательно выбранная аббревиатура. MAIM, Mutual Assured AI Malfunction, намеренно перекликается с MAD и несёт главную мысль статьи: тот страшный тупик, который удерживал ядерные державы от взаимного уничтожения, имеет аналог в сфере ИИ, и он уже существует независимо от того, признают его или нет.
Мы считаем, что в статье действительно важно что-то верно подмечено, и мы считаем, что её центральный механизм не выдерживает возложенной на него нагрузки. Оба момента существенны.
Противостояние, о котором говорится в статье, уже существует
Аргумент звучит так. Предположим, одно государство близко к решающему прорыву — системе, которая, по формулировке статьи, даст «супероружие и контроль над будущим». Ни один соперник не может позволить этому случиться. Мир, в котором одна столица контролирует супер-интеллект, для всех остальных столиц неприемлем так же, как неприемлемо преимущество первого удара во времена холодной войны.
Но в отличие от развёрнутого ядерного арсенала, проект по созданию ИИ в процессе работы уязвим. Он размещён в дата-центрах с известными координатами, зависит от электросетей и от тренировочных запусков, длящихся месяцами, которые хорошо спланированное вторжение может незаметно испортить. Поэтому у угрожаемого соперника есть варианты короче войны, и целая лестница таких вариантов: шпионаж, скрытые кибератаки, которые замедляют тренировочный запуск или отравляют данные, саботаж инфраструктуры и, на крайней ступени, физические удары по самим объектам.
Авторы статьи утверждают, что это уже описывает стратегическую реальность, с которой сталкиваются сверхдержавы в сфере ИИ. Любое государство, которое открыто и агрессивно стремится к доминированию в ИИ, должно ожидать, что его проект будет сорван соперниками. Отсюда и название, и парадоксальная надежда: если каждый игрок понимает, что рывок к доминированию будет саботирован, никто не бросится вперёд, и самый дестабилизирующий ход в игре окажется предотвращён. Как и в случае с доктриной взаимного гарантированного уничтожения, авторы считают, что противостояние можно стабилизировать осознанными действиями: размещать дата-центры подальше от городов, чтобы крайние сценарии были менее катастрофичными, чётко разделять кибер- и кинетические ступени эскалации, а также расширять прозрачность между соперниками, чтобы никто не принял коммерческий проект за попытку добиться доминирования.
Два других столпа
MAIM попала в заголовки, но стратегия состоит из трёх частей, и вторая из них нам кажется самой полезной. Нераспространение применяет механизмы, созданные для того, чтобы не допустить расщепляющихся материалов к террористам, к ИИ: отслеживать передовые чипы так же, как обогащённый уран, защищать веса моделей от кражи и встраивать в системы отказ помогать в разработке биологического оружия или атаках на критическую инфраструктуру. Этот столп предполагает сотрудничество государств в управление вычислениями даже когда они соперничают во всём остальном — точно так же, как Вашингтон и Москва вместе занимались нераспространением в самые тяжёлые годы холодной войны.
Конкурентоспособность это реалистичная дань: государства должны укреплять свои экономики и вооружённые силы с помощью ИИ и прежде всего чинить хрупкие цепочки поставок чипов через внутреннее производство — вопрос, который с тех пор превратился в политика экспортного контроля теперь формирующие отрасль.
Статья противопоставляет эту триаду двум отвергаемым стратегиям: безоглядной гонке за первенство в создании сверхразума в надежде на лучшее и тому, что авторы называют неосуществимым глобальным мораторием. Сдерживание, по их версии, — взрослый вариант между безрассудством и наивностью.
Что в статье правильно
Начнём с достижения. Годами стандартный аргумент в пользу гонки заключался в том, что суперинтеллект соперника будет катастрофой, поэтому мы должны первыми достичь цели. «Стратегия суперинтеллекта» незаметно переворачивает этот тезис. Если односторонняя заявка на доминирование неприемлема для соперников, то каждая заявка неприемлема для кого-то, и сама гонка становится угрозой национальной безопасности, а не ответом на неё. Со стороны авторов такого уровня эта инверсия оказала реальное влияние. Она поставила проблему потери контроля и стратегической нестабильности на столы людей, которые никогда не прочитали бы работу по выравниванию, и на респектабельном языке обосновала, что сдержанность можно обеспечить, а не только просить.
Столп нераспространения — это просто часть договорной архитектуры, которую мы предлагаем, но подойдённая с другой стороны. Отслеживание чипов, защита весов и управление с помощью аппаратных средств служат сразу двум режимам: сдерживанию и проверке. Каждый доллар, вложенный в них, — это доллар, потраченный на то, чтобы будущее соглашение можно было проверить.
Где ядерная аналогия не работает
Проблемы начинаются, когда вы спрашиваете, что обеспечило стабильность MAD, и сравниваете каждый элемент с его аналогом в ИИ.
Ядерный пуск недвусмыслен. Его можно атрибутировать за минуты, место запуска известно с точностью до метра, а ответная реакция предсказуема и заранее понятна всем. Теперь сравним. "Дестабилизирующий" тренировочный запуск со стороны выглядит как обычный коммерческий: те же кластеры, то же энергопотребление, та же спутниковая сигнатура. Порог не определён, и не из-за недостатка усилий по формулировкам, а потому что возможности не проявляют себя так, как шлейф ракеты. Это и есть проблема, которую мы назвали определение опасного ИИ, и MAIM наследует её целиком: режим сдерживания нуждается в красной черте, а статья не может точно указать, где эта черта проходит.
Атрибуция не работает и в обратную сторону. Когда тренировочный запуск проваливается, это саботаж, баг или плохие данные? Государство может подвергнуться атаке, не зная об этом, — значит, атака ничего не сдерживает, — или посчитать себя атакованным, когда это не так, что ещё хуже. Сдерживание работает через видимые, достоверные, атрибутируемые угрозы. Скрытые кибероперации не обладают ни одним из этих качеств. Аналитики MIRI, RAND и других организаций сразу после публикации указывали именно на эти моменты, и критика наблюдаемости в частности так и не получила удовлетворительного ответа: несколько исследователей пришли к выводу, что условия для стабильного сдерживания пока не сложились и могут потребовать глубокой взаимной прозрачности дата-центров соперников.
Есть ещё и сама лестница эскалации. Нормализация атак на критическую инфраструктуру ядерных держав как обычную государственную практику явно не способствует стабильности. Ответ статьи — держать кибер-ступени хорошо ниже кинетических — предполагает, что цель кампании саботажа разделяет вашу оценку, на какой ступени вы стоите. История холодной войны — это каталог моментов, когда такие оценки расходились, и она даёт ещё одно предупреждение, на котором статья не останавливается: MAD несколько раз едва не сорвалась из-за случайности, ложной тревоги и просчёта, и спасалась скорее удачей, чем доктриной. Принять её логику — значит принять её режимы отказа.
Сдерживание нуждается в недвусмысленной спусковой проволоке и недвусмысленном ответе. MAIM пока не имеет ни того, ни другого.
Что MAIM не сможет сделать, даже если сработает
Даже если принять всю эту схему, остаётся более глубокое ограничение. MAIM сдерживает один конкретный сбой: deliberate, видимую гонку государства за одностороннее доминирование. Она ничего не делает с тем сценарием провала, который беспокоит нас больше всего, потому что в нём нет агрессора, которого можно сдержать.
Невыравненность не заботит, какой флаг развевается над дата-центром. Мир соперничающих программ, каждая из которых тщательно остаётся ниже порога саботажа, всё равно мир в гонке к системам, которые никто не сможет контролировать, с обычным для гонки давлением срезать углы по безопасности. Хуже того, MAIM добавляет собственное давление: проекты под угрозой саботажа имеют все основания прятаться, укрепляться и рассредоточиваться, а секретность — враг любой worthwhile практики безопасности. Сдерживание следит за конкурентами, пока проблема контроля сам остаётся без надзора, и более медленные, тихие пути к катастрофе, включая постепенное лишение власти которые не требуют никакой попытки доминирования, проходят полностью под его радаром.
Противостояние тоже не является устойчивым состоянием. Взаимное гарантированное уничтожение было терпимо, потому что сдерживание применения уже существующего оружия — ограниченная задача. MAIM должна сдерживать разработку движущейся возможности навсегда, с порогами, которые сдвигаются каждый год по мере роста эффективности алгоритмов и децентрализации вычислительного фронтира. Постоянное управление кризисом — это обратный отсчёт с хорошим брендингом, а не стратегия.
Сдерживание и договоры — не соперники
Ядерное сдерживание никогда не существовало в одиночку. Оно стало жизнеспособным благодаря неприметной инфраструктуре, наращиваемой десятилетиями: горячим линиям, инспекциям, NPT, SALT, START протоколы верификации которые позволяют каждой стороне подсчитывать боеголовки другой. Взаимное гарантированное уничтожение порождало страх, а контроль над вооружениями превращал этот страх в правила, прежде чем он успел обернуться войной. Призывать первую половину этой истории и отмахиваться от второй, как делает статья, объявляя согласованные ограничения утопией, — значит цитировать холодную войну выборочно.
И две половины работают на одном двигателе. Чтобы угроза саботажа звучала убедительно, государству нужно видеть программы ИИ соперников достаточно глубоко, чтобы вовремя заметить попытку добиться доминирования. Эта слежка — спутники, отслеживание чипов, разведданные о тренировочных запусках — и составляет большую часть того, что договор о сверхинтеллекте потребности в верификации. Статья, прочитанная вопреки собственным намерениям автора, — это довод, что трудная часть договора уже строится.
Поэтому наш вердикт уже, чем готовы написать и поклонники статьи, и её самые жёсткие критики. MAIM ценна как описание: она верно называет противостояние, показывает, что односторонние рывки будут встречать сопротивление, и даёт оборонным ведомствам понять, что гонка — это угроза, а не решение. Как цель она не работает: постоянное, неопределённое, скрытое противостояние ядерных держав — это не стабильность, и при этом остаётся без управления сам источник экзистенциального риска — сами системы. Сдерживание покупает время. Проверенное международное соглашение это то, для чего нужно время.