Договоры по контролю над вооружениями начинаются с определений. Конвенция о химическом оружии определяет химическое оружие как любое токсичное химическое вещество или его прекурсор, используемые как метод ведения войны. Договор о нераспространении ядерного оружия определяет государства, обладающие ядерным оружием, как те, что изготовили и взорвали ядерное устройство до 1 января 1967 года. Переговоры об ограничении стратегических вооружений определяли баллистические ракеты по дальности и полезной нагрузке. Эти определения не были политически нейтральными: каждое отражало стратегический выбор — кого охватывать, какие действия ограничивать и как сбалансировать интересы сторон.
Эти вопросы сложнее, чем кажутся, и от того, как на них ответят, зависит, сможет ли любой итоговый договор действительно регулировать то, что он должен регулировать.
Управление ASI сталкивается с проблемой определений, обладающей несколькими чертами, не имеющими близких аналогов в контроле над вооружениями. Понимание этих черт — необходимое условие для создания определений, которые действительно смогут регулировать то, для чего они предназначены.
Три подхода к определению опасного ИИ
Существующие механизмы управления используют три разных подхода к определению того, какие ИИ-системы попадают в их сферу. У каждого подхода есть сильные и слабые стороны, которые должен учитывать договорной уровень регулирования.
Пороги вычислительных мощностей определяют опасный ИИ по вычислительным ресурсам, использованным для обучения модели, измеряемым в операциях с плавающей точкой, или FLOPs. Закон об ИИ EU определяет передовые модели ИИ как обученные более чем на 10 в 25-й степени FLOPs. Исполнительный указ US по ИИ, изданный в октябре 2023 года, требовал отчётности перед федеральным правительством для моделей, обученных более чем на 10 в 26-й степени FLOPs. Обязательства по безопасности передового ИИ, подписанные в Сеуле, распространяются на модели на уровне или приближающиеся к передовым возможностям, с вычислительными мощностями как прокси для статуса передовых.
Пороги по вычислениям имеют два важных преимущества для конструкции договора. Во-первых, вычисления наблюдаемы. Аппаратура, необходимая для обучения больших ИИ-моделей, — специализированные чипы, производимые небольшим числом производителей, — потребляет характерные объёмы энергии и генерирует измеримое тепло. Цепочки поставок этих чипов узки и проходят через юрисдикции, открытые для мониторинга. Во-вторых, вычисления труднее подделать, чем заявления о возможностях, поскольку производство аппаратуры и запуск тренировочных прогонов оставляют наблюдаемые следы, которые сложно скрыть в больших масштабах.
Ограничение порогов вычислений в том, что они устаревают по мере улучшения алгоритмов. Модель, обученная сегодня на 10²⁶ FLOP, обладает существенно иными возможностями, чем модель пятилетней давности с тем же объёмом вычислений, потому что алгоритмические улучшения дают более способные модели на единицу вычислений со временем. Порог, установленный сегодня, либо окажется слишком жёстким, когда эффективные алгоритмы позволят создавать мощные модели ниже порога, либо слишком мягким, когда фронтир уйдёт выше него.
Определения на основе возможностей характеризуют опасный ИИ по тому, что система умеет делать, а не по тому, как её обучали. Система, способная автономно выявлять и эксплуатировать уязвимости в кибербезопасности выше определённого порога серьёзности, опасна по определению на основе возможностей, независимо от объёма вычислений, затраченных на её создание. Система, способная оказать существенную помощь в синтезе биологического оружия выше определённого уровня детализации, опасна независимо от вычислительных затрат на обучение.
Определения на основе возможностей точнее нацелены на предотвращаемые ими вреды, но создают серьёзную проблему измерения. Оценки возможностей не стандартизированы. Разные методики дают разные результаты. Разработчики передовых систем ИИ сейчас проводят такие оценки по собственным закрытым методикам, которые не проходят независимый аудит. Определение на основе возможностей в международном договоре потребует стандартизированных, независимо проверяемых методов оценки, которых пока не существует в форме, приемлемой для всех крупных государств-разработчиков ИИ.
Конвенция о химическом оружии сочетала критерий общего назначения со списками запланированных химикатов, чтобы охватить как известные, так и неизвестные опасные агенты. Критерий общего назначения определяет химическое оружие как любое токсичное химическое вещество, используемое в качестве метода ведения войны, независимо от того, включено ли оно в список. Списки запланированных веществ затем устанавливают градуированные требования к верификации для конкретных химикатов. Такой многоуровневый подход позволил договору охватывать агенты, неизвестные на момент его заключения. Управление ASI могло бы использовать аналогичную структуру: критерий общего назначения, определяющий опасный ИИ по характеру его эффектов, в сочетании со списками запланированных возможностей для известных опасных применений.
Определения по доменам относят опасный ИИ к сектору применения, а не к объёму вычислений или общим возможностям. Система, развёрнутая для автономного принятия летальных решений в военных целях, опасна. Система, управляющая критической инфраструктурой, опасна. Система, предназначенная для масштабного убеждения в ходе демократических выборов, опасна.
Определения по областям имеют преимущество: они чётко связывают обязательство по управлению с предотвращаемым вредом. Они также политически более приемлемы, чем общие определения по возможностям, поскольку государства могут принять ограничения ИИ в конкретных высокорискованных областях, не признавая принцип, что их программы ИИ в целом подпадают под международный надзор. Существенный недостаток: такие определения позволяют высокомощной системе работать без обязательств по управлению, если она развёрнута вне заданных областей, даже если ту же систему легко перенаправить на опасные применения.
Проблема движущейся границы
Определения в соглашениях по контролю над вооружениями обычно пишутся под стабильную технологию. Дальность и мощность баллистической ракеты, токсичность внесённого в список химиката, масса делящегося материала, необходимая для ядерного оружия. Эти параметры существенно не меняются за время действия договора. Возможности ИИ быстро растут, поэтому определение, адекватное сегодня, может устареть уже через несколько лет.
Так возникает проблема движущейся границы: как сформулировать определения в договоре, чтобы они оставались актуальными при развитии технологии и не требовали постоянного пересмотра самого договора. В контроле над вооружениями уже применяли три механизма для решения похожих задач.
Делегированные полномочия по определениям: договор создаёт руководящий орган, который может обновлять технические определения в заданных пределах с последующим утверждением Конференцией сторон. Организация по запрещению химического оружия использует такой подход для своих списков химических веществ, которые можно менять через Конференцию государств-участников без пересмотра самого договора. Это быстрее полной renegotiation договора, но требует, чтобы стороны доверяли руководящему органу право менять определения.
Технологически нейтральные определения: договор определяет опасный ИИ по характеру последствий, а не по конкретным техническим параметрам. Определение, охватывающее любую систему ИИ, способную вызвать массовые жертвы выше заданного порога, или любую систему, способную на автономные действия, достаточно серьёзные, чтобы угрожать критической национальной инфраструктуре, останется актуальным при смене технологий, поскольку описывает исходы, а не входные данные. Ограничение в том, что определения, основанные на исходах, труднее верифицировать: проверка касается того, что система могла бы сделать, а не того, что она уже сделала.
Положения о сроке действия и продлении: определения договора пишутся с заданным циклом пересмотра, на котором их пересматривают и обновляют. Договор вступает в силу с первоначальными определениями, продолжает действовать в период пересмотра и обновляется на каждой конференции по пересмотру. Именно так NPT проводит свои периодические конференции по пересмотру, хотя определения ядерных государств в NPT оказалось невозможно обновить через этот механизм из-за заинтересованности пятёрки постоянных членов в сохранении своего привилегированного статуса.
Измерение стратегических интересов
Переговоры об определениях — не чисто технические упражнения. Каждый выбор определения имеет стратегические последствия для того, какие государства несут наибольшие издержки соблюдения и какие сохраняют наибольшую свободу действий. Эти последствия видны участвующим правительствам и влияют на их позиции по вопросам определений.
Государства с более развитыми программами ИИ предпочитают широкие определения, которые одинаково ограничивают конкурентов на более низких уровнях развития. Порог вычислений, установленный выше текущего frontier самых передовых программ, не накладывает ограничений на ведущие государства, но требует от всех остальных оставаться ниже порога бессрочно. Государства с менее развитыми программами предпочитают узкие определения, позволяющие им достичь текущего frontier до применения обязательств по управлению, и возражают против определений, которые навсегда поставят их в невыгодное положение по сравнению с государствами, первыми создавшими frontier ИИ.
«Определение — это то место, где происходит большая часть реальной работы над договором по управлению ASI. Определение, которое политически достижимо, но технически недостаточно, даёт договор, регулирующий не тот риск. Определение, которое технически адекватно, но политически недостижимо, даёт договор вообще без договора. Единственный путь через эту проблему лежит через общие технические доказательства, поэтому Институты безопасности ИИ важнее, чем многие думают».
Именно поэтому эмпирическая работа, которую ведут Институт безопасности ИИ UK и Центр стандартов и инноваций ИИ US (оба созданы как институты безопасности ИИ), фундаментальна для переговоров о договоре, хотя эти органы и не создавались с целью подготовки договора. Создавая общее понимание того, что системы ИИ на разных уровнях способностей могут и не могут делать и какие способности коррелируют с какими рисками, они формируют фактическую основу для переговоров по определениям, которую труднее просто перекрыть стратегическими интересами. Согласие по фактам автоматически не порождает согласия по определениям, но меняет характер разногласий с чисто стратегического на отчасти технический, где общие данные дисциплинируют переговорные позиции всех сторон.
Работа над определениями должна начинаться до переговоров. Когда переговоры по контролю над вооружениями начинаются без предварительного технического консенсуса по определениям, negotiаторы обычно вырабатывают определения, отражающие наименьший общий знаменатель политического согласия, а не технические требования цели регулирования. Чем больше технической работы проделано заранее, тем прочнее основа, на которой negotiаторы смогут построить определения, действительно регулирующие то, что требуется.
Самое жёсткое возражение
Самое справедливое возражение: определения будут обходить с первого дня. Верно. Поэтому определениям нужны полномочия на обновление, тесты возможностей и триггеры по вычислительным мощностям, а не статичный глоссарий. Обход — это входные данные для проектирования. Не повод оставлять передний край без ярлыков.