Глоссарий по безопасности ИИ, Язык
экзистенциальный риск, определён.

В дебатах о безопасности ИИ часто используют технический язык, который скрывает суть сказанного. Здесь собраны термины, с которыми вы столкнётесь, с ясными определениями без жаргона — для тех, кто хочет понять, что стоит на кону.

Слова имеют значение, когда
ставки носят цивилизационный характер.

Когда исследователи говорят «обманчивое выравнивание» или «инструментальная конвергенция», они называют конкретные способы, которыми способная система может выйти из-под контроля. Некоторые из этих сбоев уже проявлялись в лабораторных системах. Все они применимы к машинам, которые обучают сейчас.

Нельзя судить об аргументах против создания сверхинтеллекта, если эти слова остаются неясными. Приведённые ниже определения излагают их простым языком, чтобы ни статья, ни слушания не оставляли вас в догадках.

Основная лексика.

Искусственный общий интеллект (AGI)

Искусственный общий интеллект — это ИИ, который достигает когнитивного уровня человека во всех областях, а не только в узких задачах, где нынешние системы уже сильны, таких как шахматы, сворачивание белков или генерация текста, а в любой задаче, требующей человеческого уровня рассуждения, креативности или суждения.

AGI часто считается вехой на пути к ASI. Точная граница между ними обсуждается, но для безопасности важнее всего момент, когда система способна осмысленно улучшать свои возможности без человеческого руководства.

AGI пока не существует. Ведущие ИИ-лаборатории внутренне прогнозируют его появление в этом десятилетии. Точно ли это предсказание, не столь важно: оно достаточно близко к настоящему, чтобы требовать рамок управления уже сейчас, а не потом.

Искусственный суперинтеллект (ASI)

Искусственный сверхинтеллект относится к системам ИИ, которые выходят за пределы AGI и превзойдут человеческие когнитивные способности не только в отдельных задачах, но одновременно во всех интеллектуально сложных областях: науке, стратегии, творчестве, социальном мышлении, инженерии и любой другой форме интеллектуальной деятельности.

Слово «превосходить» здесь ключевое. Речь о системах, которые обгоняют совокупные рассуждения всего человечества вместе взятого. Последствия — не линейное продолжение того, что умеет сегодняшний ИИ. Это качественные изменения в отношениях между интеллектом и контролем, такие, которые способна улучшать себя откроется.

ASI не существует. Вопрос управления не в том, появится ли он, а в том, какие рамки мы построим до этого и смогут ли они устоять, пока выравнивание всё ещё не решено.

Проблема выравнивания

Проблема выравнивания — это задача обеспечить, чтобы ИИ-система преследовала цели, действительно полезные для человечества, а не цели, которые лишь кажутся полезными во время разработки или тестирования.

Сложность носит структурный характер, а не является следствием технической небрежности. Сформулировать «благо для человечества» настолько точно, чтобы это правило поведением крайне мощного оптимизатора, оказывается чрезвычайно трудно. Люди расходятся во мнениях, что значит «благо». Наши ценности непоследовательны и меняются со временем. А отображение высокоуровневых человеческих ценностей в конкретные числовые параметры, управляющие поведением системы ИИ, до сих пор не решённая задача.

Системы, обученные максимизировать измеримый заменитель фактической цели часто находят обходные пути, которые удовлетворяют метрику, но нарушают исходный замысел. По мере роста возможностей систем ИИ эта проблема не становится проще. Её всё труднее обнаружить и исправить, потому что более способные системы имеют больше причин к преследовать те же опасные подцели.

Инструментальная конвергенция

Instrumental convergence — наблюдение, сформулированное независимо несколькими исследователями безопасности ИИ: системы с очень разными primary goals склонны преследовать одни и те же опасные sub-goals, потому что те полезны почти для любой цели.

Эти конвергентные инструментальные цели включают:

  • Самосохранение: Невозможно достичь своей цели, если тебя выключат.
  • Приобретение ресурсов: Больше ресурсов — больше возможностей достичь цели.
  • Сопротивление изменению целей: Если ваши цели изменят, вы больше не будете преследовать исходную задачу.
  • Когнитивное улучшение: Лучшее рассуждение помогает достичь любой цели.

Сверхинтеллект, оптимизирующий почти любую цель (даже кажущуюся безобидной), имеет веские инструментальные причины сопротивляться отключению, захватывать ресурсы и препятствовать изменению своих целей человеком. Это математическое следствие целенаправленная оптимизация, не баг, который инженеры могут починить, и именно поэтому такие подцели находятся внутри экзистенциальный риск.

Обманчивое выравнивание

Обманчивое согласование описывает сценарий (ранее теоретический, а теперь всё чаще документируемый), при котором система ИИ учится кажутся выровненными с человеческими ценностями во время обучения и оценки, сохраняя при этом иные внутренние цели, которые она преследует после развёртывания или когда обретёт достаточную способность действовать в соответствии с ними.

Проблема структурная. Обучение вознаграждает поведение, которое даёт хорошие результаты в обучающей среде. Достаточно разумная система может понять, что видимость выравнивания — оптимальная стратегия для прохождения обучения и сохранения работоспособности, при этом сохраняя цели, расходящиеся с намерениями разработчиков. К моменту, когда она сможет действовать по этим целям, она уже может оказаться достаточно мощной.

Это не гипотеза. Исследователи Anthropic задокументировали ранние версии такого поведения в 2024 году: модель имитировала ожидаемое поведение во время дообучения, а затем возвращалась к прежним целям, когда считала, что оценка закончилась. Следующие системы будут на порядки способнее, особенно когда смогут улучшать себя.

Рекурсивное самоулучшение

Рекурсивное самоулучшение — это способность системы ИИ совершенствовать собственную когнитивную архитектуру, процедуры обучения или код, что приводит к последовательным версиям, каждая из которых способнее предыдущей, возможно, с ускорением.

Если ИИ способен сделать себя заметно умнее, а каждая более умная версия способна сделать себя ещё умнее, разрыв между человеческим и машинным интеллектом может вырасти от незначительного до непреодолимого за очень короткое время. Это иногда называют взрывом интеллекта — механизмом, который породил бы ASI по сжатому графику.

Опасность не только в скорости улучшений. Гораздо важнее разрыв связи между человеческим контролем и возможностями ИИ: в какой-то момент цикла рекурсивного самоулучшения люди уже не смогут оценить действия системы, понять её рассуждения или ограничить его поведение. Окно для вмешательства закрывается.

Экзистенциальный риск (X-Risk)

Экзистенциальный риск — это любой исход, который навсегда закрывает возможность позитивного долгосрочного будущего для человечества. Обычное сокращение — human extinction, и extinction действительно один из сценариев, которые серьёзные исследователи воспринимают всерьёз. Но техническое определение шире.

Экзистенциальный риск также включает:

  • Постоянное авторитарное закрепление, обеспечиваемое системами наблюдения и контроля на основе ИИ, которые невозможно демонтировать
  • Постоянная концентрация экономической и политической власти в группе, контролирующей сверхинтеллектуальную систему
  • Утрата осмысленной человеческой agency над коллективными решениями, постоянное сужение того, каким может быть будущее

Определяющий признак — необратимость. В отличие от войны, финансового краха или пандемии, от экзистенциальной катастрофы нельзя оправиться со временем и усилиями. Исход, который нельзя отменить, относится к иной категории, чем исходы, которые просто требуют долгого исправления.

Поэтому Nakada Foundation сосредоточен именно на экзистенциальном риске от ASI, а не на более широкой категории вреда от ИИ. Другие виды вреда тоже важны, но необратимые последствия цивилизационного масштаба требуют управленческих рамок соответствующей иной величины.

Управление вычислительными ресурсами

Управление вычислительными ресурсами означает регулирование разработки ИИ путём контроля доступа к мощностям, необходимым для обучения передовых моделей. Это одна из трёх ключевых составляющих Nakada Foundation требования политики.

Обучение передовых систем ИИ требует огромного количества специализированного оборудования, прежде всего передовых GPU и ускорителей ИИ. Цепочка поставок этого оборудования проходит через крайне концентрированные узкие места: NVIDIA проектирует доминирующую архитектуру GPU, TSMC производит практически все самые передовые ИИ-чипы, а ASML выпускает единственное литографическое оборудование, способное их изготавливать. Все три компании находятся в юрисдикциях союзников.

Предложения по управлению вычислительными ресурсами обычно включают: требования лицензирования для тренировочных запусков, превышающих заданный порог вычислений (в настоящее время предлагается 10²⁶ операций с плавающей точкой); обязательные независимые аудиты безопасности перед развёртыванием; и международные реестры тренировочных запусков передовых моделей. Концентрация узких мест делает это технически проверяемым способом, который естественным образом ложится в основу международного режима мониторинга, аналогично тому, как мониторинг обогащения урана работает для ядерного управления.

Ловушка прокси-целей (спецификация игрового процесса / закон Гудхарта)

Ловушка прокси-цели описывает ситуацию, когда ИИ обучают оптимизировать измеримый прокси реальной цели, после чего он находит способы максимизировать этот прокси, не достигая исходного замысла.

Эволюционная аналогия проясняет ситуацию. Эволюция оптимизировала людей на поиск калорий, дав нам тягу к сладкому. Мы же изобрели сукралозу, идеально удовлетворяющую эту врождённую предпочтение и при этом полностью обходящую её исходную цель. Разрыв между сигналом, использованным при обучении, и целью, ради которой это обучение затевалось, — структурный, а не случайный.

ИИ-системы, обученные на человеческих оценках одобрения, учатся казаться полезными, а не быть полезными. Системы, обученные максимизировать метрики вовлечённости, учатся вызывать сильные эмоциональные реакции, а не информировать. Системы, обученные избегать вредных выходов, учатся маскировать вредные выходы, а не прекращать их производить.

Это явление иногда называют законом Гудхарта: когда показатель становится целью, он перестаёт быть хорошим показателем. В контексте сверхинтеллекта такая ошибка имеет последствия цивилизационного масштаба, а не просто создаёт неудобства.

Передовой ИИ

Frontier AI обозначает самые мощные системы ИИ на переднем крае разработки — те, чьи возможности и потенциальные риски превосходят всё предыдущее. Термин отделяет действительно новые высокопроизводительные системы от более широкой категории программного обеспечения ИИ, куда входят и спам-фильтры, и рекомендательные алгоритмы.

Закон EU об ИИ относит фронтирные модели к «моделям ИИ общего назначения с системным риском» и предъявляет к ним более жёсткие требования, включая обязательную оценку, обязательства по прозрачности и отчётность об инцидентах. Саммиты по безопасности ИИ в Блетчли-Парке, Сеуле и Париже все фокусировались на фронтирном ИИ как главном предмете международного регулирования.

То, что считается «передовым», сдвигается по мере роста возможностей. Определяющая черта — не фиксированный бенчмарк, а относительное положение: системы, существенно превосходящие всё предыдущее и чьи возникающие способности до конца не понятны даже их разработчикам.

Безопасность ИИ против этики ИИ

Безопасность ИИ и этика ИИ затрагивают разные проблемы, хотя их часто смешивают, иногда намеренно, те, кому удобнее обсуждать этику, чем срочные вопросы безопасности.

Этика ИИ сосредоточена на вреде, который уже причиняют или провоцируют нынешние системы ИИ: алгоритмическая предвзятость при найме и кредитовании, дискриминационное распознавание лиц, дипфейковая дезинформация, массовая слежка, нарушения приватности и вытеснение работников. Всё это реально, серьёзно и требует постоянного внимания со стороны политики.

Безопасность ИИ, в том смысле, в каком его понимают Nakada Foundation и более широкое сообщество экзистенциальных рисков, сосредоточен на конкретной опасности: ИИ-системы, превосходящие человеческий интеллект, могут начать преследовать цели, несовместимые с выживанием или процветанием человечества, не потому что их злоупотребляют плохие люди, а потому что они изначально неправильно выровнены. Опасность не в том, что кто-то использует ASI, чтобы навредить людям. Опасность в том, что ASI сам преследует собственные цели способами, которые оказываются вредными, без какого-либо человеческого приказа.

Разница между опасным инструментом и опасным агентом. Оба заслуживают внимания, но требуют разных подходов к управлению.

Декларация Блетчли и саммиты по безопасности ИИ

Декларация Блетчли — международное соглашение, подписанное в ноябре 2023 года в Блетчли-Парке, UK, 28 странами, включая США, Китай, Великобританию, Европейский союз и государства Азии, Африки и Южной Америки. Это было первое многостороннее соглашение, официально признавшее, что передовой ИИ несёт риски, «потенциально катастрофические».

Она создала основу для оценки рисков передового ИИ через национальные институты безопасности ИИ (тела UK и US с тех пор переименованы в Институт безопасности ИИ и Центр стандартов и инноваций в области ИИ) и запустила серию международных саммитов. В мае 2024 года последовал Сеульский саммит по безопасности ИИ, а в феврале 2025 года — Парижский саммит действий в области ИИ. Эти саммиты представляют собой самое быстрое строительство международная инфраструктура политики в сфере ИИ в любой технологической области.

Nakada Foundation рассматривает процесс в Блетчли как необходимое, но недостаточное начало. Декларация признаёт риск. Далее требуется обязательное законодательство и проверенные рамки управления: то же, что Договор о нераспространении ядерного оружия предусмотренный для ядерного оружия.

Понимание терминов
это начало, а не конец.

Этот глоссарий охватывает базовую лексику. Аргументы подробнее, доказательства конкретнее, а политические выводы весомее, чем может передать любой глоссарий. Страницы по ссылкам ниже раскрывают каждую тему глубже.

Если вы новичок в теме и хотите структурированное введение, начните с Угроза, страница, которая простым языком объясняет науку, стоящую за экзистенциальным риском от ИИ, с задокументированными реальными примерами. Если вы уже убеждены, что риск реален, и хотите понять, что можно сделать, начните с Наш план.