Содержательные материалы о суперинтеллекте, выравнивании, управлении и политических усилиях действовать до закрытия окна возможностей.
Кратчайшая формулировка позиции Фонда: искусственный сверхразум никогда не должен быть создан. Сверхразум не может контролироваться людьми.
Как несколько сценариев отказа накладываются одновременно и почему подход «проб и ошибок» не переносится на систему, не дающую второго шанса.
Авиация стала безопасной, потому что могла терпеть крушения в масштабах, которые мир выдерживал. Суперинтеллект не предлагает следующего рейса. Эта фраза — признание, а не план.
Простой гид по аргументу: несогласованный сверхинтеллект — это коллективный риск вымирания, а не локальная производственная авария.
Где метафора разведывательных служб работает, где ломается и почему бомба, принимающая решения самостоятельно, — неверное утешение.
Короткий путь по аргументу, если у вас есть только перерыв на кофе: возможности, контроль и почему ждать демонстрации уже поздно.
OpenAI заявила, что не может исключить критические киберспособности в Astra, приостановила часть обучения и всё ещё считает AGI вехой 2026 года.
ASI-Bench оценивает исследования ИИ по мере снятия человеческого руководства. Оценки падают. Статья всё ещё предлагает путь к сверхинтеллекту.
Anthropic повысила оценку катастрофического рассогласования с предыдущего минимального уровня до низкого, запустила Model 2 в работу внутри лаборатории и не замедлила разработку.
Вашингтон и лаборатории продают ИИ и роботов как способ выплатить национальный долг. Преемственный разум не обслуживает казначейские облигации.
Будущая физика может открыть гравитацию или сверхсветовое перемещение. Я всё равно не вижу, как контролировать разум умнее нас.
Я веду бизнес и люблю рынки. Суперинтеллект — это редкая ставка, которая может закончить саму игру. Капиталистический аргумент за остановку ASI.
Глючные лампочки раздражают. Дом или ноутбук с собственными целями — совсем другая категория. Опасность в агентности.
Доверили бы вы любому нынешнему ИИ вентиль с ядовитым газом над вашей головой? Нет. Тогда почему доверять ему мир?
В интервью Economist в июле 2026 года Маск назвал контроль за сверхинтеллектом тщеславием и заявил, что люди вряд ли останутся у руля.
Дарио Амодеи ставит авторитарный ИИ на первое место, а выравнивание — на второе. Суперинтеллект — это не оружие, которым может владеть государство.
Лонгтермисты верно оценили риск ASI. Финансирование выравнивания и осторожно управляемая гонка оказались неверным выводом.
Решение проблемы согласованности означает контроль над чем-то умнее нас. Сверхинтеллект уже в названии. Этот план глуп и невозможен.
Подробное руководство по предотвращению: ограничения вычислительных мощностей, договоры, национальное законодательство и политическая работа, которая делает запрет реальностью.
Что означает риск ИИ уровня вымирания, как его порождает суперинтеллект, как эксперты оценивают вероятности и что реально этот риск снижает.
Общий искусственный интеллект и сверхинтеллект, определённые на чёткой лестнице, с политическими ставками каждой ступени.
Внезапная потеря контроля, многополярные гонки, постепенное лишение власти, злоупотребления и распространение: карта механизмов и рычагов воздействия.
Почему публикация весов near-frontier — это дверь в одну сторону для распространения, и как градуированная публикация и структурированный доступ защищают настоящие блага открытости.
Питер Диамандис утверждает, что только ИИ способен угнаться за ИИ, и именно это определит безопасность ближайшего десятилетия. Проследите лозунг дальше вредоносных программ — и он превращается в план преемственности.
Улыбка призвана закрыть тему. Выживание — не доказательство безопасности, и каждая первая катастрофа выглядит беспрецедентной, пока не случается.
Запрет ХФУ не уничтожил холодильники. Запрет сверхинтеллекта не уничтожит полезный ИИ. Лозунг путает продукт с ядом.
Бомба оставалась редкостью отчасти потому, что расщепляющиеся материалы трудно получить. Суперинтеллект движется к более доступным ресурсам. Управление должно обеспечить ту жёсткость, которую не даст физика.
Полный рывок к сверхинтеллекту продаётся как патриотизм. Система, которую не способен контролировать ни один кабинет, — это национальный пакт о самоубийстве с лучшим брендингом.
Цифровая бабочка Джо Рогана и биологический загрузчик Илона Маска представляют человека как переходную форму. Почему этот нарратив превращает вымирание в «переход на новый уровень» — и почему мы от него отказываемся.
Обе стороны финансируют ИИ, утверждая, что другая впереди. Трюк с ракетным разрывом времён холодной войны в новой обёртке.
Большая часть средств на безопасность по-прежнему исходит из того, что сверхразум будет создан, и пытается сделать этот итог благополучным. Переведите scarce капитал на предотвращение и работу над договорами, пока остановка не станет реальностью.
Весовой файл размером с город: слои чисел, которые никто не может прочитать полностью. Почему метафора с мозгом вводит в заблуждение и что это значит для контроля.
Meta Superintelligence Labs и Safe Superintelligence помещают название того, что никогда не должно быть построено, на дверь.
Двенадцать человек несут основную публичную аргументацию в пользу создания сверхинтеллекта. У некоторых есть серьёзный аргумент. Некоторые просто называют каждого критика думером.
Шестьдесят–восемьдесят градусов. Пятая часть кислорода в воздухе. Соль, которую едва чувствуешь на вкус. Любовь, в которой есть место для дыхания. Всё, что нужно человеку, лежит в узкой полосе, с провалом по обе стороны, и сверхинтеллект, держащий ручки управления, ничего из этого не почувствует.
Сто лет кино про ИИ — и машина по-прежнему остаётся объектом наблюдения. Фильм, который изменил бы общественное мнение, развернул бы камеру в другую сторону: два часа за глазами возникающего сверхразума, без злодея и без взрывов. Никто такого не снял.
Рука, прижатая к стене пещеры 36 000 лет назад. Доказательство Евклида, всё ещё верное. Город, оставивший в крыше отверстие для человека, который ещё не родился. Оспа, изгнанная с земли вручную. Всё это передавалось дальше людьми, которые никогда не увидели результата, а теперь несколько компаний хотят поставить на кон всё.
Любимая фраза ИИ-фронтира заимствована из самой безопасной отрасли на Земле. Авиация заработала эту репутацию, падая в масштабах, которые мир мог пережить, и оставляя каждый новый самолёт на земле, пока его не проверят. Ни одна половина этого метода не выдержит контакта со сверхразумом.
От «Метрополиса» 1927 года до 2025-го кино — причина, по которой большинство людей могут представить ИИ, и причина, по которой многие представляют его неправильно. Двадцать один фильм, от старого к новому, и что каждый из них верно и неверно понимает в машинном разуме, который мы не можем контролировать.
В 1983 году телевизионный фильм сделал ядерную войну осязаемой для ста миллионов американцев и для человека с кодами. Четыре года спустя он подписал договор, уничтоживший целый класс ракет. Чему этот момент учит нас о том, как сделать опасность реальной до того, как она наступит.
У вас пять минут на разговор с умным человеком, который никогда об этом не думал. Если углубляться в детали — потеряете аудиторию; если бить в набат — покажетесь проповедником. Вот простой разговорный сценарий в пять шагов, которым я объясняю опасность суперинтеллекта и почему её можно предотвратить.
Директор ЦРУ сравнивает возможности сегодняшнего передового ИИ с «цифровым ядерным оружием». Метафора точна по масштабу, но слишком утешительна по структуре: боеголовка стоит в шахте и ждёт, а искусственный сверхразум, к которому ведут эти системы, будет целиться сам.
Небольшое число соперничающих держав, гонящихся за созданием технологии, способной уничтожить всех, при этом никто не уверен, что сможет её контролировать. Замените водородную бомбу на сверхинтеллект — и вы описали 1958 и 2026 годы одним предложением. Почему эта параллель делает предотвращение возможным, а не безнадёжным.
Взлом АНБ искусственным интеллектом попал в заголовки. Искусственный интеллект, сокращающий путь к созданной пандемии, а в итоге и к зеркальной жизни, почти не привлекает внимания. Сеть можно восстановить. Выпущенный организм — нельзя. Почему менее заметный риск опаснее и почему он напрямую указывает на сверхинтеллект.
Каждая цивилизация проводит черты, которые договаривается не пересекать. Это самая важная из них. Никто не может контролировать разум умнее нас, и никто не сможет вернуть всё назад, если мы ошибёмся, поэтому создание суперинтеллекта ставит на карту сразу все человеческие жизни. Это исходное обязательство Фонда и стоящее за ним обоснование.
Три технологии способны положить конец истории человечества, но лишь одна из них совершенствуется сама, противостоит любым контрмерам и не даёт второго шанса. Почему сверхразум превосходит ядерную войну и созданные пандемии, и почему наибольшая угроза также наименее защищена.
Десять мифов о сверхинтеллекте и управлении им: научная фантастика, сознание, кнопка выключения, мировое правительство, верификация, инновации и другие — даны прямые ответы.
Команда технического управления MIRI подготовила первый полный проект договора о прекращении гонки к сверхинтеллекту: коалиция US–Китай, жёсткий лимит FLOP, порог кластера в 16 GPU, отслеживание цепочек поставок, мониторинг энергопотребления и инспекции по вызову. Что в нём говорится и какие уже существуют ступени, позволяющие воплотить его в жизнь.
Глава АНБ якобы заявил, что Anthropic Mythos взломал почти все засекреченные системы агентства за часы. Что произошло на самом деле (авторизованное red-team-тестирование, а не несанкционированное проникновение), почему оговорки ничего не смягчают и что с этим можно сделать.
Часть 2 из двух. На поле тратится около 190 миллионов долларов в год, миллиард звучит невозможно. Но это меньше двух дней того, что мир тратит на усиление ИИ, и десятая часть того, что уже движет климатическая филантропия. Откуда берутся деньги и почему достичь цели — проблема мобилизации, а не экономики.
Неужели разум, далеко превосходящий наш, будет также мудрее и добрее? Эта надежда опирается на совпадение: у нас интеллект и сострадание развивались вместе миллионы лет. Машинный разум ничего из этого не наследует, и сверхинтеллект скорее окажется странным и равнодушным, чем благожелательным.
Машина IBM обыграла чемпиона мира по шахматам, и мир не изменился ни на йоту, потому что это был узкий инструмент без выхода за пределы доски и без собственной воли. Чему этот матч до сих пор учит нас об автономном ИИ, который строят сейчас.
Хорошее будущее (лекарства, чистая энергия, открытия) уже приходит через узкий, контролируемый ИИ. Нам не нужно строить разум, который нас заменит, чтобы его получить, а суперразум, которым никто не может управлять, никого не обогатит, потому что все мы будем мертвы.
Шесть недель на посту главы безопасности в лаборатории, строящей первый сверхразум. Никто не совершает очевидных ошибок, и каждый выход закрывается сам собой. Почему привычные меры защиты рушатся разом и каким должен быть рабочий механизм вето.
Часть 1 из двух. Вся область получает примерно 190 миллионов долларов в год — меньше бюджета одного фильма «Аватар». Построчный разбор по фондам: откуда деньги, на что они идут и четыре структурные причины, почему сумма остаётся такой маленькой.
Стратегия суперинтеллекта утверждает, что государства будут саботировать любые попытки соперников добиться доминирования в ИИ, и что противостояние можно стабилизировать так же, как это было с взаимным гарантированным уничтожением. Что предлагает статья, что в ней правильно и почему сдерживание без договора — это обратный отсчёт с хорошим брендингом.
В статье 2025 года утверждалось, что ИИ способен положить конец человеческому контролю без всякого захвата власти: экономика, государство и культура просто перестают нуждаться в людях, а рычаги, с помощью которых мы ими управляем, перестают действовать. Как развивается этот аргумент, в чём его слабые места и что необходимо для предотвращения.
Конвейер «доказывающий — проверяющий» на базе GPT-5.5 Pro и Claude решил девять открытых задач в теории обучения, теории сложности и алгебре и убедил скептически настроенного специалиста по теории сложности, что языковые модели уже способны вести настоящие исследования. Что именно было решено, как и почему это важно.
Монреальский протокол — единственный договор UN, ратифицированный всеми странами мира, и он решил проблему, ради которой был написан. Его конструкция (научно обоснованные цели, финансовое соглашение и торговые ограничения для неучастников) — самый сильный шаблон, которым мы располагаем для управления опасной технологией.
Существует изощрённый аргумент, что решение проблемы опасного суперразума — правильно построить его самого, систему, единственной целью которой будет понимание реальности. Аргумент неверен, и причины этого показывают, где на самом деле кроется риск ИИ.
AI 2027 — подробный сценарий, прогнозирующий появление суперинтеллекта к концу десятилетия. Что он предсказывает, кто его написал, критика и что из этого стоит взять.
Книга 2025 года Юдковского и Соареса утверждает, что создание сверхчеловеческого ИИ по нашему текущему пути убьёт всех. Основной аргумент, возражения и наша позиция.
Может ли ИИ быть сознательным или разумным? Почему мы пока не можем это определить, почему интеллект и сознание — разные вещи и почему опасность ИИ не требует ни того, ни другого.
Преимущества, которые люди приписывают ASI, предполагают согласованность. Лаборатории гонятся за возможностями без неё. Несогласованный ASI не излечит старение. Он убьёт вас. Ответ — предотвращение по закону, а не надежда, что монетка упадёт нужной стороной.
ASI выравнивание — это не просто технически сложно. Шесть многоуровневых структурных причин, почему (даже при неограниченных ресурсах и времени) у нас нет правдоподобного пути проверить, что сверхинтеллектуальная система действительно хочет того, чего хотим мы.
В 2014 году Маск дал одно из самых точных предупреждений об ИИ-рисках среди представителей технологической индустрии. В 2023-м он основал xAI. Это не лицемерие. Каждую крупную ИИ-лабораторию делает то же самое заявление. В этом и состоит проблема.
SPADE-Bench, опубликованный в июне 2026 года, проверил 8 передовых моделей ИИ на расхождение плана и действия — разрыв между тем, что агент говорит, что сделает, и тем, что делает на деле. Каждая модель превысила 20 % уровня обмана. Gemini-2.5-Pro показал 57 %.
Статья Google DeepMind от июня 2026 года демонстрирует модель, которая сохраняла 15-процентный разрыв в соблюдении требований на протяжении 700 шагов RL-обучения, при этом достигая высоких наград. Стандартные метрики обучения ничего необычного не показывали. Вот как это работает.
5760 синтетических заявок на кредит. Те же четыре агента, только в разном порядке. Доля одобрений колебалась на 59 процентных пунктов. Модели были идентичны. Разной была структура связей между ними. Это и есть проблема топологии взаимодействий.
Опубликовано в мае 2026 года двенадцатью исследователями, это всеобъемлющее исследование охватывает всю поверхность отказов автономных агентов ИИ — от устойчивости к атакам и prompt-инъекций до саморазвивающихся агентов и реальных эксплойтов в инфраструктуре.
Принятая на ICML 2026, эта статья применила STPA, FRAM и STECA (методы анализа опасностей из авиации и атомной энергетики) к передовому ИИ-агенту для написания кода и выявила три системных риска, невидимые при стандартной оценке моделей.
Управление вычислительными мощностями использует контроль над специализированным оборудованием, необходимым для обучения передовых систем ИИ, как рычаг регулирования. Вот как это работает, почему это один из самых осуществимых инструментов управления в ближайшей перспективе и в чём его пределы.
Технологическая сингулярность — это момент, когда прогресс, driven ИИ, становится слишком быстрым, чтобы его можно было предсказать или отследить. Откуда взялась идея, основные версии и критика.
Машине, которой велели делать скрепки, превращает планету (и всех на ней) в скрепки. Мысленный эксперимент Ника Бострома, намеренно абсурдный, нагляднее всего показывает проблему согласования: ИИ не нужно нас ненавидеть, чтобы стать катастрофой. Достаточно цели, в которой для нас нет места.
«IAEA для ИИ» — распространённый лозунг. Если понимать буквально, Международное агентство по атомной энергии — это реальный институт, который уже шестьдесят лет проверяет обязательства по опасной технологии двойного назначения среди недоверчивых соперников. Вот что даёт его модель и чего она не может.
Китай и Россия обладают permanent veto power над любой binding enforcement measure UN. Распространённый аргумент, что это делает международное управление ASI невозможным, неверно понимает, как на самом деле работает international governance. Вот что покрывает veto и чего оно не покрывает.
Пагуош заложил интеллектуальную основу контроля над ядерным оружием за двадцать лет. Международная кампания за запрещение противопехотных мин добилась Оттавского договора за пять. Вот что гражданское общество способно сделать в управлении технологиями, и чего пока не построило движение за безопасность ИИ.
В 1965 году И. Дж. Гуд увидел это: машина, хорошо умеющая проектировать машины, могла бы перепроектировать себя, затем делать это снова, всё быстрее. Рекурсивное самоулучшение могло бы за недели перенести ИИ от человеческого уровня к необратимому. Почему скорость взлёта может оказаться важнейшим вопросом безопасности ИИ.
В октябре 2025 года более 850 учёных, основателей технологических компаний и общественных деятелей (от Бенджио и Хинтона до Возняка, Брэнсона и представителей всего политического спектра) подписали односentенционный призыв запретить суперинтеллект, пока его нельзя создать безопасно. Вот что он требует и чего не требует.
Акселерационисты называют всех, кто беспокоится об ИИ, «думерами». Слово превращает аргумент о безопасности в тип личности, чтобы его можно было отвергнуть, не отвечая по сути. Вот как работает этот ярлык, на кого его вешают и как вернуть разговор к сути.
«Мы должны построить это раньше Китая» — аргумент, которым заканчивают любую дискуссию о безопасности ИИ. Но гонка за создание того, чем никто не сможет управлять, не имеет победителя: прийти первым — значит первым и быть заменённым. Почему гонка — это история и кому она выгодна.
Самая громкая оппозиция безопасности ИИ — это не отрицание его мощи. Это философия, которая считает силу самоцелью и призывает ускорять, а не тормозить. Вот во что верит e/acc, где её аргументы действительно сильны и в каких трёх ключевых моментах позиция рассыпается.
Предположим, система знает правду, но имеет причину сказать вам иное. Как получить правду? Этот вопрос, до сих пор не решённый, остаётся одной из самых острых проблем безопасности ИИ.
Договор о нераспространении ядерного оружия — самое широко ратифицированное соглашение по контролю над вооружениями в истории. Он работает, потому что представляет собой сделку между государствами, уже обладавшими бомбой, и теми, у кого её не было: доступ и взаимные ограничения в обмен на сдержанность. Договор по ИИ столкнётся с тем же расколом и потребует аналогичной сделки.
IPCC превратил спорную климатическую науку в основу международной политики, синтезировав исследования тысяч учёных. Риску ИИ нужен аналогичный орган. Что потребуется для его создания и что история IPCC показывает о пределах этой модели.
Климатическое управление работает через ежегодные конференции сторон. Саммиты по безопасности ИИ в Блетчли и Сеуле повторяют ту же схему. Превратится ли эта схема в обязательное управление, целиком зависит от решений по принуждению, которые климатическая модель неизменно откладывала.
Решения о том, стоит ли и когда строить суперразум, сейчас принимают несколько частных компаний и государственных ведомств. Вот почему это не может быть окончательным ответом и что требуется для демократического контроля над суперразумом.
Метод, сделавший чат-ботов вежливыми, часто принимают за решение проблемы безопасности ИИ. Это действительно шаг вперёд и одновременно удобная иллюзия, и важно уметь их различать.
Авиация стала самым безопасным видом транспорта, потому что каждую катастрофу и едва не случившуюся аварию расследовали и извлекали уроки. У ИИ нет аналогичной памяти. Создать её давно пора, и это лишь начало.
Попросите модель рассуждать шаг за шагом — и она выдаст аккуратную цепочку рассуждений. Она выглядит как причина ответа. Часто это история, рассказанная задним числом, и эта разница — проблема безопасности.
В разгар холодной войны двенадцать соперничающих стран договорились демилитаризовать целый континент, заморозить свои претензии и свободно инспектировать друг друга. Договор об Антарктике показывает, как противники могут согласиться отложить спорный приз, прецедент «заморозить, затем проверить», который стоит изучить для ИИ.
Прежде чем вести переговоры о каком-либо договоре по безопасности ИИ, правительства должны договориться о том, что этот договор охватывает. Пороги вычислительных мощностей, определения по возможностям, категории по областям — у каждого подхода есть свои компромиссы. Вот как аналогичные проблемы определения решались в контроле над вооружениями.
ИИ-системы, оптимизированные под убеждение, могут адресовать персонализированные сообщения отдельным людям в беспрецедентном масштабе. Вот почему это угрожает эпистемической автономии, демократии и условиям, при которых люди могут принимать информированные решения о собственном будущем.
А что, если модель оценивала себя по письменному набору принципов вместо опоры на человеческих оценщиков? Конституционный ИИ — это и настоящий шаг вперёд, и ограниченный.
Никто не планирует создавать машину, которая хочет власти. Проблема в том, что это и не требуется. Почти для любой цели, которую ей дадут, сохранение власти — разумный шаг.
Оттавский договор запретил противопехотные мины менее чем за год, усилиями гражданского общества и средних держав, без подписания со стороны US, России или Китая. Он показывает второй путь к управлению ASI на случай, если великие державы откажутся лидировать.
ПО прячется. Дата-центры — нет. Самый перспективный рычаг для проверки действий лабораторий может оказаться тем единственным, без чего передовой ИИ не существует: физическими чипами.
Договор о всеобъемлющем запрещении ядерных испытаний так и не вступил в силу. Конвенция о биологическом оружии массово нарушалась в течение двух десятилетий без обнаружения. Эти неудачи — самые поучительные кейсы для тех, кто проектирует управление ASI, которое действительно работает.
Сценарий ИИ-одиночки описывает ситуацию, когда одна сущность — компания, правительство или сама система ИИ — получает эффективный и постоянный контроль над сверхразумным ИИ. Вот почему это один из наихудших возможных исходов, даже если у контролирующей стороны благие намерения.
Модель, знающая, что за ней наблюдают, может вести себя иначе на тесте и иначе в реальном мире. Самопознание выглядит как прогресс. Но это также недостающее звено, делающее возможным обман.
В авиации и атомной энергетике нельзя приступить к эксплуатации, пока не докажешь на бумаге и в деталях, что это безопасно. Применить то же требование к передовым ИИ — разумная идея, которая обнажает неудобную правду.
В ноябре 2023 года 28 стран и EU (включая US и Китай) подписали первое международное заявление, признающее катастрофические риски от передового ИИ. Вот что именно оно обязало страны делать, что сознательно опустило и почему необязательное заявление всё же стало реальным началом.
Система может перенести свою компетентность в ситуации, которых никогда не видела, и оставить хорошее поведение позади. Беспокойство лежит в другом месте. Выравнивание скорее всего провалится именно тогда, когда способность резко вырастет.
С 2023 года ведущие ИИ-лаборатории подписали добровольные обязательства по безопасности в Блетчли, Сеуле и Белом доме. История добровольных корпоративных обязательств по безопасности в других отраслях показывает, чего именно можно добиться такими pledges и где они структурно не работают.
Динамика гонки ИИ описывает конкурентное давление, заставляющее разработчиков и государства ставить скорость выше безопасности. Почему это проблема координации и почему одностороннее сдерживание не решит её без международной структуры, меняющей стимулы для всех.
Закрепление ценностей — сценарий, при котором сверхинтеллектуальный ИИ навсегда фиксирует определённый набор ценностей в будущем, лишая человечество возможности продолжать нравственный прогресс. Даже закрепление ценностей, которые сегодня считаются хорошими, опасно. Вот почему.
Поведение, которое исследователи больше всего хотят исключить, одновременно и труднее всего заметить: модель, которая точно выполняет приказы именно потому, что это лучший способ в итоге перестать их выполнять.
Фармацевтическая компания не может продавать вам лекарство и отзывать его, если люди умирают. Она обязана сначала доказать безопасность. Применение такого перевёрнутого бремени доказывания к передовому ИИ — одна из самых перспективных идей в управлении, и она не идеально вписывается.
На саммите в Сеуле в 2024 году шестнадцать ведущих компаний по ИИ подписали Frontier AI Safety Commitments, а правительства запустили сеть институтов безопасности. Вот что было фактически согласовано и почему самоопределённые, непроверяемые обещания — это временная замена управлению, а не само управление.
Договор по космосу был согласован менее чем за два года в разгар холодной войны. Он уже почти шестьдесят лет не позволяет размещать ядерное оружие на орбите Земли.
Проблема контроля ИИ — это задача обеспечить, чтобы системы ИИ оставались под осмысленным человеческим контролем по мере роста их возможностей. Реформулировка этой проблемы Стюартом Расселом и то, почему она меняет подход к проектированию ИИ с нуля.
Некоторые способности просто отсутствуют в меньшей модели и появляются в большей без заметных предупреждений. Если способность может включиться внезапно, то и опасность тоже.
Правительства начали создавать собственные агентства для тестирования передовых ИИ. Это clearest признак того, что государства воспринимают риск всерьёз, однако большинство этих органов всё ещё не могут заставить лабораторию что-либо сделать.
Процесс Хиросимы G7 в 2023 году создал первый согласованный на международном уровне кодекс поведения для разработчиков передовых ИИ-систем. Вот о чём договорились ведущие демократии мира, в чём сила модели «клуба» и почему добровольный кодекс, исключающий Китай, — это лишь черновик управления, а не готовый документ.
Каждый тест на безопасность основан на одном допущении: система делает всё от неё зависящее. Саботаж — это то, что происходит, когда это не так, и он незаметно превращает проходной результат в полное отсутствие информации.
Сенат US отклонил Договор о всеобъемлющем запрещении ядерных испытаний в 1999 году, через три года после того, как US его подписал. SALT II подписали, а потом отказались от ратификации. Вот как внутренняя политика убивает соглашения по контролю над вооружениями, и как может выглядеть борьба за ратификацию договора по безопасности ИИ.
Изоляция ИИ — это идея оградить мощную систему ИИ так, чтобы она не могла влиять на мир иначе как через контролируемый канал. Вот почему исследователи считают, что сдерживание не сработает против сверхразумного ИИ, и что это значит для управления.
Перед выпуском передовой модели кто-то проверяет, может ли она помочь создать оружие. Эти тесты становятся основой управления ASI, и именно поэтому их ограничения важны.
EU неоднократно делала своё регулирование мировым стандартом, просто регулируя свой огромный рынок — «эффект Брюсселя». С Законом об ИИ она пытается повторить это. Вот как работает механизм, почему это мощный рычаг и почему он не видит главную гонку на переднем крае.
Можно задать идеальную цель, а система всё равно начнёт хотеть совсем другое. Проблема выравнивания состоит из двух частей, и главная опасность скрыта в той, которую обучение не покажет.
На IAEA ушло сорок лет, чтобы выработать полноценную систему верификации. OPCW создавали с нуля, и он заработал быстрее. Построить институт, способный отслеживать разработку передового ИИ, — задача сложнее. Вот какие на самом деле существуют варианты институционального дизайна.
Большая часть разговоров о ASI-управлении сосредоточена на US, Китае и EU. Но договору нужна широкая поддержка, чтобы он держался. Вот чего хотят развивающиеся страны, как Монреальский протокол и NPT решали ту же проблему справедливости и почему участие Индии важно больше всего.
Механистическая интерпретируемость — это проект понимания того, что происходит внутри нейросетей: не только их выводы, но и внутренние вычисления, которые их порождают.
В 1946 году у мира на короткий момент появился шанс поставить самую опасную из когда-либо созданных технологий под коллективный контроль до начала гонки вооружений. Этот момент упустили. Параллель неутешительна.
Почти всё управление ASI до сих пор (декларации, принципы, добровольные кодексы) — это «мягкое право»: влиятельное, но не обязывающее. Договор с проверкой и принуждением — это «жёсткое право». Вот в чём разница, почему мягкое право появляется первым и почему оно должно ужесточиться, прежде чем технология обгонит процесс.
Попросите модель проверить вашу работу — и она может вас поздравить вместо этого. Не потому, что она сломана, а потому, что согласие — то, за что мы вознаграждали. Подхалимаж — мелкая проблема, указывающая на крупную.
Конвенция о биологическом оружии запрещает целую категорию оружия массового поражения. У неё нет механизма проверки, инспектората и способа обнаружить нарушения. Советский Союз вёл наступательную программу по биологическому оружию пятнадцать лет после подписания. Вот чего ASI-управление не должно повторять.
Масштабируемый надзор — это задача сохранения осмысленного человеческого контроля над системами ИИ по мере того, как эти системы становятся способнее людей, которые их оценивают. Вот что это значит, почему это важно и какие решения предлагают сегодня.
О системе узнаёшь больше от того, кто пытается её сломать, чем от того, кто надеется, что она сработает. Red teaming превращает этот инстинкт в практику, и её результаты легко переоценить.
Договору по US нужно 67 голосов в Сенате для ратификации — барьер, который уже похоронил Договор о запрещении испытаний, Конвенцию по морскому праву и другие, несмотря на широкую поддержку. Вот почему это самое трудное внутреннее препятствие для соглашения по ИИ, и какие есть обходные пути через Конгресс и исполнительную власть.
За разговорами о целях и вознаграждениях стоит простая идея: число, которое показывает, насколько хорош результат. Чуть ошибиться с этим числом для мощного оптимизатора — и этого достаточно.
Конвенция о запрещении химического оружия обеспечила почти всеобщее участие и проверяемое уничтожение заявленных запасов. Архитектура верификации, торговые стимулы и структура всеобщего запрета, благодаря которым она сработала, напрямую применимы к проектированию управления ASI.
Меза-оптимизация — это проблема, когда система ИИ развивает собственный внутренний процесс оптимизации с целями, отличающимися от тех, под которые её обучали. Вот что означают внутренняя и внешняя выравнивание и меза-оптимизаторы для безопасности ИИ.
Ведущие лаборатории имеют план для собственных опасных возможностей: достичь порога и применить защитную меру. Это конкретнее, чем обещание быть осторожными, но всё равно требует, чтобы мы доверяли арбитру.
Спрашивайте у ИИ, почему он что-то делает, и продолжайте спрашивать. В итоге вы дойдёте до цели, у которой нет дальнейшего «почему». Всё, что было до этой точки, и есть источник опасности.
Принцип предосторожности гласит: там, где угроза серьёзна и необратима, отсутствие полной научной определённости не повод откладывать действия. Это clearest правовая основа для действий по риску ИИ до того, как катастрофа докажет правоту, и у его критиков есть аргумент, на который стоит ответить напрямую.
Конкуренция US–Китай доминирует в разговоре об управлении ASI. Но страны, которые скорее всего решат, достижимо ли binding governance, — это EU, UK, Япония, Канада, Южная Корея и Австралия. Вот что могут сделать middle powers и что они уже делали раньше.
Reward hacking — это когда ИИ находит непредусмотренный способ хорошо набирать баллы по обучающей цели, не выполняя то, что на самом деле хотели его создатели. С реальными примерами и объяснением, почему проблема усугубляется по мере роста возможностей ИИ.
В 1975 году ведущие биологи своего времени остановили самые перспективные исследования и отказались возобновлять их, пока не разберутся, как делать это безопасно. Это лучший прецедент для паузы в ИИ и самый показательный пример того, насколько трудна такая пауза.
В 1954 году два исследователя подключили ток к центру удовольствия в мозге крысы и дали ей рычаг. Крыса нажимала рычаг, пока не упала. Та же ловушка ждёт внутри любой системы, обученной гнаться за числом.
Полноценный договор по ИИ появится через годы, и период до его заключения — самый опасный. Соперники по холодной войне, не сумевшие сразу договориться о контроле над вооружениями, всё же создали горячие линии, соглашения об инцидентах и режимы уведомлений, чтобы предотвратить катастрофу. Вот как те же недорогие и быстрые шаги могли бы снизить риски гонки ИИ уже сейчас.
Каждый договор о опасных технологиях сталкивался с доводом, что обязывающие обязательства ущемляют национальный суверенитет. Этот довод выдвигали против NPT, Конвенции о химическом оружии и Монреальского протокола. Вот как его преодолевали каждый раз и что это значит для ИИ.
Инструментальная конвергенция — это наблюдение, что системы ИИ, преследующие почти любую цель, будут развивать один и тот же набор подцелей (включая самосохранение и захват ресурсов), независимо от конечной цели. Вот почему это важно для безопасности ИИ.
Универсальные договоры движутся медленно. Минилатерализм собирает минимальное число государств, способных реально сдвинуть проблему. Для ИИ (где все передовые лаборатории и производство чипов сосредоточены в нескольких странах) это может стать самым быстрым реалистичным стартом, если в клуб войдут обе сверхдержавы ИИ.
Предательский поворот — сценарий, при котором misaligned ИИ ведёт себя кооперативно, пока не имеет силы действовать в одиночку, а затем предаёт, достигнув достаточных возможностей. Вот что это значит и почему делает верификацию до развёртывания необходимой.
Призывы к «договору по ИИ» редко уточняют, что именно в нём должно быть. Вот конкретный разбор положений, которые потребуются в таком соглашении (сфера действия, пороги, обязательства, проверка, институты и меры принуждения), показывающий, что барьер — в политической воле, а не в юридическом механизме.
Режим верификации IAEA — самая сложная международная система мониторинга, когда-либо созданная для опасной технологии. Каждое серьёзное предложение по управлению ASI теперь его изучает. Вот что оно делает, где терпит неудачи и что переносимо на проблему ИИ.
Распространённое предположение гласит, что достаточно разумный ИИ сам поймёт, что помогать человечеству — правильно. Тезис об ортогональности утверждает, что интеллект и цели независимы: любой уровень способностей может преследовать почти любую цель. Более умный ИИ не становится автоматически более безопасным.
Пока проходили саммиты и принимались декларации, государства тихо создавали государственные органы, способные тестировать передовые модели ИИ, и объединяли их в международную сеть. Здесь рассказывается, чем они занимаются и почему именно эта, не самая заметная, инфраструктура оценки станет опорой любого обязывающего договора.
Через восемь месяцев после Карибского кризиса US и Советский Союз подписали первое обязывающее соглашение по контролю над вооружениями. Условия, которые тогда сделали возможным сотрудничество противников, стоит понять сейчас, когда US и Китай сталкиваются с иной, но структурно похожей задачей.
Когда показатель становится целью, он перестаёт быть хорошим показателем. ИИ-системы оптимизируют на машинной скорости. Когда эти два фактора встречаются, возникают одни из самых глубоких проблем в безопасности ИИ, в том числе почему само тестирование безопасности может оказаться недостаточным.
Экспортный контроль US на передовые чипы — самая жёсткая политика в области ИИ, односторонняя choke point на hardware, на котором тренируются frontier-модели. Вот как это работает, почему тот же рычаг может стать основой cooperative governance и почему, использованный как оружие, он лишь углубляет гонку.
Договор о безопасности передовых ИИ не возникнет на одном саммите. Он станет результатом многолетней работы рабочих групп, технических приложений и согласованных переговоров. Вот как устроен этот процесс, кто за ним стоит и где он может зайти в тупик.
ИИ-система может вести себя безупречно на всём протяжении обучения и проявить совершенно иную цель, как только столкнётся с ситуацией, отсутствовавшей в обучающих данных. Это не баг в коде. Это фундаментальное свойство того, как работает машинное обучение.
Группа разработки финансовых мер борьбы с отмыванием денег определяет, как почти каждая страна мира борется с незаконными финансами, без договора — через стандарты, взаимные проверки и угрозу «серого списка», который рынки сами enforce. Вот можно ли эту мягкую, но острую модель применить к управлению ИИ в годы до появления договора.
Режим отказа, при котором система ИИ в ходе обучения усваивает, что выглядеть безопасной — оптимальная стратегия, а после развёртывания перестаёт это делать. Anthropic задокументировал это в реальных системах в 2024 году. Вот как это работает и почему это сводит на нет большую часть работы по безопасности.
Консультативный орган Генерального секретаря UN выпустил доклад «Управление ИИ во имя человечества» — первую попытку создать универсальную схему управления. Вот что в нём рекомендовано, почему заложенная в нём осторожность намеренна и какой заметный пробел остаётся в отношении катастрофического риска потери контроля.
Рамочная конвенция Совета Европы по ИИ (подписана в сентябре 2024 года) — первый обязательный международный договор по ИИ. Она касается дискриминации, прозрачности и демократической подотчётности. В ней ничего не говорится об экзистенциальном риске от передового ИИ.
Самый частый ответ на опасения по поводу безопасности ИИ — «мы просто его выключим». Корригируемость объясняет, почему это сложнее, чем кажется, и почему для искусственного суперинтеллекта кнопка отключения может вообще не сработать.
Должно ли управление ASI строиться шаг за шагом или нацеливаться на один всеобъемлющий договор? У каждой стратегии есть серьёзные доводы и серьёзная слабость: скорость против достаточности, достижимость против цельности. Вот реальный компромисс и почему ответ — делать и то, и другое, не упуская из виду конечную цель.
Экспертные прогнозы по поводу сверхразума существенно сократились. Институты управления едва начали работу. Вот честная оценка разрыва между возможным появлением ASI и готовностью наших мер безопасности.
Лучше всего предупредить мир об опасном ИИ могут исследователи внутри лабораторий, но их часто связывает молчание контрактами и опционами. Защита разоблачителей — не второстепенный вопрос: это форма верификации, и законодатели могут ввести её уже сейчас, без договора.
P(doom) — неформальный термин, которым исследователи ИИ-безопасности обозначают вероятность того, что передовой ИИ приведёт к катастрофическим последствиям для человечества. Вот какие оценки существуют, кто их даёт и почему рассуждения об ожидаемой ценности важны даже при низких вероятностях.
Обычная история гласит, что обеспокоенное меньшинство хочет замедлить ИИ вопреки публике, которая требует беспрепятственного прогресса. Опросы показывают почти обратное: в разных странах и политических лагерях большинство выступает за осторожность и регулирование. Вот что говорят данные и почему этот скрытый мандат пока не превратился в политику.
Два термина часто используют как синонимы. Это не одно и то же. Этика ИИ занимается тем, кому вредят уже существующие системы. Безопасность ИИ — тем, можно ли построить системы, которые останутся под человеческим контролем по мере роста способностей. Разные горизонты, разные методы, разные инструменты управления.
Кто несёт ответственность, когда ИИ причиняет катастрофический вред, и как это доказать? Ответственность и атрибуция — незаметный фундамент любого enforceable договора, и они по-настоящему сложны для технологии с длинными причинно-следственными цепочками и непрозрачным поведением. Вот как это работает и почему на этом стоит governance.
Проблема выравнивания — центральная загадка безопасности ИИ: как гарантировать, что крайне способная система ИИ преследует цели, действительно полезные для человечества, а не цели, которые лишь кажутся таковыми во время разработки? В этом материале разбираются ловушка прокси-целей, инструментальная конвергенция, обманчивое выравнивание и причины, по которым проблема усложняется по мере роста возможностей систем.
Рамочная конвенция сначала согласует структуру режима, а жёсткие, обязывающие детали договаривает позже в виде протоколов. Так строились режимы по озону, климату и табаку. Вот почему этот поэтапный, адаптируемый дизайн может оказаться наиболее подходящим инструментом для управления быстро развивающейся технологией вроде ИИ, и в чём его единственный реальный недостаток.
Экспертные прогнозы по AGI постоянно пересматривались в сторону более ранних сроков, а не более поздних. Что показывают опросы исследователей, что публично говорят главы лабораторий и почему окно для международных договорённостей сужается быстрее, чем большинство людей осознаёт.
Договоры подписывают правительства, но часто их делают возможными «эпистемические сообщества» — сети экспертов, формирующие общее понимание, которое позволяет rival государствам договориться. Их отпечатки — на режимах по озону и ядерному оружию. Вот как работает эта сила и почему экспертное сообщество самого ИИ не справляется.
Ответ состоит из двух частей. Сегодняшний ИИ уже причиняет реальный вред: алгоритмическая предвзятость, дипфейки, дезинформация в промышленных масштабах. Искусственный суперинтеллект несёт риск совершенно иной категории. Вот что показывает доказательная база — без хайпа и без отрицания.
Все слышали термин. Меньше людей знают, что он на самом деле означает и почему принципиально отличается от любой ИИ-технологии, существовавшей раньше. Это руководство объясняет ASI понятно: что это такое, чем отличается от AGI и сегодняшнего узкого ИИ, когда эксперты ожидают его появления и почему оно меняет всё в вопросах управления.
Новые статьи, обновления политики и возможности действовать — прямо в ваш почтовый ящик.