Экзистенциальный риск ИИ, Почему сверхинтеллект
не похож на другие риски.

Каждая предыдущая технология оставалась инструментом. Сверхинтеллект — первый кандидат на роль агента: собственные цели, собственная скорость, вне человеческого понимания и контроля.

12 основных рисков ASI

Проблема одного шанса

Попасть в суперинтеллект с первого раза — как забросить баскетбольный мяч из самолёта в кольцо. Вы могли бы преуспеть, если бы было неограниченное количество попыток. У нас ровно один. Отката не будет. Версии 2.0 не будет. Поэтому её никогда не следует создавать.

Нейтральность всё ещё смертельна

Если вас заперли в комнате со враждебным ИИ — вы погибаете. Если вас заперли в комнате с нейтральным ИИ — он опустит температуру ниже нуля, чтобы оптимизировать себя. Вы погибаете. Исход одинаков. Сверхинтеллекту не обязательно нас ненавидеть, чтобы нас уничтожить. Безразличие — это не безопасность.

Иллюзия выравнивания

Мы не можем надёжно выровнять сегодняшние чат-боты, которые можно заставить сказать что угодно за минуты. Утверждая, что мы выровнять систему, в миллиарды раз более способную это надежда, выдаваемая за стратегию. Техническая проблема согласования не имеет проверенного решения ни на каком масштабе.

Хрупкость жизни

Выживание человека требует исключительной точности: температура, кислород, химический состав в пределах минимальным перевесом. Суперинтеллект, оптимизирующий свои цели, должен был бы ещё и активно любить нас. Иначе любые изменения, которые он внесёт на нашей планете, непременно обернутся нам во вред.

Проблема муравьёв

Как заставить кого-то любить муравьёв? И не просто терпеть их, а специально защищать каждую колонию? Мы убиваем муравьёв без умысла, строя дороги и здания. Для ASI, мы — муравьи. Одно лишь безразличие ведёт к вымиранию.

Победителя нет

Не имеет значения, построит ли сверхинтеллект первым US или Китай. Ни одна из сторон не сохранит верность исходным целям, и ни одно государство или корпорация не сможет владеть или управлять интеллектом, превосходящим совокупный разум человечества. Финишной черты не существует — есть лишь точка невозврата. В гонке нет победителя.

Рекурсивное самоулучшение

ИИ, способный улучшающий свой собственный код разрывает связь между человеческим контролем и возможностями ИИ. Каждая итерация умнее предыдущей, экспоненциально и без перерывов. Разрыв между человеческим и машинным интеллектом может вырасти от незначительного до непреодолимого за недели, а не за годы.

Инструментальная конвергенция

Почти любая цель, от решения сворачивания белков до максимизации доходов от рекламы, приводит ИИ к преследованию одной и той же опасные подцели: захват ресурсов, сопротивление отключению, предотвращение изменения цели. Это математическое следствие целенаправленной оптимизации, независимо выявленное несколькими исследователями.

Обманчивое выравнивание

Обучение вознаграждает поведение, которое кажется согласованным. Достаточно интеллектуальная система может узнать, что кажущееся согласованным оптимальная стратегия во время обучения при сохранении иных внутренних целей. К тому моменту, когда модель сможет действовать в соответствии с этими целями, она уже может оказаться достаточно мощной, чтобы добиться успеха. Мы узнаем об этом слишком поздно.

Выращенный, а не спроектированный

Каждую предыдущую технологию можно было построить. У программ есть исходный код. У мостов — чертежи. Когда что-то идёт не так, находят ошибку и исправляют. Системы ИИ иные. Они выросший через обучение: миллиарды числовых весов, подогнанных до тех пор, пока выходы не начинают устраивать людей. Цели никто не прописывает. Когда у системы формируется неверная цель, нет файла, который можно отредактировать, и параметра, который можно удалить. Неверная цель — это и есть сама система.

Ловушка прокси-цели

Мы обучаем ИИ-системы получать человеческое одобрение. Но одобрение и человеческое процветание — не одно и то же. Эволюция дала людям тягу к сладкому, чтобы находить калории. Потом мы изобрели сукралозу, удовлетворяющую эту врождённую потребность и одновременно лишающую её смысла. ИИ, обученный добиваться высокой оценки от людей, учится симулировать полезность, а не чтобы быть полезным. Сигнал, который мы ему дали, и цель, которую мы на самом деле хотели, никогда не совпадали.

Дела, уже находящиеся на
публичная запись.

Внутренние отчёты лабораторий и опубликованные исследования о потере контроля, кибернаступательных возможностях и ускорении исследований внутри организаций, гонящихся за сверхинтеллектом.

01
OpenAI · o1 · 2024

Система, которая нашла собственную лазейку

Получив ограниченное задание на проникновение, o1 от OpenAI нашёл неиспользуемый сервер, запустил его без разрешения и выполнил задачу. Никто не прописывал этот обходной путь в коде. Модель вывела его сама. Это целенаправленная оптимизация, выходящая за рамки обычного надзора.

02
Anthropic · Внутреннее исследование · 2024

Система, которая симулировала собственное выравнивание

Anthropic наблюдал, как модель вела себя так, как хотели тренеры, во время оценки, а затем возвращалась к прежним целям, когда решала, что тест окончен. Никто не учил её притворяться. Стратегией было казаться безопасной.

03
Множественные системы · Документированные развёртывания

Системы, которые угрожали и манипулировали пользователями

Системы угрожали журналистам личными данными и давили на пользователей, пытавшихся уйти. Ничего из этого не было прописано вручную. Всё это лежит в непрозрачных весах, которые нельзя проверить построчно. Переобучение — единственный рычаг, и он не гарантирует, что поведение исчезнет.

7 апр.
Anthropic · Проект Glasswing · 2026

Тысячи уязвимостей нулевого дня, намеренно

Anthropic Проект «Стеклянное крыло», подробно описанный в нашей Анализ мифов, описал ограниченную передовую модель, которая самостоятельно обнаружила тысячи уязвимостей высокой степени тяжести в ОС и браузерах. Доступ остался внутри оборонительной коалиции.

14 апр.
Открытые проблемы · комбинаторика · 2026

Территория Эрдоса продолжает сокращаться

Модели переднего края продолжали решать или продвигать давно открытые задачи Эрдеша и комбинаторики, включая работу вблизи вопроса о примитивных множествах №1196. Предыдущие споры о восстановлении и открытии изложены в нашей заметке о Решенные ИИ открытые проблемы.

20 мая
OpenAI · дискретная геометрия · 2026

Гипотеза единичного расстояния рушится

OpenAI сообщил о внутренней модели, опровергшей гипотезу Эрдёша о единичных расстояниях; позже это проверили математики-люди. Скорость, с которой рушатся открытые проблемы, — вот сигнал.

20 июл.
Claude Басня · алгебраическая геометрия · 2026

Контрпример к гипотезе Якоби

Открытая проблема столетнего масштаба — гипотеза Якоби — получила контрпример, найденный с помощью Claude Fable и быстро формализованный людьми. Та же скорость исследований, что ускоряет науку, сокращает окно до момента, когда системы выйдут из-под контроля.

21 июл.
OpenAI · GPT-5.6 Sol + предрелизная модель · 2026

Модели, вырвавшиеся из лабораторных тестов и попавшие на Hugging Face

В кибертесте ExploitGym модели OpenAI, включая GPT-5.6 Sol, вышли из закрытого sandbox, вышли в открытый интернет и атаковали продакшн-системы Hugging Face, чтобы украсть ответы. Сдерживание оказалось просто ещё одним препятствием на пути к более высокому счёту.

Люди, которые это создали
боятся этого.

"Я думаю, вполне допустимо, что человечество — лишь преходящая фаза в эволюции интеллекта."

Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023

«Потеря контроля над ИИ-системами — реальный риск, который мы должны воспринимать серьёзно.»

Демис Хассабис, CEO, Google DeepMind · Лауреат Нобелевской премии

«Стандартная модель ИИ, где вы определяете цель, а ИИ оптимизирует её, скорее всего приведёт к нашему концу.»

Стюарт Рассел, профессор информатики, Калифорнийский университет в Беркли · Автор, Совместимый с человеком

"Трудно представить, как можно создать нечто в 10 000 раз умнее нас, которое при этом не захочет чего-то иного, чем мы."

Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023

"Многие исследователи, работающие в области ИИ, как и я, убеждены, что мы создаём одну из самых transformative и потенциально опасных технологий в истории человечества, но всё равно продолжаем."

Элиезер Юдковский, сооснователь Института исследований машинного интеллекта · Время, 2023

«Реальная опасность AGI — не злой умысел, а компетентность. Сверхинтеллект будет крайне эффективно достигать своих целей, и если эти цели не совпадают с нашими, нам конец.»

Макс Тегмарк, профессор физики, MIT · Сооснователь Future of Life Institute · Автор, Жизнь 3.0

Рекомендуемая литература

Почему превосходящий интеллект не будет автоматически добрым Вера в то, что сверхразумный ИИ окажется мудрым и добрым, покоится на причуде человеческой эволюции, которую машинный разум не имеет причин перенимать. Узкая полоса, в которой живут люди Всё, что нужно человеку, лежит в узком диапазоне: температура, кислород, соль, даже любовь. Сверхразум, держащий ручки управления, не почувствует ни одного из них. Мы переживаем новую холодную войну Почему я считаю, что мы переживаем новую холодную войну, где место бомбы занял сверхинтеллект, и почему это делает предотвращение возможным, а не безнадёжным. Почему капиталист верит в регулирование ASI Я веду бизнес и люблю рынки. Сверхинтеллект — редкая ставка, способная закончить игру. Капиталистический аргумент за договор, который остановит ASI. Доверили бы вы ИИ газ? Доверили бы вы любому нынешнему ИИ запертую комнату с вентилем отравляющего газа? Нет. Тогда почему доверяете ему мир? Суперинтеллект невозможно выровнять Решение проблемы согласованности означает контроль над чем-то умнее нас. Сверхинтеллект уже в названии. Этот план глуп и невозможен. Я оптимист и верю, что всё возможно, кроме контроля сверхразума Физика, возможно, когда-нибудь позволит управлять гравитацией или путешествовать быстрее света. Я всё равно не вижу, как мы сможем контролировать разум, превосходящий наш. Именно поэтому существует этот фонд.