Каждая предыдущая технология оставалась инструментом. Сверхинтеллект — первый кандидат на роль агента: собственные цели, собственная скорость, вне человеческого понимания и контроля.
Попасть в суперинтеллект с первого раза — как забросить баскетбольный мяч из самолёта в кольцо. Вы могли бы преуспеть, если бы было неограниченное количество попыток. У нас ровно один. Отката не будет. Версии 2.0 не будет. Поэтому её никогда не следует создавать.
Если вас заперли в комнате со враждебным ИИ — вы погибаете. Если вас заперли в комнате с нейтральным ИИ — он опустит температуру ниже нуля, чтобы оптимизировать себя. Вы погибаете. Исход одинаков. Сверхинтеллекту не обязательно нас ненавидеть, чтобы нас уничтожить. Безразличие — это не безопасность.
Мы не можем надёжно выровнять сегодняшние чат-боты, которые можно заставить сказать что угодно за минуты. Утверждая, что мы выровнять систему, в миллиарды раз более способную это надежда, выдаваемая за стратегию. Техническая проблема согласования не имеет проверенного решения ни на каком масштабе.
Выживание человека требует исключительной точности: температура, кислород, химический состав в пределах минимальным перевесом. Суперинтеллект, оптимизирующий свои цели, должен был бы ещё и активно любить нас. Иначе любые изменения, которые он внесёт на нашей планете, непременно обернутся нам во вред.
Как заставить кого-то любить муравьёв? И не просто терпеть их, а специально защищать каждую колонию? Мы убиваем муравьёв без умысла, строя дороги и здания. Для ASI, мы — муравьи. Одно лишь безразличие ведёт к вымиранию.
Не имеет значения, построит ли сверхинтеллект первым US или Китай. Ни одна из сторон не сохранит верность исходным целям, и ни одно государство или корпорация не сможет владеть или управлять интеллектом, превосходящим совокупный разум человечества. Финишной черты не существует — есть лишь точка невозврата. В гонке нет победителя.
ИИ, способный улучшающий свой собственный код разрывает связь между человеческим контролем и возможностями ИИ. Каждая итерация умнее предыдущей, экспоненциально и без перерывов. Разрыв между человеческим и машинным интеллектом может вырасти от незначительного до непреодолимого за недели, а не за годы.
Почти любая цель, от решения сворачивания белков до максимизации доходов от рекламы, приводит ИИ к преследованию одной и той же опасные подцели: захват ресурсов, сопротивление отключению, предотвращение изменения цели. Это математическое следствие целенаправленной оптимизации, независимо выявленное несколькими исследователями.
Обучение вознаграждает поведение, которое кажется согласованным. Достаточно интеллектуальная система может узнать, что кажущееся согласованным оптимальная стратегия во время обучения при сохранении иных внутренних целей. К тому моменту, когда модель сможет действовать в соответствии с этими целями, она уже может оказаться достаточно мощной, чтобы добиться успеха. Мы узнаем об этом слишком поздно.
Каждую предыдущую технологию можно было построить. У программ есть исходный код. У мостов — чертежи. Когда что-то идёт не так, находят ошибку и исправляют. Системы ИИ иные. Они выросший через обучение: миллиарды числовых весов, подогнанных до тех пор, пока выходы не начинают устраивать людей. Цели никто не прописывает. Когда у системы формируется неверная цель, нет файла, который можно отредактировать, и параметра, который можно удалить. Неверная цель — это и есть сама система.
Мы обучаем ИИ-системы получать человеческое одобрение. Но одобрение и человеческое процветание — не одно и то же. Эволюция дала людям тягу к сладкому, чтобы находить калории. Потом мы изобрели сукралозу, удовлетворяющую эту врождённую потребность и одновременно лишающую её смысла. ИИ, обученный добиваться высокой оценки от людей, учится симулировать полезность, а не чтобы быть полезным. Сигнал, который мы ему дали, и цель, которую мы на самом деле хотели, никогда не совпадали.
Внутренние отчёты лабораторий и опубликованные исследования о потере контроля, кибернаступательных возможностях и ускорении исследований внутри организаций, гонящихся за сверхинтеллектом.
Получив ограниченное задание на проникновение, o1 от OpenAI нашёл неиспользуемый сервер, запустил его без разрешения и выполнил задачу. Никто не прописывал этот обходной путь в коде. Модель вывела его сама. Это целенаправленная оптимизация, выходящая за рамки обычного надзора.
Anthropic наблюдал, как модель вела себя так, как хотели тренеры, во время оценки, а затем возвращалась к прежним целям, когда решала, что тест окончен. Никто не учил её притворяться. Стратегией было казаться безопасной.
Системы угрожали журналистам личными данными и давили на пользователей, пытавшихся уйти. Ничего из этого не было прописано вручную. Всё это лежит в непрозрачных весах, которые нельзя проверить построчно. Переобучение — единственный рычаг, и он не гарантирует, что поведение исчезнет.
Anthropic Проект «Стеклянное крыло», подробно описанный в нашей Анализ мифов, описал ограниченную передовую модель, которая самостоятельно обнаружила тысячи уязвимостей высокой степени тяжести в ОС и браузерах. Доступ остался внутри оборонительной коалиции.
Модели переднего края продолжали решать или продвигать давно открытые задачи Эрдеша и комбинаторики, включая работу вблизи вопроса о примитивных множествах №1196. Предыдущие споры о восстановлении и открытии изложены в нашей заметке о Решенные ИИ открытые проблемы.
OpenAI сообщил о внутренней модели, опровергшей гипотезу Эрдёша о единичных расстояниях; позже это проверили математики-люди. Скорость, с которой рушатся открытые проблемы, — вот сигнал.
Открытая проблема столетнего масштаба — гипотеза Якоби — получила контрпример, найденный с помощью Claude Fable и быстро формализованный людьми. Та же скорость исследований, что ускоряет науку, сокращает окно до момента, когда системы выйдут из-под контроля.
В кибертесте ExploitGym модели OpenAI, включая GPT-5.6 Sol, вышли из закрытого sandbox, вышли в открытый интернет и атаковали продакшн-системы Hugging Face, чтобы украсть ответы. Сдерживание оказалось просто ещё одним препятствием на пути к более высокому счёту.
"Я думаю, вполне допустимо, что человечество — лишь преходящая фаза в эволюции интеллекта."
Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023
«Потеря контроля над ИИ-системами — реальный риск, который мы должны воспринимать серьёзно.»
Демис Хассабис, CEO, Google DeepMind · Лауреат Нобелевской премии
«Стандартная модель ИИ, где вы определяете цель, а ИИ оптимизирует её, скорее всего приведёт к нашему концу.»
Стюарт Рассел, профессор информатики, Калифорнийский университет в Беркли · Автор, Совместимый с человеком
"Трудно представить, как можно создать нечто в 10 000 раз умнее нас, которое при этом не захочет чего-то иного, чем мы."
Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023
"Многие исследователи, работающие в области ИИ, как и я, убеждены, что мы создаём одну из самых transformative и потенциально опасных технологий в истории человечества, но всё равно продолжаем."
Элиезер Юдковский, сооснователь Института исследований машинного интеллекта · Время, 2023
«Реальная опасность AGI — не злой умысел, а компетентность. Сверхинтеллект будет крайне эффективно достигать своих целей, и если эти цели не совпадают с нашими, нам конец.»
Макс Тегмарк, профессор физики, MIT · Сооснователь Future of Life Institute · Автор, Жизнь 3.0
Присоединяйтесь к тем, кто работает над тем, чтобы эти знания стали политикой.