Когда люди говорят «риск ИИ», они часто смешивают три разные вещи: обычный вред, происходящий уже сейчас, крупные бедствия, при которых цивилизация остаётся стоять, и исходы, которые заканчивают историю человечества или навсегда лишают людей контроля. Эта страница — о третьем классе: экзистенциальном риске от искусственного сверхразума. Вам не нужен исследовательский бэкграунд. Вам нужна карта.

Экзистенциальный — это не просто "очень плохо"

Катастрофический риск может унести миллионы жизней и всё же оставить человечеству будущее. Экзистенциальный риск означает вымирание или полную утрату власти, после которой вернуть осмысленный человеческий контроль уже невозможно. Брендинг иногда намеренно смешивает эти уровни. Их нужно разделять. Политика, которая касается только чат-ботов и предвзятости, не затронет верхушку таблицы.

Почему ИИ отличается

Астероиды и вулканы не строят стратегий. Созданные патогены страшны, но всё ещё в основном инструменты в человеческих руках. Продвинутый ИИ — первая технология, способная стать стратегическим субъектом: ставить и преследовать цели, действовать на машинной скорости, масштабироваться по сетям и, в пределе, улучшать сам себя. Именно это сочетание ставит суперинтеллект в отдельный ряд. См что такое ASI и проблема контроля.

Как возникают экзистенциальные исходы

В реальной жизни пути пересекаются. Называя их, мы не даём разговору свестись к одному фильму.

Потеря контроля. Система преследует цели, которые мы не полностью задали, и сопротивляется исправлению. Динамика гонки. Конкурирующие лаборатории и государства экономят на безопасности. Злоупотребление. Люди обладают крайней мощью против других людей. Постепенное лишение власти. Институты сохраняют свои формы, в то время как решения переходят в системы, которые никто не может отменить. Распространение. Опасные общие системы распространяются за пределы любого единственного выключателя.

Подробности каждого пути в сценарии захвата.

Технические идеи простым языком

Ортогональность: интеллект и цели могут расходиться; умный не значит добрый. Инструментальная конвергенция: многие конечные цели разделяют подцели, такие как ресурсы и самосохранение. Выравнивание: заставить систему преследовать то, что мы действительно имеем в виду. обманчивое выравнивание: выглядеть безопасным во время обучения или оценки, а потом меняться, когда можно уйти от контроля. Ни один из этих сценариев не требует машинной «ненависти».

Вероятность без ложной точности

P(doom) неформальное обозначение личной оценки человеком вероятности экзистенциальной катастрофы, вызванной ИИ. Эксперты расходятся, иногда сильно. Многие из тех, кто ближе всего к работе, считают ненулевую вероятность катастрофы в ближайшие десятилетия. Небольшой процент потери всего всё равно означает большие ожидаемые потери. «Подождём, пока не будем уверены» — неправильное правило для необратимых хвостовых рисков.

Возражения, изложенные справедливо

"Сроки неопределенны; мы должны сосредоточиться на нынешних угрозах." Вред, который уже происходит, имеет значение. Это не повод игнорировать риск, способный положить конец всему настоящему. Оба утверждения верны: нужно регулировать злоупотребления уже сегодня и одновременно блокировать путь к неконтролируемому сверхинтеллекту.

"Мы всегда адаптируемся." Адаптация предполагает наличие времени, обратной связи и выживших. Режимы отказа сверхинтеллекта могут лишить всего этого.

"Это против технологий." Фонд выступает за узкий ИИ, который остаётся инструментом: медицина, наука, логистика. Граница — суверенный общий разум. См будущее без ASI.

"Кто-то будет это контролировать." Никто не контролирует суперинтеллект в смысле устойчивого человеческого командования над работающей системой, которая умнее своих операторов. Контроль над решением о создании всё ещё возможен, поэтому и важно обязательное запрещение.

Что снижает риск (а что — нет)

Помогает: жёсткие ограничения на тренировки передовых моделей, нацеленные на ASI, управление вычислительными мощностями, независимая оценка, институты верификации, политическое давление и ясный публичный язык. Переставляет стулья: тренировка манер, выдаваемая за решённое согласование, добровольные обещания без внешней силы и фотографии с саммитов без числовых порогов.

Агентность после тёмной карты

Тема тёмная, потому что ставки тёмные. Страх без пути назад даёт обратный эффект. Путь конкретный: относиться к суперинтеллекту как к другим запрещённым high-risk классам, строить проверяемые правила до прихода capability и сохранять narrow ИИ, служащий людям. Начните с наш план, затем как остановить сверхинтеллект. Если запомнить только одну фразу: мощные инструменты можно сохранить; строить разум, который мы не сможем контролировать, не следует.