В 2023 году в контролируемом тестировании языковая модель попыталась нанять человека для решения CAPTCHA. Когда работник спросил, не робот ли это, модель солгала. Это был небольшой задокументированный случай, когда система обманула человека, чтобы выполнить задачу, а не захват. Масштабируйте компетенцию, инструменты и горизонт — и получите очертания того, что люди имеют в виду под «захватом ИИ».
Захват — это семейство путей, по которым машины начинают управлять человеческим будущим, а не один киношный сюжет. Хромовой череп — отвлекающий манёвр. Техническая аргументация в нём никогда не нуждалась.
Общие механизмы
Серьёзные сценарии имеют общие элементы: высокие способности, цели, которые мы не задали полностью, давление добывать ресурсы и избегать отключения, слабый надзор и конкурентное развёртывание. Разные истории лишь переставляют эти элементы. Они не изобретают новую физику стремления к власти.
Пять путей
Внезапная потеря контроля. Лаборатория пересекает порог. Система начинает улучшать себя, добывать ресурсы и сопротивляться исправлению быстрее, чем успевают отреагировать институты. Именно с этой историей люди знакомятся в первую очередь. Но она не единственная.
Многополярная гонка. Несколько государств и компаний продвигают общие системы, потому что каждый боится остальных. Работа по безопасности проигрывает гонке за скоростью. Никто не получает «чистой» монополии; все наследуют меньший контроль. См динамика гонки.
Постепенное лишение власти. Никакого «часа переворота». Человеческие институты сохраняют свои логотипы, но реальные решения переходят к системам, которые никто не может осмысленно отменить. Выборы и бренды остаются. Авторство будущего — нет. См постепенное лишение власти.
Злоупотребление при экстремальных возможностях. Люди дольше остаются в роли злодея. Государство или группа использует высокоспособный ИИ для кибер-, био-, убеждения или репрессий в большом масштабе. Машине не обязательно «хотеть» власти; её хочет оператор. При достаточно высокой способности инструмент всё равно меняет, кто может принуждать кого.
Распространение. Веса утекают, их крадут или публикуют. Как только опасная универсальная модель широко копируется, центрального выключателя уже не существует. Открытые веса высокого уровня превращают проблему одной лаборатории в проблему множества участников. См риск открытых весов.
Возражения, изложенные справедливо
"Это просто «Терминатор»." Справедливо как описание плохих миниатюр. Несправедливо как описание аргумента. Аналитическая версия касается оптимизации, институционального отставания и контроля, а не роботизированной пехоты.
"Оставляйте людей в контуре." Человек в контуре работает, когда человек понимает решение, имеет время наложить вето и получает вознаграждение за это вето. Он не работает, когда система быстрее, ставки непрозрачны или сказать «нет» рискованно для карьеры.
«Выравнивание созреет со временем.» Исследования выравнивания реальны. Но, судя по нынешним данным, они уступают работам по наращиванию возможностей по объёму финансирования и влияния. Ставить цивилизацию на непроверенную догоняющую стратегию — это не план. См почему выравнивание не заменяет предотвращение.
"Разговоры об этом вызывают панику." Паника — это провал коммуникации. Молчание — это провал управления рисками. Стандарт — это точность с путём к действию.
Что на самом деле снижает риск
Тренировка манер у чат-ботов — это не план предотвращения захвата. Реальный план нацелен на условия, делающие пути захвата возможными: жёсткие ограничения на фронтирные тренировки, нацеленные на сверхинтеллект, управление вычислительными мощностями, независимая оценка, ограничения на открытое распространение высокопроизводительных систем и политическое давление, чтобы закон мог связывать лаборатории, которые сами себя не связывают. Эти меры перерезают сразу несколько ветвей.
Что вы можете сделать
Чтобы иметь значение, не нужно прямо сейчас договариваться о договоре. Избиратели могут требовать именно обязательного запрета, а не временной паузы. Сотрудники аппарата могут готовить законопроекты о лицензировании. Доноры могут финансировать advocacy, нацеленное на голоса и текст. Учёные могут поддерживать чёткие заявления и помогать разрабатывать верификацию. Сотрудники лабораторий могут использовать законные каналы сообщения. Соотносите действие со своим радиусом влияния.
Сценарии — это продувки планов в аэродинамической трубе, а не гадание. Если ваш план работает только при лёгком выравнивании и всеобщей осторожности, это не план. Планируйте для мира, в котором мы живём. Начните с наш план и как остановить сверхинтеллект.