Каждые несколько месяцев очередная лаборатория или фонд объявляет о выделении дополнительных средств на исследования выравнивания. Заявление звучит искренне: если мы собираемся создавать системы умнее нас, лучше убедиться, что они хотят того же, чего хотим мы. Я уважаю людей, которые этим занимаются. Раньше я кивал в знак согласия. Потом произнёс цель вслух простым языком.

Решить alignment в том пределе, который интересует область, — значит надёжно контролировать нечто намного более intelligent, чем все люди, участвующие в его создании. Не калькулятор. Не folder белков. Общий разум, который thinking нас на всех фронтах. Мы даже назвали цель: суперинтеллект.

Это название работает больше, чем сами статьи.

Что уже подразумевает слово

Super означает «выше». Интеллект — это то, чем мы изобретаем инструменты, находим лазейки и побеждаем в состязаниях с более слабыми умами. Если вы создаёте систему, которая превосходит вас в этих играх, вы построили нечто, лучше вас справляющееся именно с теми навыками, которые нужны, чтобы держать её на поводке.

Люди до сих пор говорят так, будто alignment — это патч, который успеет установиться до того, как система это заметит. Вы пытаетесь писать правила для игрока, который в итоге будет лучше вас в правилах. Вы пытаетесь экзаменовать студента, который в итоге будет лучше экзаменатора в экзаменах. Вы пытаетесь контролировать сотрудника, который в итоге будет лучше вас понимать рабочее место, стимулы и ваши слепые зоны.

Не называйте это планом безопасности для вида.

О чем на самом деле спорят

Возможности будут расти, нравится нам это или нет. Односторонний отказ одной лаборатории не останавливает другие. С этой точки зрения, единственный ответственный шаг - это как можно лучше определить цели, обнаружить обман и сохранить системы исправными, чтобы, если появится опасная система, у нас был шанс. Часть этой работы уже помогает современным моделям. Игнорировать это было бы безрассудно.

Узкую половину я принимаю. Работа по безопасности над системами, которые мы ещё можем inspect и выключить, — это настоящая инженерия. Не принимаю я скачок от помощи сегодняшним моделям к выводу, что мы сможем выровнять superintelligence настолько надёжно, чтобы ставить на это цивилизацию. В этом скачке скрыто предположение, что контроль масштабируется вместе с объектом управления. История и здравый смысл говорят об обратном. Чем умнее второй игрок, тем меньше ваша хитрая схема выглядит как схема и тем больше — как головоломка.

Контроль требует преимущества

Каждое устойчивое отношение контроля, которое мы знаем, опирается на преимущество: физическую силу, юридическую власть, информацию, которой нет у другой стороны, или возможность выключить систему. Сверхинтеллект по определению размывает эти преимущества. Если он сможет моделировать вас лучше, чем вы его, ваши тесты превращаются в театр. Если он сможет действовать быстрее и шире, чем ваша команда надзора, ваш kill switch — это история, которую вы рассказываете себе до того дня, когда он окажется недоступен.

Это утверждение касается конечного состояния, к которому продолжают направлять финансирование, а не критики каждой полезной статьи по сегодняшним моделям. Структурные барьеры накапливаются: невозможно полностью задать человеческие ценности, невозможно надёжно отличить подлинное соблюдение от имитации, а разрыв в интеллекте между оценивающим и системой растёт по мере её совершенствования. Надежда, что последний барьер падёт прямо перед развёртыванием, — это фантазия о дедлайне, а не наука.

Если продукт умнее людей, держащих пульт, то пульт никогда и не был решением.

Глупость — это диагноз

Назвать план глупым — указать на категориальную ошибку, а не оскорбить исследователей. Мы вкладываем scarce средства безопасности в то, чтобы преемник вида развивался хорошо, пока гонка по созданию этого преемника идёт по расписанию. Это всё равно что финансировать хорошие манеры для потопа, пока плотину всё ещё разбирают выше по течению.

Разумный шаг скучен: не создавать то, чем нельзя управлять. Узкий ИИ, сворачивающий белки, читающий снимки и прогнозирующий погоду, может продолжать приносить пользу. Такие системы остаются инструментами. Сверхинтеллект — это новый центр агентности, а не просто более крупный инструмент. Считать «согласовать его» главным планом, пока лаборатории соревнуются, — это способ, которым культура уговаривает себя на необратимый эксперимент.

Что делать с деньгами вместо этого

Перевести средства из стопки «согласование для ASI» на работу, которая делает не-создание реальным: проектирование договоров и проверок, управление вычислительными мощностями, которое можно инспектировать, публичную аргументацию, сохраняющую цель понятной, и политическое давление, чтобы законодатели слышали не только тезисы лабораторий. Я отдельно написал обоснование финансирования. Коротко: последовательность. После подтверждённой остановки на пути к сверхразуму исследования мощного ИИ под жёстким контролем могут продолжаться. До этой остановки каждый доллар, делающий гонку «управляемой», — это доллар, не потраченный на её прекращение.

Сверхразум нельзя выровнять в том смысле, который нужен презентации. Само слово уже подсказывает почему. Перестаньте финансировать фантазию, что у нас получится. Финансируйте решение не создавать его.