P(doom) — не технический термин из формальной статьи. Он возник в онлайн-дискуссиях по безопасности ИИ как сокращение для вероятностной оценки, которую большинство исследователей до 2020 года вообще не стали бы выражать числом. Готовность количественно оценивать его (рассматривать катастрофический риск ИИ как вероятность, которую можно оценить, а не как возможность, о которой можно смутно упомянуть) — один из значимых сдвигов в том, как люди, работающие ближе всего к разработке ИИ, думают о проблеме.
Оценки варьируются от нескольких процентов до более 50 % в зависимости от исследователя и того, как он оценивает сложность выравнивания и скорость управления. Вот что говорит этот диапазон и почему даже низкие вероятности требуют серьёзного внимания.
«Гибель» в G7 намеренно не конкретизирована. Разные исследователи вкладывают в неё вымирание человечества, необратимую утрату человеческой автономии, необратимую концентрацию власти в руках одного актора или иную цивилизационную катастрофу. Неточность признаётся; смысл термина — заставить явно и количественно рассуждать о риске, а не полагаться на интуицию о том, «реален» он или «спекулятивен».
Как выглядят оценки
Разброс оценок среди этих исследователей впечатляет. Хинтон и Юдковский разделены десятками процентных пунктов. Формальная декомпозиция Карлсмита дала широкий диапазон, а не точечную оценку, отражая реальную неопределённость на каждом промежуточном шаге. Общее у всех оценок — их нетривиальность: ни один из исследователей безопасности, кто серьёзно занимался проблемой и поставил число, не опустился ниже примерно 5 %.
Определите свою позицию по каждому из ключевых вопросов ниже и посмотрите, как они складываются в единую оценку.
Почему существует широкий разброс
P(doom) как число — это произведение нескольких неопределённых промежуточных вопросов. Насколько быстро будут расти возможности ИИ? Насколько сложна проблема выравнивания на уровнях способностей, которые мы ещё не тестировали? Насколько вероятно, что несовмещённый ИИ определённого уровня способностей вызовет катастрофический, а не локальный вред? Насколько вероятно, что управление успеет отреагировать до достижения критического порога возможностей?
У разных исследователей разные распределения вероятностей по этим вопросам, и оценки складываются. Исследователь, считающий проблему согласования решаемой, развитие возможностей относительно медленным, а управление способным отреагировать вовремя, даст значительно более низкую общую оценку, чем тот, кто считает иначе по каждому пункту. Широкий разброс отражает реальную неопределённость по каждому фактору, а не разногласие, которое можно разрешить, просто внимательнее изучив одни и те же данные.
Аргумент ожидаемой ценности
Обычный ответ на нетривиальные оценки P(doom): «Даже 10 % кажется слишком низким порогом, чтобы перестраивать вокруг него общество». Этот ответ опирается на отказ от рассуждений через ожидаемую ценность, который не приняли бы в других контекстах риска.
Годовая вероятность крупной пандемии, способной унести миллионы жизней, оценивается ниже 1 % в любой отдельный год, однако подготовка к пандемиям получает серьёзные глобальные инвестиции и внимание политиков. Вероятность погибнуть в автокатастрофе за жизнь в US составляет примерно 1 %, и регулирование безопасности дорожного движения считается совершенно нормальным. Утверждение, что вероятность цивилизационной катастрофы в 10 % (или даже 5 %) не требует серьёзных мер предосторожности, не согласуется с тем, как мы обращаемся с рисками в других областях.
Ожидаемая ценность — это вероятность, умноженная на масштаб. Для рисков, которые необратимы и имеют цивилизационный масштаб (когда от плохого исхода нет восстановления, а сам исход закрывает всякую будущую ценность), ожидаемая ценность предосторожности остается очень высокой даже при вероятностях значительно ниже 10 %. Шанс в 1 % потерять всё — это проблема, чья ожидаемая стоимость равна 1 % от всего, а в масштабе того, что содержит долгосрочное будущее, это огромная величина, а не «проблема в 1 %».
Что снизило бы P(doom)
Исследователи, дающие высокие оценки P(doom), диагностируют, где нужна самая критическая работа, а не смиряются с плохим исходом. Факторы, которые могли бы снизить P(doom) в оценках большинства исследователей, хорошо известны: продемонстрированный прогресс в инструменты интерпретируемости способных верифицировать выравнивание передовых систем; подходы масштабируемого надзора, работающие на уровнях возможностей выше человеческих экспертов; обязательные международные рамки управления с реальным принуждением; и развитие возможностей, которое идёт медленнее исследований выравнивания, чтобы безопасность была обеспечена до достижения опасных уровней возможностей.
Именно поэтому Фонд сосредоточен на рамках управления и исследованиях выравнивания как на главных рычагах, а не на отрицании риска или принятии конкретной оценки P(doom) за авторитетный ответ. Неопределённость в P(doom) — не причина ждать дополнительной информации: плохой исход наступает при определённых порогах возможностей, а не по графику, который позволяет бесконечно откладывать меры предосторожности.