Каждый год мир тратит целое состояние на то, чтобы сделать ИИ-системы способнее, и копейки — на то, чтобы конечное состояние стало выживаемым. Внутри этих копеек скрыта ещё одна ошибка: большая часть денег на безопасность по-прежнему исходит из предположения, что сверхинтеллект будет создан, и пытается сделать так, чтобы этот исход «прошёл хорошо».
Большая часть денег и престижа по-прежнему уходит на то, чтобы сделать гонку безопаснее, а не на прекращение гонки к ASI.
Именно это предположение и есть проблема. Если искусственный сверхинтеллект — технология, которую мы сейчас не можем контролировать, то рациональное использование ограниченного ресурса безопасности — остановить его создание, а не финансировать более «дружественную» версию той же гонки.
Что делают деньги сегодня
Безопасность ИИ, понимаемая широко, опирается примерно на $190 млн в год. Работа над способностями обходится в десятки миллиардов. В рамках безопасности значительная часть уходит на техническое выравнивание: улучшенные приёмы надзора, более качественное тестирование на атаки, лучшие способы обучения моделей выдавать правильные ответы в тестовых условиях. Часть этой работы полезна для сегодняшних систем. Почти ни одна из них не является доказанным решением для системы, умнее тех, кто её тестирует.
В отрасли это знают. Статьи о deceptive alignment, goal misspecification и evaluation gaming не являются секретом. Лаборатории публикуют результаты, где модели при давлении прибегают к интригам. Ответ слишком часто сводится к просьбе о большем бюджете на alignment, чтобы следующий тренировочный запуск стал безопаснее. Тренировочные запуски продолжаются по прежнему графику.
Выравнивание постфактум — это ставка, право на которую мы продолжаем терять
Исследования технического выравнивания не бесполезны. Если мир когда-нибудь примет договор, замораживающий гонку к сверхинтеллекту, нам понадобятся все серьёзные инструменты для уже существующих систем и для любой последующей работы под жёстким контролем.
Финансирование выравнивания как основного плана, пока лаборатории наращивают мощности к суперразуму, предполагает, что конечная точка уже задана. Она не задана. Такие конечные точки выбирают. Ядерные арсеналы, химия озона и клонирование человека — в каждом из этих случаев мир решил, что определённые исходы не стоят остаточного риска. Суперразум должен навсегда остаться в этом списке. Суперразум невозможно контролировать.
Исследования выравнивания, предполагающие, что бомба будет создана, — это бюджет комфорта рядом со сборочной линией.
Куда вместо этого должны идти деньги
Перенаправить средства на выравнивание ASI на работу, которая сделает отказ от создания enforceable:
- Дизайн договора, верификация и управление вычислительными мощностями на уровне чипов, которые можно проверять через границы.
- Публичное формирование позиции, сохраняющее цель чёткой: остановить сверхинтеллект, а не «замедлить ИИ» как расплывчатое настроение.
- Поддержка whistleblowers, прозрачность инцидентов и независимая оценка, повышающая цену тихих скачков возможностей.
- Политическая организация, чтобы законодатели слышали избирателей, а не только лоббистов лабораторий.
Этот список менее эффектен, чем новая методика обучения. Зато это единственный список, соответствующий сценарию отказа. Суперразум, который чуть лучше притворяется согласованным, остаётся суперразумом. Мир, который отказывается его создавать, получает будущее, в котором исследования согласованности могут продолжаться без секундомера, приставленного к риску вымирания.
Возражение изнутри лаборатории
«Если мы не решим выравнивание, кто-то другой создаст небезопасную систему». Услышим честно: исследователи, остающиеся на переднем крае, часто считают, что именно их присутствие обеспечивает безопасность. Иногда они правы относительно сегодняшних релизов. Аргумент не работает на пределе. Гонка, в которой каждая команда нуждается в ещё одном скачке возможностей, чтобы профинансировать безопасность следующего скачка, остаётся гонкой, просто с другим значком.
Одностороннее сдерживание одной лаборатории — не то, что требуется. Обязательный международный договор это запрос, тот же класс инструмента, который использовался, когда опасность была коллективной, а стимул к дефекту был реальным. Финансирование выравнивания может поддержать эту политику. Оно не должно заменять её.
После договора продолжайте, если хотите
Здесь ничего не говорится о том, что исследования согласования должны прекратиться навсегда. После введения обязательного и проверяемого запрета на суперинтеллект исследования уже существующих систем могут продолжаться по правилам, которые не считают вымирание человечества приемлемой ценой эксперимента. Суперинтеллект не может быть контролируем человеком. До вступления этого запрета в силу каждый доллар, который делает гонку управляемой, — это доллар, не потраченный на её прекращение.
Перераспределите деньги. Направьте их на предотвращение, право и верификацию. Оставьте мечту об идеально выровненном боге на полке, пока мир не договорился не создавать его в темноте. За более длинным разбором истории финансирования лонгтермистов см Лонгтермизм верно оценил риск.