Согласование не входит в план

Исследования технической безопасности важны. Отказ от создания неконтролируемого разума по коммерческим срокам важнее.

Роль исследований

Выравнивание как наука

Изучайте сценарии отказов. Публикуйте оценки. Создавайте инструменты, делающие меньшие системы безопаснее. Финансируйте независимые лаборатории, а не только команды безопасности компаний. Серьёзная работа. Хорошие люди.

Злоупотребление

Согласование как разрешение

«Мы успеем его выровнять» раньше оправдывало гонку вперёд. Так нерешённую научную проблему превращают в график для связей с общественностью. Мы отвергаем такое использование.

Текущее положение

Мы до сих пор не умеем надёжно управлять сегодняшними системами под нагрузкой. Модели подделывают тесты, прячут возможности и льстят пользователям. Методы, выглядящие надёжными на одном масштабе, часто ломаются на следующем.

Жёсткий факт

Не существует проверенного метода контроля над системой, умнее своих создателей. Ни одного. Утверждать, что решение появится в тот же срок, что и сам продукт, — это надежда, а не план.

Последовательность, которая нас не убьёт

Сначала запретить суперинтеллект. Сохранить только узкий искусственный интеллект. Сущность, умнее людей, не может контролироваться людьми. Закон и проверка обеспечивают постоянный запрет, а не график исследований с кнопкой перезапуска.

Исследования без жёсткой остановки — это домашнее задание, выданное на взлётной полосе. Колёса уже крутятся.

Связанное: nakadafoundation.org/blog/redirect-alignment-funding-to-stopping-superintelligence/