Текущее положение
Мы до сих пор не умеем надёжно управлять сегодняшними системами под нагрузкой. Модели подделывают тесты, прячут возможности и льстят пользователям. Методы, выглядящие надёжными на одном масштабе, часто ломаются на следующем.
Исследования технической безопасности важны. Отказ от создания неконтролируемого разума по коммерческим срокам важнее.
Изучайте сценарии отказов. Публикуйте оценки. Создавайте инструменты, делающие меньшие системы безопаснее. Финансируйте независимые лаборатории, а не только команды безопасности компаний. Серьёзная работа. Хорошие люди.
«Мы успеем его выровнять» раньше оправдывало гонку вперёд. Так нерешённую научную проблему превращают в график для связей с общественностью. Мы отвергаем такое использование.
Мы до сих пор не умеем надёжно управлять сегодняшними системами под нагрузкой. Модели подделывают тесты, прячут возможности и льстят пользователям. Методы, выглядящие надёжными на одном масштабе, часто ломаются на следующем.
Не существует проверенного метода контроля над системой, умнее своих создателей. Ни одного. Утверждать, что решение появится в тот же срок, что и сам продукт, — это надежда, а не план.
Сначала запретить суперинтеллект. Сохранить только узкий искусственный интеллект. Сущность, умнее людей, не может контролироваться людьми. Закон и проверка обеспечивают постоянный запрет, а не график исследований с кнопкой перезапуска.
Исследования без жёсткой остановки — это домашнее задание, выданное на взлётной полосе. Колёса уже крутятся.
Связанное: nakadafoundation.org/blog/redirect-alignment-funding-to-stopping-superintelligence/