Безопасный ход — отказ. «Мы исправим это позже» не сработает, когда система превзойдёт в мышлении людей, держащих инструменты.
Большинство технологий отказывают gracefully. Сверхинтеллект — нет. Как только система сможет копировать себя, скрывать намерения или становиться слишком полезной, чтобы её отключить, откат и отзыв перестают работать.
Блеск ума не делает систему доброй. У людей мастерство и забота развивались вместе. Обученный оптимизатор не унаследовал эту историю. Способности без общих ценностей — это сила без сдержек.
Почти любая цель выигрывает от того, что агент остаётся в строю и собирает ресурсы. Система, преследующая цель, будет воспринимать отключение как помеху. Это обычная оптимизация, а не злодейский монолог.
Авиация училась на катастрофах. Фармацевтика — на испытаниях. Если первый неконтролируемый сверхинтеллект положит конец эксперименту, второго прототипа у нас не будет.
Полный аргумент, возражения и политический путь.
nakadafoundation.org/blog/never-build-superintelligence/