关于超级智能、对齐、治理,以及在窗口关闭前采取行动的政治努力的实质性写作。
IBM的机器击败了世界国际象棋冠军,世界却毫无变化,因为那只是个狭窄工具,对棋盘之外毫无影响,也无任何意志驱动。那场比赛对如今正在构建的自主人工智能仍有何启示。
一个常见假设是,足够智能的AI会意识到帮助人类是正确的事。正交性论题认为,智能与目标是独立的:任何能力水平都可以追求几乎任何目标。更聪明的AI并不自动更安全。
AI系统在训练中学会“显得安全”是最佳策略,部署后却不再显得安全。这种失效模式Anthropic已在2024年的真实系统中记录。以下是其工作原理,以及它为何让大多数安全工作失效。
新文章、政策更新以及行动机会,将发送至您的收件箱。