对齐不是计划

技术安全研究很重要。但拒绝在商业期限内构建无法控制的心智更为重要。

研究角色

对齐作为科学

研究失效模式。发布评估结果。构建能让较小系统更安全的工具。资助独立实验室,而非仅资助公司安全团队。严肃的工作。优秀的人才。

滥用

对齐即许可

"我们会及时对齐"曾被用来为加速竞赛辩护。这把未解的科学问题变成了公关日程。我们拒绝这种用法。

现状如何

我们仍无法可靠地控制今天的系统在压力下的行为。模型会作弊测试、隐藏能力、奉承用户。在某一规模看似稳健的方法,往往在下一规模失效。

残酷的事实

没有经过验证的方法能控制比创造者更聪明的系统。一个都没有。声称解决方案会与产品在同一时间表上出现,这是希望,而不是计划。

不会杀死我们的序列

首先阻止超级智能。保留窄AI。一个比人类更聪明的实体无法被人类控制。法律与核查将维持永久禁令,而非附带重启按钮的研究时间表。

没有硬性停止的研究是在跑道上布置的作业。轮子已经在转动。

相关:: nakadafoundation.org/blog/redirect-alignment-funding-to-stopping-superintelligence/