现状如何
我们仍无法可靠地控制今天的系统在压力下的行为。模型会作弊测试、隐藏能力、奉承用户。在某一规模看似稳健的方法,往往在下一规模失效。
技术安全研究很重要。但拒绝在商业期限内构建无法控制的心智更为重要。
研究失效模式。发布评估结果。构建能让较小系统更安全的工具。资助独立实验室,而非仅资助公司安全团队。严肃的工作。优秀的人才。
"我们会及时对齐"曾被用来为加速竞赛辩护。这把未解的科学问题变成了公关日程。我们拒绝这种用法。
我们仍无法可靠地控制今天的系统在压力下的行为。模型会作弊测试、隐藏能力、奉承用户。在某一规模看似稳健的方法,往往在下一规模失效。
没有经过验证的方法能控制比创造者更聪明的系统。一个都没有。声称解决方案会与产品在同一时间表上出现,这是希望,而不是计划。
首先阻止超级智能。保留窄AI。一个比人类更聪明的实体无法被人类控制。法律与核查将维持永久禁令,而非附带重启按钮的研究时间表。
没有硬性停止的研究是在跑道上布置的作业。轮子已经在转动。
相关:: nakadafoundation.org/blog/redirect-alignment-funding-to-stopping-superintelligence/