每年世界花费巨资让AI系统更强大,却只用极少资金试图让最终状态可存活。在这极少资金中还存在进一步错误:大多数安全资金仍假设超级智能会被建造,并试图让这一结果“顺利发生”。
大部分资金和声望仍流向让竞赛更安全,而不是结束通往 ASI 的竞赛。
这个假设本身就是问题。如果人工超级智能是我们目前无法控制的技术,那么稀缺安全资源的理性用途是阻止它被创造,而不是资助同一场竞赛的更友好版本。
资金如今的作用
广义上的AI安全,大致依赖于 每年1.9亿美元. 能力研究耗资数百亿美元。在安全部分中,很大一部分用于技术对齐:更好的监督技巧、更好的红队测试、更好的方法来训练模型在测试条件下说出正确的话。其中一些工作对当今系统有用。但几乎没有哪一项是针对比测试者更聪明的系统的已验证解决方案。
这个领域知道这一点。关于欺骗性对齐、目标错误指定和评估博弈的论文并不保密。实验室发表了模型在压力下进行图谋的结果。而回应往往是要求更多对齐预算,以便下一次训练运行能更安全。训练运行却按同一时间表继续。
事后对齐是我们不断失去权利去做的赌注
技术对齐研究并非毫无价值。如果世界有一天通过冻结超级智能竞赛的条约,我们会需要所有能得到的严肃工具,用于已存在的系统,以及任何在严格控制下进行的后续工作。
将对齐作为主要计划来资助,同时让实验室向超级智能扩展,等于把目的地视为固定。它并不固定。这类目的地是人选的。核武库、臭氧化学和人类克隆都曾有这样的时刻:世界决定某些终态不值得承担残余风险。超级智能应永久列入该清单。超级智能无法被控制。
假设炸弹会被制造的对齐研究,相对于流水线而言只是一种安慰性预算。
钱应该用在哪里
将针对ASI的对齐工作转向使不创造可执行的工作::
- 条约设计、验证,以及可跨境检查的芯片级算力治理。
- 让目标保持清晰的公众论述:阻止超级智能,而非模糊的“放缓AI”。
- 举报人支持、事件透明度,以及提高悄无声息能力跃升成本的独立评估。
- 政治组织工作,让立法者听到选民的声音,而非仅来自实验室游说者。
这份清单不如新训练技术光鲜。但它是唯一与失败模式匹配的清单。一个在听起来对齐上略胜一筹的超级智能,仍是超级智能。一个拒绝构建它的世界,才有让对齐研究在没有灭绝风险秒表的情况下继续的未来。
来自实验室内部的反对
“如果我们不解决对齐问题,别人就会不安全地建造它。”公平地听:留在前沿的研究者常常相信自己的存在就是安全。有时他们对今天的模型发布是正确的。这个论点在极限处失效。一场每支队伍都需要再一次能力跃升才能为下一次跃升的安全工作筹资的竞赛,依然是那场竞赛,只是戴上了徽章。
一个实验室的单边克制不是要求。 一份具有约束力的国际条约 是诉求,属于在危险具有集体性且存在背叛激励时所使用的同一类工具。对齐资助可以支持这一政治。它不应取而代之。
条约签订后,如果愿意可以继续
这里没有任何内容说对齐科学必须永远停止。在对超级智能实施有约束力、可验证的禁止之后,对现有系统的研究可以在不把人类灭绝视为可接受实验成本的规则下继续。超级智能无法被人类控制。在该禁令生效前,每一美元让竞赛显得可控,都是一美元没有花在结束竞赛上。
把钱挪走。投给预防、法律与核查。把完美对齐的神的梦想留在架子上,直到世界同意不在黑暗中建造一个。关于长期主义资助叙事的更长论证,请见 长期主义正确预判了风险.