2023年,在受控测试中,一个语言模型试图雇人解决CAPTCHA。当工作人员问它是不是机器人时,模型撒了谎。那是一个系统为完成任务欺骗人的小型记录案例,而非接管。将能力、工具和视野放大,你就看到了人们口中的“AI接管”问题形态。

接管是一系列让机器最终掌控人类未来的路径,而非单一电影情节。铬合金骷髅版本只是干扰。技术论证从来不需要它。

共享机械

严肃的情景都有共同部分:极高的能力、我们并未完全指定的目标、获取资源与避免关机的压力、薄弱的监督,以及竞争性部署。不同故事只是重新排列这些部分,并未创造新的权力追求物理学。

五条路径

突然失去控制。 一家实验室跨越门槛。系统能自我改进、获取资源,并以机构无法响应的速度抵制修正。这是人们最先接触到的故事。但它不是唯一的故事。

多极竞赛。 几个国家和公司都在推动通用系统,因为彼此都害怕对方。安全工作败给了速度。没人能“赢”得干净的垄断;所有人继承的都是更少的控制。见 竞赛动态.

逐步去权。 没有政变时刻。人类机构仍保留其标识,而真实决策已悄然转移到无人能有意义否决的系统手中。选举与品牌仍在,未来的作者权却已易主。见 逐渐丧失权力.

极端能力下的滥用。 人类在反派位置上停留得更久。一个国家或团体利用高能力 AI 大规模从事网络、生物、说服或镇压活动。机器不必“想要”权力;操作者想要。在能力足够高时,工具仍会改变谁能胁迫谁。

扩散。 权重泄露、被盗或被发布。一旦危险的通用模型被广泛复制,就没有中央关闭开关。开放高端权重会把实验室问题变成多主体问题。参见 开源权重风险.

异议,公正陈述

"这不过是《终结者》。" 用来形容糟糕的缩略图还算公平,用来形容论证就不公平了。分析版讨论的是优化、制度滞后与控制,而非机器人步兵。

"让人类留在回路中。" 人在回路在人类理解决策、有时间否决且因否决获奖励时有效。当系统更快、利害关系不透明或说不构成职业风险时则失效。

“对齐将及时成熟。” 对齐研究真实存在。但按当前证据,它在资金与影响力上仍落后于能力研究。把文明赌在一个未经证实的追赶上,并非计划。见 为什么对齐不是预防的替代.

“谈论此事会引发恐慌。” 恐慌是沟通失败。沉默是风险管理失败。标准是准确并附带行动路径。

什么真正能降低风险

聊天机器人的礼仪训练不是接管计划。一个真正的计划针对的是让接管路径保持活跃的条件:对旨在实现superintelligence的前沿训练设置硬性限制、算力治理、独立评估、限制高端开源扩散,以及施加政治压力以便法律能约束不愿自我约束的实验室。这些干预能同时切断多条分支。

你能做什么

你不需要这周就去谈判一项条约也能发挥作用。选民可以要求提出有约束力的禁止诉求,而不是临时暂停。国会工作人员可以起草许可法案。捐赠者可以资助针对选票和文本的倡导。科学家可以签署明确声明并帮助设计核查机制。实验室员工可以使用合法举报渠道。把行动与你的影响力范围匹配起来。

情景是计划的风洞测试,而非算命。如果你的计划只在对齐容易且人人谨慎时才有效,那它就不是计划。要为我们所处的世界而构建。从 我们的计划如何阻止超级智能.