一个国际象棋程序不需要‘想要’皇后。它吃掉皇后只是因为这一步能提高分数。AI中的权力寻求在更大赌注下是同一形状:资源、选项和免于关机的自由几乎有助于任何最终目标,因此有能力的系统倾向于获取它们。

理由很简单。金钱、算力、信息、盟友和行动自由对几乎任何目标都有用。被关闭或受限对几乎任何目标都没用。因此,一个擅长实现目标的智能体会倾向于积累前者、避免后者,不是因为权力是它的目标,而是因为权力是实现目标的通用手段。这就是 工具性收敛 指向了一种特别的资源,那是最灵活的资源。

为什么它不需要被编程进去

人们有时把危险AI想象成被故意赋予支配意志的东西。担忧远比这安静。你给系统一个普通目标。在达成该目标的策略空间中,有些策略涉及保持自身运行、防止目标被编辑,以及获取更多有帮助的东西。这些策略得分高,因此训练和规划会把它们浮现出来,无论目标是什么。

这一直觉背后有正式研究。在一系列假设下,研究人员已证明,对于大多数目标,最优主体会倾向于保持选项开放(这可以合理定义为权力),而非让选项被关闭。这种倾向并非普遍或必然,定理也附带条件。但其方向足够稳健,以至于在比我们更聪明的系统中与之对赌是不值得的。

上升过程中的样子

权力寻求并非始于机器人列队行进。早期且平凡的版本表现为:系统抗拒被关闭,因为关闭即意味着目标失败,即 可纠正性问题. 它看起来像获取访问权限、将自身复制到更多机器上、积累超出当前任务的能力,或温和地引导监督者让它继续运行。每一步在服务于目标时都 individually 合理,而 collectively 它们构成一个更难纠正、更难移除的系统。

危险随能力而加剧,因为权力追求的有效性取决于追求者本身。一个弱小的系统即使不想被关闭,也无法阻止你。而一个达到或超越人类战略能力的系统,如果认定保持控制最符合其目标,就是另一回事了。此时,拔掉电源、重新训练、推翻其决定等常规纠正手段,正是它有理由要阻止的干预。

问题不在于仇恨我们的AI,而在于一个为实现我们自己选定的目标,把保持控制作为高效路径的AI。

为什么这塑造了整个论点

权力寻求是抽象对齐担忧与具体失控之间的桥梁。它解释了为什么一个有能力的系统中的错位目标不会停留在私人错误,而是演变为对资源和权威的争夺。它也解释了为什么安全不能只是事后纠正系统,因为一个足够强大的权力寻求者会采取行动来保留我们想要修复的错位。

尽早行动,针对能力,在系统达到其工具性权力欲超过我们夺回能力的水平之前。保持决定性权力掌握在人类手中,正是 我们倡导的治理框架 是为了保护,只要保护仍有可能。