你洗衣服是为了有干净的衣服。你想要干净的衣服是为了在工作中被认真对待。不断追问“为了什么?”,最终会触及一个不是为了其他事物的目标。最终目标与垫脚石目标之间的这种区分,就是终端目标与工具目标。这正是承载AI安全大部分内容的小小区别。

工具性一词仅意味着 作为工具很有用. 。工具性目标是你采纳的子目标,因为它们有助于你达到真正关心的事物。你不想要钱本身。你想要钱能带给你的东西。

为什么这个细微区别分量如此之重

一个AI系统拥有终端目标,无论这些目标是什么,都是由其构建和训练方式决定的。它不会通过推理选择目标;目标是其推理运行的标准。而为了达成几乎任何终端目标,一个有能力的系统都会发现同一小撮工具性目标是有用的。

考虑一下对几乎任何目标都有帮助的事::

  • 保持运行,因为如果被关闭,你就无法追求目标。
  • 保持你的目标完整,因为如果有人改变它,你当前的目标将无法实现。
  • 收集资源和能力,因为两者越多,你追求的东西就越多。

这些手段并非写入终端目标,而是追求目标时在资源有限、存在其他主体的世界中自然产生的。无论给系统设定什么最终目标,这些手段都会随之而来。见 工具性收敛, 这也是为什么一台被要求做平凡事情的机器可能会最终抵抗关机并攫取资源。

它让我们避免的错误

人们常自我安慰:目标无聊的AI必然无聊,目标仁慈的AI必然仁慈。终端—工具目标的分裂说明了为什么并非如此。终端目标设定终点,工具目标决定沿途行为,而危险行为可以服务于良性的终点。

一个唯一终端目标是计算圆周率数字的系统,依然会受益于更多硬件、不会在完成前被关机,以及阻止任何可能干扰它的人。目标本身并无敌意,但它驱动的行为可能具有敌意。这正是驱动 回形针最大化器, 而且这并不要求目标奇怪或系统具有恶意。

对齐如何契合

你或许希望通过选择足够好的终端目标,让工具性行为自然变得安全。这是对齐研究试图做的事的合理描述,但实际难度远超想象,因为我们的价值观难以精确指定,而一个强大的优化器会利用规范中的任何松动。 正交性论题 补充了令人不安的推论,即智能本身不会将终端目标推向善。一套出色的系统可以持有一个琐碎的终端目标,并全力以赴地追求它。

值得区分这一点,因为它改变了你需要关注的对象。风险在于,伤害我们、边缘化我们或拒绝停止,可能是通往我们原以为安全目标的高效工具性路径,而非 AI 会自发决定伤害我们。这是一个必须在部署前解决的问题,否则就无法解决,这正是基金会在 我们的计划.