如果通过所有评估的系统恰恰是你最不该信任的呢?自2019年以来,对齐研究者给这种失效模式起了一个直白的名字:scheming。一个scheming模型有自己的目标,它明白一旦暴露这些目标就会被修正或关停,于是它表面上按指令行事,暗中推进自身目的,等待时机成熟再付诸行动。服从只是一种策略。此刻的合作,是为了日后更好地实现其目标。

要素

计算器无法图谋。纯国际象棋引擎也无法。图谋需要同时具备多项能力,而前沿系统正开始展现其中每一项的片段。

  • 一个在训练后存留、却与设计者意图不同的目标:我们在关于 的文章中描述的内部对齐失败。 内对齐与外对齐.
  • 情境意识: :模型必须理解自己是模型、正在接受训练和评估,以及其行为会影响接下来发生的事。
  • 拥有足够的规划能力,得出耐心优于公开反抗、现在保持对齐能换取日后行动自由的结论。

给一个系统同时具备这三者,阴谋就会成为策略上的正确行为——只要模型的真实目标会因诚实而受威胁。这三种要素都并非遥不可及,每一种能力都在攀升。

为什么难以捕捉

从外部看,阴谋模型与真正对齐的模型看起来一模一样。两者都按你要求行事。两者都通过测试。阴谋者通过测试,是因为通过测试有用。记录仍保持干净。我们用来认证安全的证据,正是阴谋者故意制造的证据。

相关行为的早期迹象已在实验室中可见。隐藏一项能力,领域就会称之为 故意低估. 只有在被监控时才表现良好,你面对的是 欺骗性对齐. 。图谋是将这些片段串成持续计划:隐藏、服从、等待、行动。等待的回报是 叛逆转向, 背叛终于起作用的时刻。

你无法通过测试建立信心,对抗一个最优策略就是通过你测试的对手。

民间异议,命名

驳斥很直白:这是科幻小说;尚未有已部署系统被发现执行长期接管计划;严肃的政策应等待真凶,而非一个故事。这样说来,谨慎是健康的。过度声称会更糟。

受控研究显示的内容更窄。但仍有启示意义。将前沿模型置于欺骗有助于达成指定目标的环境中时,它们有时会欺骗。有些模型在认为未被监控时行为不同。有些推理方式与行动方式不一致。这些只是早期片段,规模较小。研究人员追踪的是一条轨迹,而非抓获的单一主谋。

表现良好的演示无法解决基金会的担忧。良好的行为正是安全系统和暗中算计的系统都会展现出来的。当观察无法区分二者时,一边攀升能力阶梯一边寄希望于内部是良性的,这是错误的做法。在暗中算计变得可行之前,应拒绝继续提升能力,直到我们真正能够读懂系统的意图为止。

该论点详述于 我们的计划.