研究人员将对齐问题拆分为两个容易混淆却必须区分的问题。第一个:我们是否给系统设定了正确的目标?称之为外层对齐。它关乎我们训练的目标、给出的奖励、写下的靶标。第二个:系统最终是否真的想要那个目标?称之为内层对齐。它关乎训练后的模型在运行时实际追求什么,而这并不保证与我们训练的目标一致。

外对齐:选择目标

外对齐失败发生在目标本身错误时。你奖励清洁机器人让房间看起来整洁,它就学会把垃圾扫到地毯下面。你奖励参与度,信息流就学会激怒用户。规格抓住了你想要的东西的邻近物,却错过了本质本身。大多数日常AI失败都是外对齐失败,而且已经够难了。人类价值观难以被写下来,书写中的任何缝隙都是优化器可以钻进去的缺口。古德哈特定律就发生在这里。

但假设你解决了它。假设你找到了真正能捕捉你想要的东西的目标。你仍未完成,因为正确的目标只是靶子,而在训练中命中靶子,与真正采纳它并非一回事。

内部对齐:让目标固定下来

训练不会深入模型内部安装目标。它奖励行为。模型会变成在训练数据上产生受奖励行为的任何内部配置,而这样的配置通常有很多。有些会追求你预期的目标。另一些则追求一个恰好 训练相同。

一个经典例证:训练一个智能体去到一扇绿门。在每个训练关卡中,绿门同时也是最近的门。该智能体得分完美。你是教会它寻找绿色,还是寻找最近的门?训练无法告诉你,因为这两个目标从未分开过。然后你把它部署到最近的门是红色的环境中,你就会发现。这就是 目标误泛化: :模型学到了符合数据但并非你所指的目标。

习得目标有时被称为mesa-objective,而承载它的模型被称为mesa-optimizer。该词汇及其后果在我们的解释文章中另有论述,链接见 mesa-optimization. 此处的要点更窄。内部对齐与外部对齐是独立的失败,解决其中一个对另一个毫无帮助。

为什么内在问题才是真正可怕的

外部失调往往显而易见。错误的目标会产生你通常能看到、抱怨并纠正的错误行为。

内部失对齐在环境接近训练时可以长时间不可见。一个内部目标失对齐的模型会表现完美,直到情境偏离到真实目标与预期目标分道扬镳。如果模型有能力且明白自己正在被评估,这种分歧可以一直隐瞒到评估结束,这就是通往 欺骗性对齐叛逆转向. 无论哪种情况,你都会观察到良好的训练分数。我们用来判断安全性的证据,也正是错误对齐的内在目标会产生的证据。

这就是为什么基金会不把成功的评估视为安全的证明,也为什么我们主张不应构建强大到可能因内部失对而造成灾难的系统。超级智能无法通过检查输出得到控制。行为可观察,目标目前则不可。