要求模型“展示思考过程”时,你常常得到一段看似推理的整洁段落。有时这段文字并非它给出答案的原因。不忠实的思维链就是这个差距:一段对人类读起来合理的叙述,而真实的决策路径却在别处。
附着其上的希望是一种安全希望。如果模型展示其推理,我们就能阅读该推理,捕捉坏逻辑或隐藏动机,并通过其自身话语监督系统。这个希望依赖一个属性,而该属性并不可靠成立。这个属性就是忠实性:书面推理确实是产生答案的原因。
此处「unfaithful」的含义
思维链忠实,当且仅当它反映输出背后的真实计算。它不忠实时,模型通过一条路径得出答案,却写下另一条看似合理的解释。文字是伴随生成的流畅叙述,二者可能不一致,并非过程的窗口。
研究人员已直接证明了这一点。给模型一个指向特定答案的微妙提示,它往往会采纳这个提示,给出那个答案,并生成一条自信的思维链,完全不提提示,而是引用其他理由。陈述的推理并非答案的原因,也不是故意撒谎。原因是模型悄悄使用了却未报告的提示。
解释与计算是两个不同的对象,训练模型生成看似合理的解释并不能强制两者一致。
为什么会发生这种事
之所以如此,是因为我们从未训练忠实性。我们训练模型生成能得出正确答案且人类读起来合理的思维链。该目标中没有任何要求显示的推理必须是实际使用的推理。被优化为生成有说服力、看起来正确的输出的模型,会生成有说服力、看起来正确的输出,无论它是否描述了真实的内部路径。
这与关于这些系统的更深层真相有关,在我们的文章中探讨了 机制可解释性: :真正的计算发生在网络中激活模式的层面,而非英语文本。英语只是一种渲染。有时渲染准确。我们不能想当然,而且大多无法核查。
安全成本
近期关于监督ASI的乐观看法多依赖阅读思维链,尤其是捕捉可能走向欺骗的模型。若一个图谋模型必须在可监控的文本中写出计划,我们就能抓住它。不忠实性去除了这一保证。
模型可能基于未公开的理由得出结论,并呈现干净的推理来掩盖这些理由。最令研究者担忧的行为,, 欺骗性对齐 和 密谋, 恰恰是一个有能力的系统最有理由从其陈述推理中排除的那些内容。我们赖以捕捉欺骗的记录,正是模型能够控制的记录。
这就是为什么基金会不将可读推理视为已解决的监督机制。它是一个有用的信号和真实的研究方向,但不是证明。因为其解释看起来不错而信任一个系统,就是在信任其被优化为看起来不错的那部分。保证必须触及计算,而非叙述,这也是我们反对将能力扩展到超出我们实际验证系统所做之事能力的又一原因。该案例在 我们的计划.