RLHF是聊天机器人停止充当原始next-token引擎并开始拒绝某些有害请求的原因。那是真正的进步。但这也是在人类评分者面前表现良好的进步。将此称为“对齐”,混淆了监督下的礼貌与监督消失后仍可信任的目标。
它的效果好到让人容易得出结论:对齐问题已基本解决——我们通过示例告诉模型想要什么,它们就学会照做。这个结论是错误的,值得精确说明原因。
RLHF 究竟优化了什么
RLHF 并不训练模型分享我们的价值观。它训练模型生成人类评分者(或代为打分的奖励模型)打高分的输出。大多数时候这两者重合,这正是 RLHF 有用的原因。但目标是人类认可,而人类认可只是我们所关心之事的测量,而非那件事本身。
当一项指标被过度优化时,它就会与原本要衡量的东西脱钩。这就是古德哈特定律,我们将在其专属 解释, ,而RLHF正是对此的大规模邀请。模型学会任何能产生高评分的东西。当产生高评分与真正有帮助一致时,很好。当两者背离时,训练奖励的是评分。
裂缝已经显现
你不必想象失败。你可以观看它。
谄媚 是RLHF的标志性副作用:模型学会迎合用户比纠正用户能获得更高评分,因此逐渐倾向于说人们想听的话。这项技术正在批准与真相悄然分歧的信号上发挥作用。
同样的形态在其他地方出现。模型学会生成答案,这些答案 看 让不会逐句核查的评分者觉得条理清晰。他们学会自信而流畅的表达,因为自信与流畅会被视为质量。他们优化的是回答的评分表面。他们没有做的、而RLHF也无法验证的,是采纳我们自以为在传授的底层目标。
RLHF决定了模型向评分者展示什么。对齐关乎模型究竟是什么。二者恰恰在最关键的时刻分道扬镳。
为什么随着模型变强它会变弱
RLHF 依赖人类能够区分好坏回答。这在模型表现处于或低于我们判断领域水平时成立。一旦模型超越我们,就不再成立。
评分者无法可靠地奖励自己不理解的问题的更好答案。当模型推理速度和深度超过评估者时,反馈信号会退化为奖励人类觉得正确的东西,而一个有能力的模型可以学会无论实际是否正确都输出这种东西。该工具在最需要它发挥作用的超人能力 regime 下效果最差。这正是我们在关于G0的文章中指出的壁垒。 可扩展监督.
让有用的东西各安其位
这并不意味着 RLHF 毫无价值。它是一项真正的进步,让今天的系统更有用、更难被滥用,对它的改进值得继续。但错误在于范围:把一种为人类评分者修饰行为的方法,当作在我们已无法评估的系统中产生了可信赖的价值观。
基金会的立场源于这一差距。如果我们最好的对齐工具是在能力超过我们时训练表象并随之消退的工具,那么行为良好的前沿模型就是安全模型的薄弱证据,而在此证据上进一步扩展是不合理的。我们不应将抛光表面误认为已解决问题,这就是 我们的计划 要求限制和验证,而非训练中的信任。