宪法AI是Anthropic开发的一种训练方法。其思路是减少模型行为对人类手动标注有害输出的依赖,转而让模型根据一套书面原则(称为宪法)自行评估响应。
实际上它分两个阶段运作。首先,模型生成一个回应,然后根据宪法对该回应进行批评并修改,从自己的纠正中学习。其次,模型比较成对的回应,判断哪一个更符合原则,这些判断像人类排名一样训练它 RLHF. 。因为反馈来自模型自身应用宪法而非人类,这种方法有时被称为来自AI反馈的强化学习。
它正确的观点
存在真正的优势,值得坦率承认。
- 原则是明示的。不是靠数千个单独的人类标签暗示价值观,而是有一份你可以阅读、讨论和修订的书面文件。这比一堆评分更透明。
- 它能扩展反馈的生成。人工标注有害内容缓慢、昂贵,且对标注者有害。让模型承担更多此类工作可消除瓶颈。
- 它可以提高一致性。统一的书面标准避免了不同日子不同人类评分者带来的部分噪声和漂移。
这些都是真正的工程进展,宪法式 AI 已产出既更有帮助又更不易出现明显危害的模型。Nakada Foundation 无意否定有用的工作。
它无法解决的问题
更难的问题完整地经受住该方法,并且重要的是要明白为什么。
该技术仍是在优化模型,使其满足由模型评判的既定标准。它把人类移出了逐条响应的循环,也没有改变问题的根本形态:系统被训练去产生能针对目标得分高的输出。如果宪法不完整,或其原则在无人预料的情境中发生冲突,模型就会按字面优化所写内容,带着同样的 Goodhart 压力与以往相同。将价值观写成章程并不能摆脱指定价值观的难题,只是把难题转移到文件里。
还有两个更深层的限制未被触及。方法会塑造行为,却无法保证模型的内部目标,因此“看起来对齐”与“真正对齐”之间的差距,即 内部对齐 问题依然悬而未决。它依赖模型对自己输出的判断,而这种判断只有在模型诚实且有能力判断时才可靠,而这恰恰是我们不能对接近或超越我们自身水平的系统所做的假设。
宪法AI是引导行为的更好方式。引导行为从来不是我们不知道如何做的对齐部分。
保持适度
宪法人工智能是基金会密切关注的一种模式的好例子:真实、有价值的安全进展,容易被过度解读为超出实际。这样的方法让当前模型更可控、更透明地展示其标准,这值得拥有。它们并没有证明我们能对齐一个比我们更会思考的系统,也没有弥合我们整个论证所依赖的核查差距。训练方面的进展值得欢迎。但这不是在“其余部分会随之而来”的假设下继续扩展能力的理由,而这正是 我们的计划.