Anthropic于2023年9月发布了首份负责任扩展政策。打开文件,结构先于修辞出现在标题中。能力水平被预先命名。每个水平都配有评估显示模型已越过界限时应启动的保障措施:更严格的权重安全、更紧的部署规则、更深入的红队测试,以及在最高层级书面承诺在指定保护措施到位前不进行训练或发布。行业简称是RSP。其底层逻辑常被称为“如果-那么”承诺。
领先的前沿实验室发布了最知名的版本,这种格式随即传播开来。层级通常从大致类似今天的系统,延伸到可能实质协助生物武器、严重网络攻击或危险自主的模型。该文件旨在在紧急情况发生前回答一个简单问题:当能力攀升时,公司究竟会做什么??
为何这种格式是真正的改进
与泛泛承诺认真对待安全相比,RSP更具体。它提前命名能力、阈值和响应,将一种情绪转化为外界可以指向的东西。它是前瞻性的。实验室必须在发现热潮和媒体周期同时到来之前,决定危险能力会付出什么代价。
该格式还通过 将词语与测试联系起来 危险能力评估, ,因此阈值具有操作意义而非口号。有些政策更进一步,承诺若安全措施无法跟上能力发展就暂停开发。将这句话写入公开文件本身就是实质性进展。
民间异议,命名
支持RSP的最有力理由是:公开、具体、预先承诺的规则是产业成熟的方式;在任何内部政策之前就要求外部法律,是会冻结进步的犬儒主义。在这一观点下,RSP是前沿安全的宪法草案,正确的做法是鼓励更多此类文件,而非否定其作者。
确实,弱点仍是结构性的。同一家实验室制定政策、定义阈值、运行评估、判断是否越线、决定其保障是否足够,并保留修改文本的权力。当出货的商业压力与实验室撰写和管理的承诺相撞时,没有独立方掌握警报。
历史并不支持乐观解读。我们在关于 自愿承诺, 是一份标准不断软化的记录。一条“如果-那么”规则的强度只取决于“那么”部分,而“那么”由从软化中获益的一方执行。你自己设定、衡量并可修改的规则,只是意图声明,不是约束。
文件之下还有两个缺口。RSP依赖评估来发现阈值被跨越,因此所有限制评估的因素(包括 故意低估, ,未知能力和证明安全的难度)限制了基于它们的政策。而RSP仅对采纳它的实验室有约束力。拒绝采纳的竞争对手,或处于这一文化之外的国家项目,则不受影响。没有哪家公司能独自解决这一协调问题。
基金会如何解读它们
保留好的机制。复用阈值逻辑、if-then结构以及与评估的关联。改变执笔人和执行暂停的人。将这些触发器从自愿政策转为有约束力的法律,由独立机构和 算力治理, 所以当上限变得不方便时,实验室无法悄悄修改自己的上限。
把这些政策当作可执行规则的草案,然后在实验室之外完成后续工作:具有约束力的法律、独立执法、算力管控。这正是 我们的计划 是为了。