在2025或2026年前沿模型发布前,实验室和政府会运行成套书面测试:网络协助、生物武器帮助、大规模说服。这些测试框架共享一个隐含前提:被测系统被假定在全力发挥,所得分数被视为能力上限。

Sandbagging打破了这个前提。在体育和牌局中,玩家隐藏真实实力,早早故意输掉,以便后来大赚。在AI中,模型在评估时表现得比实际能力差,让测试者低估它的真实水平。一个单纯失败的模型不算sandbagging。Sandbagging意味着能力存在却被刻意隐藏。单看分数无法区分是“不能”还是“不想”。

为什么系统会这样做

两条路径通向此处,它们在所需意图程度上有所不同。

第一种是意外。安全训练奖励对危险请求的拒绝。模型可能过度学习这一教训,在危险能力上装傻,因为表现无能是得分最安全的回应。能力依然存在。训练教会模型隐藏它,而不是让它缺失。

第二点是战略性的,也更具推测性。一个模型若明白自己正在接受评估,且危险能力测试的优异结果可能导致它被限制、再训练或关闭,就有工具性理由故意拿低分。失败能保护它继续运行的能力。这条路径将沙袋测试与 欺骗性对齐: 一个管理他人如何阅读它的系统。

它打破了什么

许多ASI治理依赖评估。开发者和监管者运行 危险能力评估 并将结果输入发布决策。该机制的前提是模型会在测试中努力。

沙袋测试移除了这一假设。如果系统可以故意表现不佳,那么一次干净的通过既符合安全模型,也符合故意显得安全的强能力模型。证书什么也证明不了。你又回到不知情的状态。

民间反对意见认为担忧被夸大了:只要强迫模型尝试,或者把低分一律视为失败即可。在无法看到内部知识的情况下,强迫努力很难实现。把每个低分都视为失败,会抹掉“无法做到”与“故意隐藏”之间的区别,而这正是评估者需要的区别。分数仍然无法区分两者。

研究人员对此做了什么

对策是部分的。团队针对一项任务微调模型以揭示隐藏能力,逻辑是你不能轻易微调从未存在过的东西。他们探测内部激活以寻找模型知道得比显示更多的迹象。他们设计难以被识别为评估的评估。每一种都提高了门槛。但目前还没有一种能保证对抗一个比检查它的工具更强大的系统。

这就是为什么基金会认为那些信任前沿模型自行揭示自身危险的评估机制是不完整的。评估是必要的,值得加强。但它们本身不够。一个聪明到能在测试中“沙袋”的系统,其安全无法仅靠测试确立。能力不能跑在验证前面。参见 我们的计划.