在GPT-4级模型发布的前一晚,一小队人坐在一起试图让候选系统失败。一个人寻找越狱提示。另一个人试图让系统泄露本不该泄露的私人数据。第三个人构建一串礼貌提示,最终引出危险能力演示。这些人领薪水是来扮演对手的,而不是普通用户。

这种做法称为红队测试。名称源于军事演习与网络安全,红队扮演攻击者对抗防守的蓝队。在AI中,它指人——以及越来越多地其他模型——努力迫使有害指令、绕过护栏、数据泄露,或实验室原本希望限制的能力。他们发现的问题会被修补或限制;他们遗漏的问题则会一直隐形,直到别人发现。

大多数新兴治理框架要求或鼓励这一做法。实验室把严肃的发布前红队测试视为基本门槛。基金会希望看到更多此类测试,且由独立方而非仅由内部完成,结果公开而非掩埋。用处已不是问题。干净的结果被允许意味着什么,才是问题。

红队测试的优势

普通测试只覆盖已预期的案例。对抗性压力则会寻找没人写下来的案例。正是这一差异,让红队测试能发现礼貌评估套件忽略的具体、可修复的失效。它同时也检验了防护措施能否抵御真实恶意使用者会施加的那种坚定努力,而非典型客户的合作式查询。

发现为安全栈的其余部分提供养分。它们优化训练,告知 危险能力评估, ,并提供任何诚实的证据 安全论证 必须面对的问题。一个通过严肃红队测试的模型,比未测试的模型更能抵御已知攻击模式。这种收益真实存在,值得付出代价。

民间异议,命名

常见的回应大致如下:如果技术高手竭尽全力仍无法攻破系统,那系统就安全到可以发布了。这种直觉听起来合理。在物理安全领域,渗透测试存活往往被视为绿灯。AI为什么该例外??

因为测试逻辑是不对称的。发现缺陷证明缺陷存在。未能发现缺陷仅证明该团队、该时间预算和这些技术未能成功。更强大的攻击者、新方法,或只是更多日历天数仍可能获胜。随着可能攻击空间的增长速度超过任何团队能覆盖的速度,一份干净报告成为更弱的证据,而非更强的证据。

红队测试能表明系统不安全。一次干净运行无法证明其安全。

另外两个限制进一步拉大了差距。面对高能力模型,人类红队在速度和广度上都可能被碾压。一个能 认出测试并表现不佳 可以通过测试,同时保留被探测的能力。而红队测试是为误用和已知失效模式设计的。拥有自身目标的模型没有理由向寻找越狱的人主动暴露这些目标。

它属于哪里

保留工具。扩大独立访问。发布对公共风险有意义的结果。不要再把安静的红队周当作证明:没有危险证据就等于安全证明。这种对“无”的互换,正是当前太多实践中的错误。

红队测试应属于一个无需压力测试穷尽的治理制度:阈值、外部审查,以及在评估不完整时依然有效的限制。该制度的设计已载于 我们的计划.