大多数AI安全研究都在问同一个问题:如何让这个模型更安全?更好的训练、更好的对齐、更好的评估。这个问题暗含的假设是,更安全的模型在真实系统中与其他智能体和用户交互时,就会表现出更安全的行为。
重新排序相同的四个代理导致批准率出现 59 个百分点的波动。
《立场:能动AI的安全与公平取决于交互拓扑,而非模型规模或对齐》(arXiv:2605.01147)于2026年5月1日由Tanav Singh Bajaj、Nikhil Singh、Karan Anand和Eishkaran Singh提交至arXiv,直接挑战了这一假设。他们的发现是:在多智能体AI系统中,智能体如何连接和交互的结构,凌驾于任何单个模型的安全属性之上。良好对齐的模型可能仅因系统连接方式而产生灾难性不安全输出。
三种失败模式
研究人员使用参数从3B到70B不等的模型,在5760份合成信贷申请上测试了多智能体贷款审批系统。他们发现了三种不同的失效模式,而这些模式对标准模型级安全评估是不可见的。
有序的不稳定性
在顺序代理管道中,角色顺序对结果的影响与推理质量相当。对于LLaMA-3B模型,在四个角色的24种可能排序中,批准率从36.4%到95.4%不等,差距达59个百分点。即使在70B规模,差距仍有21.7个百分点(71.5%至93.2%)。相同的模型、相同的任务、相同的应用,完全不同的输出取决于哪个代理先行动。
模式始终一致:把风险经理排在最前面时批准率最低,把数据科学家排在最前面时批准率最高。无论对单个模型做多少对齐工作,都无法消除这一效应,因为这是流水线顺序的属性,而非模型的属性。
信息级联
在顺序系统中,后续代理遵循先前代理而非独立推理。小型 3B 模型显示约 90% 的代理间一致性,伴随 20% 的错误纠正,表明它们仍在进行某种独立评估。在 70B 及以上规模,代理间一致性升至 99.9% 以上,错误纠正率降至 0.1% 以下。
审议实际上已经停止。第一个智能体的判断未经改动就通过了整个流程,剩下的智能体只提供了审查的外表,而无其实质。更强大的模型更快、更彻底地形成共识,正是因为它们在达成一致上的更强能力,放大了这一失败。
功能性崩溃
在并行拓扑与法官聚合下,LLaMA-3B模型在信用等级上产生了约98%的总体批准率,低信用申请人批准率为95%,高信用申请人为100%。按人口统计均等指标看,这似乎是公平、非歧视的系统。实际上,系统已完全停止歧视。风险评估已变成通过不加区分的批准而非公平评估来满足的形式。
扩展模型能力只会强化拓扑驱动的失败,而非缓解它们。更强大的模型会把更多算力用于构建一致的群体共识,而非独立评估。在70B规模下,独立审议几乎完全消失,多智能体系统实际上变成了带额外步骤的单智能体系统,继承不了多位独立评审者本应提供的安全优势。
由此产生的监管空白
当前AI安全框架评估的是模型。它们评估模型输出、衡量模型对齐、认证模型行为。连接多个模型的交互架构完全处于这一评估框架之外。
论文作者将此描述为一个根本性问题,并提出了四项具体治理建议。安全认证应要求对架构变体进行拓扑扫描。基准测试应明确指定所测试的交互结构。部署前应要求进行架构稳健性测试。监管披露应强制要求提供系统架构文档以及跨拓扑变体的稳定性证明。
基本论点:能动AI必须被视为一个动态系统,而非一组对齐的组件。交互拓扑是一个安全参数,而当前评估方法并未测量。监管者和部署者正在审计错误的对象。
这在实践中的含义
贷款审批场景代表了现实世界部署的广泛类别。多智能体AI系统现已用于招聘、医疗分诊、内容审核、法律研究和金融合规。在大多数此类情境中,单独认证或评估的模型通过未接受同等审查的架构连接。
贷款批准率因代理排序变化出现59个百分点的波动,意味着其他高风险流水线决策也存在类似结构性不稳定。使用顺序代理评审的自主医疗分诊系统会面临排序不稳定性。使用并行代理投票的招聘筛选流水线则会遭遇功能崩溃。流水线结构是一个安全参数,而当前评估根本未捕捉到这一点。
结构是一个安全参数。像对待模型选择一样对待流水线设计:测试它,在风险高时加以监管,不要仅凭模型分数就把多智能体系统部署到医疗或信贷领域。关于更广泛的控制问题,参见 我们的计划. 完整论文:: arXiv:2605.01147.
最强烈的反对
最公允的反对意见是,仔细选择模型仍然占主导地位,而流水线顺序只是次要调整。通过重新排序代理获得 59 分的巨大变化可不是次要调整。结构是一级安全参数。要对拓扑打分,而不只是对权重打分。