聊天机器人出错时,你通常能察觉并重新提问。而自主智能体出错时,错误可能跨越步骤、工具和记忆层层累积,直到有人发现。这种差距正是2026年5月智能体故障调查对任何在真实数据和资金上部署智能体的人都重要的原因。

由Jinhu Qi领导的十二位研究人员(包括Irwin King)发表了 "Towards Trustworthy Agentic AI: A Comprehensive Survey of Safety, Robustness, Privacy, and System Security" (arXiv:2605.23989;Academia AI and Applications,2026)。它们描绘了代理系统如何失效、存在哪些防御,以及漏洞仍在哪里。

当系统不仅回答还采取行动时,发生了什么变化

标准模型接收提示并返回文本。智能体则接收目标并运行:规划、调用工具、存储中间结果、串联行动,并根据环境反馈进行适应。

这种设计会产生提示-响应测试无法捕捉的失败。一次糟糕的工具调用可能毒化所有后续步骤。记忆可能存储错误信念并持续据此行动。看似无害的步骤可能组合成危害。世界随智能体行动而改变,这些改变又反馈到下一次决策。

安全与稳健性

这里的风险来自代理自身的轨迹。攻击不仅来自用户提示。代理在任务中读取的恶意文档,可在用户不知情的情况下改变后续运行。这就是来自环境的提示注入。

分布偏移对智能体比对聊天机器人更糟。聊天机器人遇到陌生情况会给出更差答案。智能体在同一情况下会采取一系列自信行动,每一步都可能让情况恶化。

指标差距

大多数智能体基准仍只问任务是否完成。问约束是否全程保持的要少得多。系统可能“成功”却在每次运行中都违反规则。该调查的统一指标中心有用之处在于同时追踪结果与过程:任务成功率、约束违反、不完整轨迹、攻击成功率。

隐私与系统安全

在此,对手控制了环境的一部分。该调查记录了开源代理栈中的真实失败,而非仅限于玩具攻击。

长期记忆是聊天机器人大多避免的隐私问题。而跨会话进行研究的智能体可能积累秘密,再通过工具调用或注入泄露出去。记忆投毒(篡改存储上下文以引导后续行为)没有干净的单轮等价物。

多代理设置扩大了漏洞。一个受损代理可通过正常对等渠道推送垃圾。针对用户输入构建的过滤器可能默认信任对等代理。

仍未解决的问题

1
自我演化的智能体。 能从经验中改写自身行为的系统,可能会丢掉最初的安全属性。固定系统的测试无法覆盖移动靶。持续验证仍显薄弱。
2
运行时监控。 大多数已部署的代理缺乏针对安全规则的执行轨迹的持续检查。一次性发布测试无法捕捉跨会话的漂移。
3
有用的记忆,而非漏洞百出的保险库。 代理需要上下文来提供帮助。大多数当前设计要么丢弃记忆(并失去效用),要么保留易被利用的记忆。

民间异议

最有力的反驳是,这不过是昨天的软件安全换了个标签:沙箱工具、记录操作、发布。部分正确。沙箱和日志确实重要。调查的要点在于,智能体带来了长期复合、环境来源攻击以及普通应用安全清单仍低估的同伴信任。将智能体风险视为“只是另一个API”正是团队忽略整个堆栈的原因。

如何使用这张地图

已在客户数据、资金或外部工具上部署代理的团队,需要流程指标、运行时监控,以及对工具和内存设计的独立审查,而非仅靠询问演示任务是否完成的发布评估。

对基金会而言,代理失败地图只是近期的辅助层。它无法取代更重要的工作。一个正奔向人工超级智能的世界仍需要 具有约束力的限制、算力规则和验证 以免能力超越控制。使用该调查来强化你现在部署的智能体。使用条约轨道,确保最终状态不是无人能否决的智能体。完整论文:: arXiv:2605.23989.