校对:Soup 报道日期为7月15日. 根据公司负责任的扩展政策第3.4版,对灾难性错配风险的总体评估从先前的下限评级转移到了低等. 给出的理由是近期网络安全事件披露后的不确定性,加上模型在自动化研究和工程中加速的早期迹象,而不是内在对接的新证据.

这句话很容易被错过,如果你只想要标题 QQAnthropic仍然是小心的。 再读一遍 安全品牌的实验室提出了自己的灾难性风险标签,在同一文件中说,它并没有全面减缓发展.

二号型号已经在工作了

报告命名了一个未释放的神话级系统,模型 2. QQAnthropic形容这在许多内部任务上是"神话5"的显著改进,在公司的私人能力指数上高出了约1.5分,而不是从"Opus 4.6"到"神话"的规模上跳出. 目前没有计划释放它。 完整的部署前套房尚未运行,因此公司自身对能做什么的信心低于"神话5".

在Co Bench上,449个真正的工程问题主要取自QQAnthropicQQ员工后来解决的问题,Model 2评分62.8%. 神话5分得分50.3%. "神话预览"评分54.8%. 全球之声自己的估计是, 一个能够支持其研究人员的系统至少需要85%。 模式2不是这个系统。 在实验室的功课上,它填补了最后一个内部冠军的两位数差距。

Mythos 5和Model 2在QQAnthropic内部被广泛用于研究和工程,无论是互动的还是通过持续的代理部署的;QQClaude现在的作者大部分代码合并到我们的生产代码库.

Anthropic · Risk Report August 2026

标尺用得上

关于自动化AI研发,报告仍然将总体风险评为低. 然后,它说公司对这个评级的信心不如以前的报告,因为最具体的任务评价已经饱和了. 他们不再掌握能力的增长。 实验室还发现了早期加速的迹象.

无法看到下个跳跃的测试是带有数字的盲点. QQAnthropic用Co Bench取代了旧套房的一部分,这至少是一套真正的内部问题. 即使在那里,替补员工酒吧也坐了85%,而"模型2"已经是62.8了,没有公开的名字.

被扣留者不这样做

将2号型号保留在API之外,与不让更强大的型号出赛不同. 报告说,两个最强的系统已经在内部大量使用,包括连续运行的剂. 舰船的代码,用公司的话来说,现在大多是由QQClaude所写.

民间的阅读是 仔细的实验室 持有的线

QQAnthropic没有出动型号2. 它发表了长篇报告. 它提出了一个风险形容词。 同年8月,QQOpenAI在Astra后暂停了一些边境训练,而QQAnthropic表示自己的保障措施意味着不需要暂停. 从外面看,这看起来像成人监督。 从文档内部看,它看起来像一个公司,它不再能够测量它正在规模化的东西,在自己的作品上使用更强大的系统,并拒绝减缓工作.

奖励可以解释这一点,没有坏人。 一个在竞争对手不失去下一个模型,下一个合同,下一个估值的情况下停止的实验室. 自定等级的政策是为了活过这种压力。 他们提出报告,不公布姓名,而且一分之一的评级从先前的楼层改为低层。 它们不会造成停顿。

提高法律,而不是形容词

QQNakada FoundationQQ不取更高的内部风险评级作为补救. 人工超智能绝不应建设. 超级智能无法被人类所控制. 如果写代码的工作人员已经看到QQClaude写了大部分内容, 剩下的人类角色就是在系统上缩小审查步骤,

如果需要,请发布 evals 。 随便你拿起重量 也不能取代具有约束力的禁令。 8月份的报告是有用的,因为它是坦率的。 把神道当作证据 而不是安慰