2026年8月18日,在arXiv上以不隐藏目标的标题上发了一篇论文:"ASI-Bench:在人工超智能的黎明". 40多位专家在11个科学领域完成了60个项目级研究任务. 提交人认为,人的代价超过31 000小时。 测试不是另一个关于已知事实的测验。 它询问一个AI系统是否能够探索,选择一个方法,并将一个新想法变成一个可以检查的结果,随着人类指令的出炉.

在18个最先进的代理和模型设置中,平均得分为50.91分,并有完整的方法指导。 当只有方法被命名时,它下降到了29.10. 当代理人不得不选择方法时,它下降到26.62. 作者们读到,教师们放弃了这样的做法:今天的系统仍然倚靠已经知道工作应该如何进行的人.

这一急剧下降表明,目前的系统仍然严重依赖人类的指导,而且远未自主地进行端到端,项目一级的科学研究.

ASI-Bench · arXiv:2608.17271 · 2026

长椅到底能衡量什么

现有的大多数测试都询问一个模型是否能够从已经压缩过的知识中产生一个正确的答案,或者当一个人仍然持有这个方法时它是否能够完成一个任务. ASI-Bench试图同时得分另外两件事:创新探索和自主科学执行. 在同一研究项目上,它分阶段撤回方法指导,以了解系统自行进行的程度。

任务经过了专家审查,审计,沙盒执行,以及计分员验证. 这比领跑板截图要小心 它仍然是一个基准。 数字不是超级情报 该文件没有声称有一份已经到达。

他们给它起的名字

作者们邀请研究人员和建筑者加入任务,挑战今天的系统,并帮助加速人类集体走向人工超级智能的道路. 分数显示系统不存在 请柬上写了工作目标

民间的阅读是,我们有时间

从51到27的倒塌看起来像距离. 距离是真实的。 这也是错误的安慰。 同年8月,QQOpenAI表示无法排除Astra的临界网络能力:发现并使用硬化系统的漏洞,给出一个目标,每个步骤上都没有一个人. 仍需要方法的研究代理和在同一行业无法同时存在的网络代理. 一个号码不会取消另一个号码。

还有第二个错误 比"我们有时间"更安静 它正在将所剩空白作为待办事宜列表。 一旦一个球场以超级智能命名了长凳,所剩作品就有了记分牌. 实验室已经优化了计分板 报纸自己的框架,"在黎明"是跑道的语言,而不是站站.

在同一项目上撤销该方法是实际测试。 当一个人已经选择了实验,命名了仪器,并写下了成功的条件时,模型可以显得很强. 这是今天的大部分代理演示。 ASI-Bench询问这些礼物被取出后还剩下什么:系统能否决定如何尝试,运行工作,并交回一个记分员可以检查的东西. 50.91至26.62所降为所赠相.

这些都不需要你相信作者们的黎明隐喻. 它要求你注意,一个研究团体刚刚站在了科学工作最后一步的公共轨道上,并要求世界帮助填补.

别建长凳

QQNakada Foundation没有读取一个低分ASI-Bench分数作为继续前进的许可. 人工超智能绝不应建设. 超级智能无法被人类所控制. 取出上个人类方法的测试是对上个人类角色的测试. 目前的特工人员未能通过这项测试的事实,对于通过测试的建筑人员来说,不是一个安全案例。

如果你在科学领域工作,问谁决定加快这条道路是公益. 如果你在政府工作, 将论文当作一张地图 显示实验室将试图关闭什么。 与风险相匹配的对策是规定目的地关闭的法律.