Noong Agosto 18, 2026, ang isang papel ay umakyat sa arXiv sa ilalim ng isang pamagat na hindi itinatago ang target: "ASI-Bench: Sa Dawn of Artificial Superintelligence." Mahigit sa 40 eksperto ang nagtayo ng 60 proyekto-level na gawaing pananaliksik sa ibayo ng 11 siyentipikong sakop. Inilagay ng mga awtor ang halaga ng tao sa mahigit na 31,000 oras. Ang pagsubok ay hindi isa pang pagsubok tungkol sa kilalang mga katotohanan. Tinatanong nito kung ang isang sistema ng AI ay makapaggagalugad, makapipili ng isang pamamaraan, at makapagbabago ng isang bagong ideya bilang resulta, yamang ang mga tagubilin ng tao ay dumarating.

Sa ibayong 18 estado-of-the-art agent at model setups, ang average score ay 50.91 na may buong methodolohikal na patnubay. Ito ay bumaba sa 29.10 nang ang paraan lamang ang pinangalanan. Bumagsak ito sa 26.62 nang kinailangang piliin ng ahente ang pamamaraan. Nabasa ng mga awtor na ang pagbaba sa paraan ng isang guro: ang mga sistema sa ngayon ay umaasa pa rin sa taong nakaaalam na kung ano ang dapat gawin.

This sharp decline shows that current systems remain heavily dependent on human guidance and are still far from autonomously conducting end-to-end, project-level scientific research.

ASI-Bench · arXiv:2608.17271 · 2026

What the bench actually measures

Karamihan ng umiiral na mga pagsubok ay nagtatanong kung ang isang modelo ay makagagawa ng tamang sagot mula sa kaalaman na siniksik na nito, o kung matatapos nito ang isang atas samantalang hawak pa rin ng isang tao ang pamamaraan. Sinisikap ng ASI-Bench na gumawa ng dalawa pang bagay kaagad: ang makabagong panggagalugad, at isang autonomous siyentipikong pagpatay. Sa proyekto ring iyon ng pananaliksik, ito'y nag - aalis ng sistematikong patnubay nang baitang - baitang, upang makita kung gaano kalayo ang nararating ng sistema sa ganang sarili.

Tasks went through expert review, auditing, sandbox execution, and scorer validation. That is more care than a leaderboard screenshot. It is still a benchmark. A number is not a superintelligence. The paper does not claim that one has arrived.

What they named it

The authors invite researchers and builders to add tasks, challenge today's systems, and help accelerate humanity's collective path toward artificial superintelligence. The scores say the systems are not there. The invitation says where the work is aimed.

The folk reading is that we have time

Ang pagbagsak mula 51 hanggang 27 ay parang malayo. Totoo ang distansiya. Ito rin ang maling kaaliwan. Noong Agosto ring iyon, sinabi ng OpenAI na hindi nito kayang alisin ang critical cyber na kakayahan sa Astra: paghahanap at paggamit ng mga butas sa mga tumigas na sistema, pagbibigay ng goal, walang tao sa bawat hakbang. Isang ahente ng pananaliksik na nangangailangan pa rin ng isang pamamaraan at isang ahente ng cyber na hindi maaaring sabay na umiral sa parehong industriya. Hindi kinakansela ng isang numero ang isa pa.

There is a second mistake, quieter than "we have time." It is treating the remaining gap as a to-do list. Once a field names a bench after superintelligence, the remaining work has a scoreboard. Labs already optimize for scoreboards. The paper's own framing, "at the dawn," is the language of a runway, not of a stop.

Ang pagguhit ng paraan sa parehong proyekto ay ang aktuwal na pagsubok. Maaaring magmukhang malakas ang isang modelo kapag napili na ng isang tao ang eksperimento, pinangalanan ang instrumento, at isinulat ang matagumpay na kondisyon. Iyan ang karamihan ng mga demo ngayon na ahente. Ang ASI-Bench ay nagtatanong kung ano ang natitira kapag ang mga regalong iyon ay inalis: ang sistema ay maaaring magpasiya kung ano ang lilitisin, patakbuhin ang trabaho, at mag-abot ng isang bagay na maaaring suriin ng isang iskor. Ang 50.91 hanggang 26.62 drop ay ang sukat ng regalo.

None of this requires you to believe the authors' dawn metaphor. It requires you to notice that a research community just stood up a public track for the last human step in scientific work, and asked the world to help fill it.

Do not build the thing the bench is for

Ang Nakada Foundation ay hindi nagbabasa ng mababang iskor na ASI-Bench bilang pahintulot na magpatuloy. Hindi kailanman dapat itayo ang artipisyal na superintelligence. Ang superintelligence ay hindi maaaring kontrolin ng mga tao. Ang isang pagsubok na umuurong sa huling pamamaraan ng tao ay isang pagsubok sa huling papel na ginagampanan ng tao. Ang bagay na nabibigo ang kasalukuyang mga ahente na ang pagsubok ay hindi isang ligtas na kaso para sa mga ahente ng pagtatayo na dumaraan dito.

If you work in science, ask who decided that accelerating this path was the public good. If you work in government, treat the paper as a map of what the labs will try to close. The response that matches the risk is a law that says the destination is closed.