2026년 8월 18일 arXiv에 "ASI-Bench: At the Dawn of Artificial Superintelligence"라는 제목의 논문이 올라왔다. 40명 이상의 전문가가 11개 과학 분야에 걸쳐 60개의 프로젝트 수준 연구 과제를 만들었다. 저자들은 인간 비용을 31,000시간 이상으로 산정했다. 이 시험은 이미 알려진 사실에 대한 또 다른 퀴즈가 아니다. 인간 지침이 사라진 상태에서 AI가 탐색하고, 방법을 선택하며, 새로운 아이디어를 검증 가능한 결과로 전환할 수 있는지를 묻는다.
18개의 최신 에이전트 및 모델 설정에서 완전한 방법론 지침이 제공될 때 평균 점수는 50.91이었다. 방법만 명시되자 29.10로 떨어졌고, 에이전트가 직접 방법을 선택해야 하자 26.62로 하락했다. 저자들은 이 하락을 교사가 평가하듯 해석했다. 오늘날 시스템은 여전히 작업 방식에 대해 이미 아는 사람에게 의존한다.
이 급격한 하락은 현재 시스템이 여전히 인간 지침에 크게 의존하며, 자율적으로 프로젝트 수준의 과학 연구를 종단적으로 수행하는 단계와는 거리가 멀다는 것을 보여준다.
ASI-Bench · arXiv:2608.17271 · 2026
What the bench actually measures
기존 대부분의 시험은 모델이 이미 압축한 지식에서 정답을 도출할 수 있는지, 또는 사람이 여전히 방법을 쥐고 있는 상태에서 과제를 완료할 수 있는지를 묻는다. ASI-Bench는 동시에 두 가지를 평가하려 한다. 혁신적 탐색과 자율적 과학 실행이다. 동일한 연구 프로젝트에서 방법론 지침을 단계적으로 철회하며 시스템이 얼마나 스스로 진행하는지를 확인한다.
과제는 전문가 검토, 감사, 샌드박스 실행, 채점자 검증을 거쳤다. 이는 리더보드 스크린샷보다 더 많은 주의를 기울인 결과다. 그래도 여전히 벤치마크일 뿐이다. 숫자는 초지능이 아니다. 논문은 초지능이 도래했다고 주장하지 않는다.
저자들은 연구자와 개발자들에게 과제를 추가하고 오늘날 시스템에 도전하며 인류의 집단적 경로를 인공 초지능으로 가속화하는 데 도움을 주도록 초대합니다. 점수는 시스템이 아직 거기에 이르지 못했다고 말합니다. 초대는 작업이 어디를 향하는지를 보여줍니다.
대중의 해석은 우리가 아직 시간이 있다고 보는 것입니다
51에서 27로의 급락은 거리처럼 보입니다. 거리는 실재합니다. 그러나 그것은 잘못된 위안이기도 합니다. 같은 8월에 OpenAI는 Astra에서 목표를 주고 단계마다 사람 없이 강화된 시스템의 취약점을 찾아 활용하는 임계 사이버 능력을 배제할 수 없다고 밝혔습니다. 방법이 여전히 필요한 연구 에이전트와 그렇지 않은 사이버 에이전트는 같은 산업에 동시에 존재할 수 있습니다. 하나의 숫자가 다른 숫자를 상쇄하지 않습니다.
두 번째 실수는 "우리는 시간이 있다"는 말보다 더 조용합니다. 남은 격차를 할 일 목록으로 취급하는 것입니다. 한 분야가 초지능이라는 이름의 벤치마크를 만들면 남은 작업은 점수판을 갖게 됩니다. 연구소들은 이미 점수판에 최적화합니다. 논문 자체의 표현인 "새벽에"는 정지가 아니라 활주로의 언어입니다.
같은 프로젝트에서 방법을 철회하는 것이 실제 시험입니다. 사람이 이미 실험을 선택하고 장비를 지정하며 성공 조건을 작성했다면 모델은 강해 보일 수 있습니다. 그것이 오늘날 대부분의 에이전트 데모입니다. ASI-Bench는 그러한 지원이 제거되었을 때 남는 것이 무엇인지 묻습니다. 시스템이 무엇을 시도할지 결정하고 작업을 실행하며 채점자가 확인할 수 있는 결과를 내놓을 수 있는가. 50.91에서 26.62로의 하락이 바로 그 지원의 크기입니다.
이 모든 것이 저자들의 새벽 비유를 믿을 것을 요구하지는 않습니다. 다만 과학 연구에서 마지막 인간 단계에 대한 공개 트랙을 연구 공동체가 막 세웠고 세계에 이를 채워 달라고 요청했다는 사실을 알아차리면 됩니다.
벤치마크가 겨냥하는 것을 만들지 마십시오
Nakada Foundation은 낮은 ASI-Bench 점수를 계속 진행해도 좋다는 허가로 읽지 않습니다. 인공 초지능은 결코 만들어져서는 안 됩니다. 초지능은 인간이 통제할 수 없습니다. 마지막 인간 방법을 철회하는 시험은 마지막 인간 역할을 시험하는 것입니다. 현재 에이전트들이 그 시험에 실패한다는 사실은 그것을 통과하는 에이전트를 만드는 안전 근거가 될 수 없습니다.
과학 분야에서 일한다면 누가 이 경로를 가속화하는 것이 공공의 이익이라고 결정했는지 물어보십시오. 정부에서 일한다면 논문을 연구소들이 닫으려 할 것들의 지도로 대하십시오. 위험에 맞는 대응은 목적지가 폐쇄되었다고 명시하는 법입니다.