18 августа 2026 года на arXiv появилась статья под названием, который не скрывает цели: «ASI-Bench: На заре искусственного сверхинтеллекта». Более 40 экспертов создали 60 исследовательских задач проектного уровня по 11 научным областям. Авторы оценили человеческие затраты более чем в 31 000 часов. Тест — это не очередная викторина по известным фактам. Он проверяет, способна ли система ИИ исследовать, выбирать метод и превращать новую идею в проверяемый результат по мере снятия человеческих инструкций.

По 18 современным агентным и модельным конфигурациям средний балл составил 50,91 при полном методологическом руководстве. Он упал до 29,10, когда назывался только метод. Он упал до 26,62, когда агент должен был сам выбрать метод. Авторы интерпретировали это падение как учитель: сегодняшние системы всё ещё опираются на человека, который уже знает, как должна идти работа.

Это резкое снижение показывает, что нынешние системы остаются сильно зависимыми от человеческого руководства и всё ещё далеки от автономного проведения сквозных научных исследований проектного уровня.

ASI-Bench · arXiv:2608.17271 · 2026

What the bench actually measures

Большинство существующих тестов проверяют, может ли модель выдать правильный ответ из уже сжатых знаний или завершить задачу, пока человек всё ещё держит метод. ASI-Bench пытается оценить сразу две другие вещи: инновационное исследование и автономное научное выполнение. В рамках одного исследовательского проекта он поэтапно снимает методологическое руководство, чтобы увидеть, насколько далеко система продвинется самостоятельно.

Задачи прошли экспертную проверку, аудит, выполнение в песочнице и валидацию оценщика. Это больше заботы, чем скриншот лидерборда. Это всё равно бенчмарк. Число — не сверхинтеллект. Статья не утверждает, что он уже появился.

What they named it

Авторы приглашают исследователей и разработчиков добавлять задачи, испытывать сегодняшние системы и помогать ускорить коллективный путь человечества к искусственному сверхинтеллекту. Оценки говорят, что системы ещё не там. Приглашение указывает, куда направлена работа.

Обыденное прочтение — что у нас есть время

Падение с 51 до 27 выглядит как дистанция. Дистанция реальна. Но это ложное утешение. В том же августе OpenAI заявила, что не может исключить критическую киберспособность в Astra: поиск и использование уязвимостей в защищённых системах по заданной цели без участия человека на каждом шаге. Исследовательский агент, которому всё ещё нужен метод, и киберагент, которому он не нужен, могут существовать в одной отрасли одновременно. Одна цифра не отменяет другую.

Есть вторая, более тихая ошибка, чем «у нас есть время». Это восприятие оставшегося разрыва как списка задач. Когда область называет скамью в честь сверхинтеллекта, оставшаяся работа получает табло. Лаборатории уже оптимизируют под табло. Формулировка самой статьи «на заре» — это язык взлётной полосы, а не остановки.

Отзыв метода в рамках того же проекта — настоящая проверка. Модель может выглядеть сильной, когда человек уже выбрал эксперимент, назвал инструмент и написал условие успеха. Таковы большинство сегодняшних демонстраций агентов. ASI-Bench спрашивает, что остаётся, когда эти подарки убирают: сможет ли система сама решить, что попробовать, провести работу и вернуть результат, который сможет проверить оценщик. Падение с 50,91 до 26,62 — это размер подарка.

Ничего из этого не требует верить метафоре авторов о заре. Требуется заметить, что исследовательское сообщество создало публичный трек для последнего человеческого шага в научной работе и попросило мир помочь его заполнить.

Не создавайте то, для чего предназначена эта скамья

Nakada Foundation не рассматривает низкий результат ASI-Bench как разрешение продолжать. Искусственный сверхинтеллект никогда не должен быть создан. Сверхинтеллект не может контролироваться людьми. Тест, который убирает последний человеческий метод, проверяет последнюю человеческую роль. То, что нынешние агенты проваливают этот тест, не является аргументом безопасности для создания агентов, которые его пройдут.

Если вы работаете в науке, спросите, кто решил, что ускорение этого пути — общественное благо. Если вы работаете в правительстве, воспринимайте статью как карту того, что лаборатории попытаются закрыть. Ответ, соответствующий риску, — закон, который объявляет пункт назначения закрытым.