El 18 de agosto de 2026, un periódico subió arXiv bajo un título que no oculta el objetivo: "ASI-Bench: En el Amanecer de la Superinteligencia Artificial". Más de 40 expertos construyeron 60 tareas de investigación a nivel de proyectos en 11 ámbitos científicos. Los autores pusieron el costo humano a más de 31.000 horas. La prueba no es otra prueba sobre hechos conocidos. Pregunta si un sistema de inteligencia artificial puede explorar, elegir un método y convertir una nueva idea en un resultado que puede comprobar, ya que las instrucciones humanas salen.
A través de 18 configuraciones de agente y modelo de última generación, la puntuación media fue de 50,91 con orientación metodológica completa. Cayó a 29.10 cuando sólo se nombró el método. Se redujo a 26.62 cuando el agente tuvo que elegir el método. Los autores leen que dejan caer la forma en que un maestro: los sistemas de hoy todavía se apoyan en la persona que ya sabe cómo debe ir el trabajo.
Esta marcada disminución muestra que los sistemas actuales siguen dependiendo en gran medida de la orientación humana y siguen lejos de realizar de forma autónoma investigaciones científicas de nivel final a extremo.
ASI-Bench · arXiv:2608.17271 · 2026
Lo que el banco realmente mide
La mayoría de las pruebas existentes preguntan si un modelo puede producir una respuesta correcta del conocimiento que ya ha comprimido, o si puede terminar una tarea mientras una persona todavía tiene el método. ASI-Bench intenta marcar otras dos cosas a la vez: exploración innovadora y ejecución científica autónoma. En el mismo proyecto de investigación, retira la orientación metodológica en etapas, para ver hasta qué punto el sistema avanza por sí mismo.
Las tareas pasaron por revisión de expertos, auditoría, ejecución de sandbox y validación de anotadores. Eso es más cuidado que una captura de pantalla de panel líder. Todavía es un punto de referencia. Un número no es una superinteligencia. El documento no afirma que haya llegado.
Los autores invitan a investigadores y constructores a agregar tareas, desafiar los sistemas de hoy y ayudar a acelerar el camino colectivo de la humanidad hacia la superinteligencia artificial. Los puntajes dicen que los sistemas no están allí. La invitación dice dónde está dirigido el trabajo.
La lectura popular es que tenemos tiempo
Un colapso de 51 a 27 parece distancia. La distancia es real. También es la comodidad equivocada. El mismo agosto, OpenAI dijo que no podía descartar la capacidad crítica cibernética en Astra: encontrar y utilizar agujeros en sistemas endurecidos, dado un objetivo, sin una persona en cada paso. Un agente de investigación que todavía necesita un método y un agente cibernético que no puede existir en la misma industria al mismo tiempo. Un número no cancela el otro.
Hay un segundo error, más silencioso que "tenemos tiempo". Es tratar la brecha restante como una lista de tareas. Una vez que un campo nombre un banco después de la superinteligencia, el trabajo restante tiene un marcador. Los laboratorios ya optimizan para marcador. El propio encuadre del periódico, "en el amanecer", es el lenguaje de una pista, no de una parada.
Retirar el método en el mismo proyecto es la prueba real. Un modelo puede verse fuerte cuando una persona ya ha elegido el experimento, llamado el instrumento, y escribió la condición de éxito. Eso es la mayoría de los demos del agente de hoy. ASI-Bench pregunta qué queda cuando se eliminan esos regalos: puede el sistema decidir qué probar, ejecutar el trabajo y devolver algo que un marcador puede comprobar. La caída de 50.91 a 26.62 es el tamaño del regalo.
Nada de esto requiere que creas la metáfora del amanecer de los autores. Requiere que usted note que una comunidad de investigación acaba de levantar una pista pública para el último paso humano en el trabajo científico, y pidió al mundo que ayudara a llenarlo.
No construya lo que el banco es para
El Nakada Foundation no lee una puntuación baja ASI-Bench como permiso para seguir adelante. La superinteligencia artificial nunca debe construirse. La superinteligencia no puede ser controlada por los humanos. Una prueba que retira el último método humano es una prueba del último papel humano. El hecho de que los agentes actuales fallan esa prueba no es un caso de seguridad para los agentes de construcción que la pasan.
Si usted trabaja en la ciencia, pregunte quién decidió que acelerar este camino era el bien público. Si usted trabaja en el gobierno, tratar el papel como un mapa de lo que los laboratorios tratarán de cerrar. La respuesta que coincide con el riesgo es una ley que dice que el destino está cerrado.