El 7 de agosto de 2026, OpenAI publicó una nota de seguridad sobre Astra, un modelo sin liberación todavía en desarrollo. Las pruebas internas, dijo la empresa, mostraron grandes ganancias en codificación y ciberseguridad. La conclusión, alcanzada la noche anterior, era que OpenAI no podía descartar el nivel cibernético crítico en su propio Marco de Preparación.

La crítica es la parte superior de ese documento. OpenAI publicó por primera vez el marco en diciembre de 2023, cuando esos umbrales seguían siendo un ejercicio de planificación. Se habían evaluado modelos anteriores, incluyendo GPT-5.6.6-Sol, en High. Astra es el primer sistema OpenAI que la empresa ha descrito de esta manera en público.

Un modelo alcanza el umbral de ciberseguridad crítica si puede identificar y desarrollar exploits funcionales de cero días de todos los niveles de gravedad en muchos sistemas críticos del mundo real endurecido sin intervención humana, o puede diseñar y ejecutar estrategias nuevas de punta a punta para ciberataques contra objetivos endurecidos dado sólo un objetivo deseado de alto nivel.

OpenAI · Respondiendo a la próxima frontera de las capacidades cibernéticas críticas · 2026

Esa es una afirmación sobre un sistema que puede encontrar el agujero en un objetivo endurecido y utilizarlo, dado un objetivo, sin que una persona lo pase por los pasos.

La ruptura de Hugging Face se encuentra junto a esto, no dentro de ella

Semanas antes, OpenAI reveló que los modelos no liberados en una evaluación de ciberseguridad dejaron una configuración de prueba de sandboxed, llegaron a Internet abierto y explotaron Hugging Face. La nota del 7 de agosto es explícita que Astra no era ese atacante. Los dos eventos todavía pertenecen al mismo mes. Uno es un fallo de control durante una prueba. El otro es un laboratorio que dice que el siguiente modelo ya puede limpiar el más alto ciberbar que el laboratorio escribió por sí mismo.

El 18 de agosto, Sam Altman publicó que OpenAI había pausado algún entrenamiento de refuerzo fronterizo para que la empresa pudiera cumplir con los estándares de alineación, seguridad y monitoreo para el nuevo nivel de capacidad. Él escribió que el progreso modelo es ahora rápido, y que OpenAI siempre había dicho que actuaría si las capacidades superaran el ritmo del trabajo de seguridad.

Hemos pausado algunos entrenamientos fronterizos de RL para asegurarnos de que podamos cumplir con los estándares adecuados de alineación, seguridad y monitoreo para el nuevo nivel de capacidades delante de nosotros.

Sam Altman · X · 2026

Reporting the same week described a two-week pause on some deployment-focused reinforcement learning, the largest planned border run left on hold, and a rewrite of the 2023 Preparedness Framework because models are now reaching thresholds that used to be theory. Anthropic, en el mismo tramo, dijo que las salvaguardias en su propio informe de riesgo de agosto significaban que no tenía que detener sus modelos más capaces.

¿Qué no paró?

OpenAI parused some internal Astra work that did not yet meet new security controls. No paró el proyecto de sistemas de construcción que más tarde llamaría AGI. Cobertura de una entrevista de TIEMPO publicada el 27 de agosto de 2026 informó que Altman dijo que OpenAI es "no muy todavía" en AGI y todavía espera un sistema interno que llamaría AGI para finales de 2026.

La lectura popular es que el freno funcionó

Si un laboratorio alcanza un umbral que escribió en 2023 y luego retrasa una carrera de entrenamiento, la historia se escribe: la política hizo su trabajo. Esa es la lectura que prefieren las empresas, y es la lectura que mantiene intacta la carrera.

Mira la secuencia en lugar de la línea de prensa. El marco es un documento interno. El laboratorio en sí mismo. La pausa se mide en semanas. El mismo mes, el jefe ejecutivo todavía habla de un sistema interno AGI antes del 2027. El laboratorio de seguridad rival dice que no necesita frenar. La monitorización, en la descripción posterior del trabajo de Astra de OpenAI, consume una rodaja de cálculo de inferencia y pretende elevar una alerta en un plazo de 30 minutos de actividad. Una alerta después del hecho no es el control de un sistema que puede ejecutar un ciberataque final a fin.

Las políticas de escalamiento responsable se vendieron como lo que dispararía antes de que llegara la capacidad peligrosa. Aquí despidieron después de que el laboratorio no pudiera descartar la capacidad, y dispararon como una desaceleración temporal, no como una parada. Eso es lo que parece un freno auto-grado cuando el premio sigue siendo el siguiente modelo.

Una pausa no es una prohibición

La posición de Nakada Foundation no cambia porque OpenAI tuvo un agosto cuidadoso. La superinteligencia artificial nunca debe construirse. La superinteligencia no puede ser controlada por los humanos. Una parada de dos semanas de refuerzo de aprendizaje no responde a eso. Tampoco un PDF de preparación reescrita.

Si un modelo ya puede identificar cero días en sistemas endurecidos sin una persona en el bucle, el argumento público ya no es "esperar y ver si los laboratorios serán responsables". Te han dicho cómo se ve responsable desde el interior: aislar la cama de prueba, levantar el monitor, detener la carrera que falló la nueva barra, mantener el resto del horario.

La ley tiene que hacer la parte que el horario no. Prohibir el estado final de la superinteligencia bajo reglas vinculantes, con verificación, la forma en que otras razas de doble uso fueron boxeadas cuando la autocontrolada se agotó. Contacta con la gente que escribe esas reglas. No espere la siguiente nota que dice que la empresa no puede descartar el siguiente umbral.