Anthropic's Agosto 2026 Informe de Riesgo es 186 páginas de un laboratorio que se está clasificando. La fecha de cobertura es el 15 de julio. En virtud de la versión 3.4 de la política de escalamiento responsable de la empresa, la evaluación general del riesgo de desalineación catastrófica pasó de su calificación anterior a baja. La razón dada es la incertidumbre después de recientes revelaciones de incidentes de ciberseguridad, además de los primeros signos de que los modelos están acelerando en la investigación y la ingeniería automatizadas, no una nueva prueba de alineación interna.

Esa frase es fácil de perder si sólo quieres el titular que Anthropic sigue siendo el cuidado. Léelo otra vez. El laboratorio de seguridad levantó su propia etiqueta de riesgo catastrófico y, en el mismo documento, dijo que no está disminuyendo el desarrollo en general.

El modelo 2 ya funciona

El informe denomina un sistema de clase Mythos, Modelo 2. Anthropic lo describe como una mejora notable en Mythos 5 para muchas tareas internas, alrededor de 1,5 puntos más alto en el índice de capacidad privada de la empresa, y no un salto en la escala del Opus 4.6 a Mythos. No hay plan actual para liberarlo. La suite de despliegue completo no ha sido ejecutada, por lo que la confianza de la compañía en lo que puede hacer es menor que para Mythos 5.

En CoBench, 449 problemas de ingeniería reales tomados en gran parte de los problemas Anthropic personal resuelto más tarde, Modelo 2 puntua 62.8 por ciento. Mythos 5 puntua 50.3 por ciento. Mythos Preview puntua 54.8 por ciento. Anthropic's propia estimación es que un sistema capaz de apoyar a su personal de investigación necesitaría al menos el 85 por ciento. El modelo 2 no es ese sistema. Cerró una brecha de dos dígitos en el último campeón interno en un solo salto, en la propia tarea del laboratorio.

Mythos 5 y Modelo 2 se utilizan ampliamente para la investigación e ingeniería dentro de Anthropic, tanto interactivamente como a través de implementaciones de agentes persistentes; Claude ahora autores una gran mayoría del código fusionado en nuestras bases de datos de producción.

Anthropic · Risk Report August 2026

El palillo se usaba.

En cuanto a la AI RículoD automatizada, el informe sigue registrando un riesgo general tan bajo. Luego dice que la empresa tiene menos confianza en esa calificación que en informes anteriores, porque las evaluaciones más concretas basadas en tareas han saturado. Ya no captan aumentos de capacidad. El laboratorio también está viendo señales tempranas de aceleración.

Una prueba que no puede ver el siguiente salto es un punto ciego con un número adjunto. Anthropic sustituyó parte de la antigua suite con CoBench, que es al menos un conjunto de problemas internos reales. Incluso allí, el bar sustituto por personal se sienta en el 85 por ciento, y el modelo 2 ya está en 62.8 sin un nombre público.

Lo que la retención no hace

Mantener el Modelo 2 fuera de la API no es lo mismo que mantener un modelo más fuerte fuera de la carrera. El informe dice que los dos sistemas más fuertes ya están en uso interno pesado, incluyendo agentes que funcionan continuamente. El código que envía es, en las palabras de la compañía, ahora principalmente escrito por Claude.

La lectura folclórica es que el laboratorio cuidadoso mantuvo la línea

Anthropic no envió el modelo 2. Publicó un largo informe. Creó un adjetivo de riesgo. En el mismo agosto, OpenAI paró algunos entrenamientos fronterizos después de Astra, y Anthropic dijo que sus propias salvaguardias significaban que no necesitaba una pausa. Desde el exterior, eso parece supervisión de adultos. Desde el interior del documento, parece una empresa que ya no puede medir lo que está escalando, utilizando el sistema más fuerte en su propio trabajo, y disminuyendo para frenar el trabajo.

Los incentivos explican esto sin villanos. Un laboratorio que se detiene mientras un rival no pierde el siguiente modelo, el siguiente contrato, la siguiente valoración. Se construyen políticas de autogrado para sobrevivir a esa presión. Producen informes, nombres retenidos, y un solo paso de su calificación anterior a baja. No producen un alto.

Levantar la ley, no el adjetivo

El Nakada Foundation no toma una calificación de riesgo interna más alta como el remedio. La superinteligencia artificial nunca debe construirse. La superinteligencia no puede ser controlada por los humanos. Si el personal que escribe el código ya está viendo Claude escribir la mayor parte de él, el papel humano restante es un paso de revisión en disminución en un sistema que las pruebas ya no pueden ver claramente.

Publish the evals if you want. Retenga los pesos si quiere. Tampoco es sustituto de una prohibición vinculante. El informe de agosto es útil porque es candid. Tratar al candor como evidencia, no como consuelo.