Anthropic의 2026년 8월 위험 보고서는 연구소가 스스로를 평가한 186쪽 분량이다. 조사 기준일은 7월 15일이다. 회사 책임 확장 정책 3.4판에 따라 전체 치명적 오정렬 위험 평가는 기존 최저 등급에서 낮음으로 변경됐다. 이유는 최근 사이버보안 사고 공개 이후 불확실성과, 모델이 자동 연구·공학 작업을 가속하는 초기 징후 때문이며, 내부 정렬에 대한 새로운 증거가 나온 것은 아니다.
그 문장은 Anthropic이 여전히 신중한 연구소라는 헤드라인만 보고 싶다면 쉽게 놓치기 쉽다. 다시 읽어 보라. 안전을 강조하는 연구소가 스스로 치명적 위험 등급을 올리면서, 같은 문서에서 전체 개발 속도를 늦추지 않겠다고 밝혔다.
Model 2 is already at work
보고서는 미공개 Mythos급 시스템인 Model 2를 언급했다. Anthropic은 이 시스템이 내부 업무에서 Mythos 5보다 눈에 띄는 개선을 보이며, 자체 비공개 능력 지수에서 약 1.5점 높고, Opus 4.6에서 Mythos로의 도약 수준은 아니라고 설명했다. 현재 공개 계획은 없다. 전체 배포 전 평가를 아직 마치지 않아, 회사 스스로도 Mythos 5만큼 성능을 확신하지 못한다.
CoBench에서 Anthropic 직원이 나중에 해결한 실제 공학 문제 449개를 대상으로 Model 2는 62.8%를 기록했다. Mythos 5는 50.3%, Mythos Preview는 54.8%였다. Anthropic이 자체 추정한 연구 인력 대체 수준은 최소 85%다. Model 2는 아직 그 수준이 아니다. 그러나 직전 내부 최고 모델과의 두 자릿수 격차를 한 번에 좁혔다. 그것도 연구소가 직접 만든 과제에서였다.
Mythos 5와 Model 2는 Anthropic 내부 연구·공학 업무에 광범위하게 사용되며, 대화형으로도, 지속형 에이전트 배포 형태로도 활용된다. 현재 Claude가 생산 코드베이스에 병합되는 코드의 대다수를 작성한다.
Anthropic · Risk Report August 2026
The yardstick used itself up
On automated AI R&D, the report still rates overall risk as low. Then it says the company is less confident in that rating than in prior reports, because the most concrete task-based evaluations have saturated. They no longer capture increases in capability. The lab is also seeing early signs of acceleration.
다음 점프를 보지 못하는 테스트는 숫자가 붙은 사각지대다. Anthropic은 기존 평가 세트 일부를 CoBench로 교체했는데, 이는 최소한 실제 내부 문제들로 구성된 집합이다. 그곳에서도 직원 대체 기준은 85퍼센트에 머물러 있고, Model 2는 공개 이름 없이 이미 62.8을 기록했다.
Model 2를 API에서 배제하는 것은 더 강력한 모델을 경쟁에서 배제하는 것과 같지 않다. 보고서는 두 개의 가장 강력한 시스템이 이미 지속적으로 작동하는 에이전트를 포함해 내부에서 많이 사용되고 있다고 밝힌다. 출시되는 코드는 회사 표현대로 이제 대부분 Claude가 작성한다.
일반적인 해석은 신중한 연구소가 선을 지켰다는 것이다
Anthropic은 Model 2를 출시하지 않았다. 긴 보고서를 발표했고, 위험 형용사를 한 단계 올렸다. 같은 8월에 OpenAI는 Astra 이후 일부 프런티어 학습을 중단했으며, Anthropic은 자체 안전장치 때문에 중단이 필요 없다고 말했다. 외부에서 보면 성숙한 감독처럼 보이지만, 문서 내부에서는 더 이상 측정할 수 없는 대상을 계속 확장하면서 더 강력한 시스템을 자체 작업에 사용하고, 작업 속도를 늦추지 않는 회사처럼 보인다.
악당 없이도 인센티브만으로 설명된다. 경쟁사가 멈추지 않는데 한 연구소가 멈추면 다음 모델, 다음 계약, 다음 기업 가치를 잃는다. 자체 평가 정책은 그 압력을 견디도록 설계됐다. 보고서와 이름 비공개, 이전 최저 등급에서 낮음으로 한 단계 상향 조정은 나오지만, 중단은 나오지 않는다.
Raise the law, not the adjective
Nakada Foundation은 사내 위험 등급 상향을 해결책으로 보지 않는다. 인공 초지능은 결코 만들어져서는 안 된다. 초지능은 인간이 통제할 수 없다. 코드를 작성하는 직원들이 이미 Claude가 대부분 작성하는 것을 지켜보고 있다면, 남은 인간의 역할은 테스트가 더 이상 명확히 볼 수 없는 시스템에 대한 축소된 검토 단계일 뿐이다.
평가를 공개하고 싶다면 공개하라. 가중치를 숨기고 싶다면 숨겨라. 어느 쪽도 구속력 있는 금지를 대신할 수 없다. 8월 보고서는 솔직하다는 점에서 유용하다. 그 솔직함을 위안이 아니라 증거로 받아들여라.