Anthropicの2026年8月リスク報告書は186ページにわたる自社評価である。対象期間は7月15日まで。同社の責任ある拡大方針バージョン3.4の下で、破局的ミスアライメントリスクの全体評価が従来の最低水準から低水準へ変更された。理由として挙げられたのは、最近のサイバーセキュリティ事件開示後の不確実性と、自動研究・工学の加速を示す初期兆候であり、内面アライメントの新たな証明ではない。

その文は「Anthropicは依然として慎重な立場」という見出しだけを求める読者には見逃されやすい。もう一度読んでほしい。安全を掲げる研究室が自らの破局的リスク評価を引き上げたうえで、同じ文書の中で開発全体を減速させないと述べている。

Model 2 is already at work

報告書は未公開のMythos級システムであるModel 2に言及している。Anthropicはこれを多くの社内タスクでMythos 5より顕著に優れ、自社非公開能力指数で約1.5ポイント高いと述べ、Opus 4.6からMythosへの飛躍ほどの規模ではないとしている。現時点で公開予定はない。完全な展開前評価スイートは未実施であるため、同社自身の能力に対する信頼度はMythos 5の場合より低い。

主にAnthropicスタッフが後に解決した実務的工学問題449件からなるCoBenchで、Model 2は62.8%を記録した。Mythos 5は50.3%、Mythos Previewは54.8%である。同社自身の推定では、研究スタッフを代替できるシステムには少なくとも85%が必要とされる。Model 2はその水準には達していない。最後の社内最高成績に対して二桁の差を一挙に縮めた。

Mythos 5とModel 2はAnthropic内で研究・工学に広く活用されており、対話形式および常駐エージェント展開の両方で用いられている。Claudeは現在、生産コードベースにマージされるコードの大部分を生成している。

Anthropic · Risk Report August 2026

The yardstick used itself up

On automated AI R&D, the report still rates overall risk as low. Then it says the company is less confident in that rating than in prior reports, because the most concrete task-based evaluations have saturated. They no longer capture increases in capability. The lab is also seeing early signs of acceleration.

次の飛躍を捉えられないテストは、数値付きの死角である。Anthropicは旧スイートの一部を、少なくとも実際の社内問題群であるCoBenchに置き換えた。それでもスタッフ代替の基準は85%にあり、Model 2はすでに62.8%に達しているうえに公開名もない。

What the withhold does not do

Model 2をAPIから外すことは、より強力なモデルを競争から排除することと同じではない。報告書によると、2つの最強システムはすでに継続的に動作するエージェントを含む重い内部利用中である。出荷されるコードは、会社の言葉で言えば、現在主にClaudeによって書かれている。

一般的な解釈では、慎重な研究室が一線を守ったということになる。

AnthropicはModel 2を出荷しなかった。長い報告書を公開し、リスクの形容詞を引き上げた。同年8月、OpenAIはAstra後に一部のフロンティア訓練を一時停止し、Anthropicは自社の安全策により一時停止は不要と述べた。外部から見れば大人の監督のように見えるが、文書内部から見れば、測定できなくなったものを測定しようとし、より強力なシステムを自社業務に使い、作業を遅らせることを拒否する会社の姿が浮かぶ。

悪役抜きでインセンティブがこれを説明する。競合が止めない中で自社だけ止めれば、次のモデル、次の契約、次の評価額を失う。自社評価のポリシーはその圧力に耐えられるよう作られている。報告書や非公開の名前、以前の最低評価から一段階上げた「低」評価は生み出すが、停止は生み出さない。

Raise the law, not the adjective

中田財団 does not take a higher in-house risk rating as the remedy. Artificial superintelligence should never be built. Superintelligence cannot be controlled by humans. If the staff who write the code are already watching Claude write most of it, the remaining human role is a shrinking review step on a system the tests can no longer see clearly.

評価を公開したければ公開すればよい。重みを非公開にしたければ非公開にすればよい。どちらも拘束力のある禁止の代わりにはならない。8月の報告書は率直である点で有用だ。その率直さを安心材料ではなく証拠として扱え。