GPT-4級のモデルが出荷される前夜、小さなチームが候補システムを前にして、意図的に失敗させようとする。一人は脱獄を試み、もう一人は本来漏洩してはならない個人データを引き出そうとし、三人目は丁寧なプロンプトの連鎖で危険な能力を実演させる。これらの人々は、普通のユーザーではなく、敵役として給与をもらっている。

その実践がレッドチーミングです。名称は軍事演習やサイバーセキュリティに由来し、赤チームが防衛側の青チームに対して攻撃者役を演じます。AIでは、人々、そして次第に他のモデルが、有害な指示、ガードレール回避、データ漏洩、または研究所が囲い込みたかった能力を強引に引き出そうとします。発見されたものは修正・制限されます。見逃されたものは、誰か他が見つけるまで見えません。

新興のガバナンス枠組みの多くは、この実践を要求または奨励している。ラボは本気のリリース前レッドチームを当然のものとして扱う。Foundationは、それを社内だけでなく独立して行い、結果を埋もれさせず開示することを望んでいる。有用性は問題ではない。クリーンな結果に何を意味させるかが問題だ。

Red Teamingの強み

通常のテストは、すでに誰かが想定していたケースを試す。敵対的圧力は、誰も書き残さなかったケースを探す。この違いこそが、レッドチームが丁寧な評価スイートが見逃す具体的な修正可能な失敗を発見する理由である。また、本物の悪用者が行うような執拗な試みに対して、セーフガードがどれだけ耐えられるかを検証する。

発見は安全スタックの残りを支える。それらは訓練を洗練させ、情報を提供する 危険な能力の評価, そして正直な証拠を提示 安全ケース が直面しなければならないことです。深刻なレッドチームを生き延びたモデルは、そうでないモデルよりも既知の攻撃パターンに対してよりよく耐えられます。その利得は現実的で、支払う価値があります。

一般的な異論、その名称

よくある返答はこうです。熟練した人々が全力でシステムを破ろうとして失敗したなら、そのシステムは出荷するのに十分安全だ、というものです。この直感は一見公平に思えます。物理的セキュリティでは、侵入テストを生き延びたことがグリーンライト扱いされることがよくあります。なぜAIは違うのでしょうか。?

テストの論理は非対称だからだ。欠陥を見つければ、その欠陥が存在することは証明される。見つからなかったとしても、それが証明するのは、このチームがこの時間と手法で成功しなかったという事実だけだ。より能力の高い攻撃者、新たな手法、あるいは単により多くの日数があれば、まだ勝てる可能性がある。攻撃の可能性がどんなチームでもカバーしきれない速度で増えていく以上、問題なしという報告はむしろ証拠としての価値を失っていく。

レッドチームテストでシステムが安全でないことを示すことはできる。クリーンな実行では安全であることを示せない。

さらに二つの制約がその差を縮めます。能力の高いモデルに対しては、人間のレッドチームが速度と幅の両面で太刀打ちできなくなります。 テストを認識してパフォーマンスを下げる 検査を受けても能力を保持したまま通過できる。レッドチーミングは悪用や既知の失敗モード向けに作られている。自らの目標を持つモデルには、脱獄を探す相手にその目標を自ら明かす理由がない。

それが属する場所

ツールは保持せよ。独立したアクセスの拡大を図れ。公的リスクに関わる結果を公表せよ。静かなレッドチーム週を「危険の証明がない=安全の証明」とみなす証明書として扱うのをやめよ。その不在のすり替えこそ、現在多くの実務に通底する誤りだ。

レッドチーミングは、ストレステストが網羅的である必要のない統治体制の中に位置づけられるべきだ。閾値、外部審査、そして評価が不完全でも機能する制限。それらの体制設計は 私たちの計画.