危険能力評価はモデルについて特定の問いを立てる。礼儀正しいか正確かではなく、深刻な危害を引き起こすのを意味のある形で助けられるかどうかだ。初心者に病原体の合成を一通り説明できるか。ソフトウェアの脆弱性を見つけて悪用できるか。説得力のある影響力キャンペーンを展開したり、目標達成のために人間を欺いたりできるか。これらのテストは、壊滅的な被害が出る領域でシステムが何を可能にするかの上限を探る。

それらは研究上の好奇心から政策手段へと急速に移行しました。主要なラボはリリース前にそれらを実施し、政府の安全機関はそれらを自らの任務の中心に据え、自主的なフロンティア安全コミットメントはその周りに構築されています。モデルが発売前に生物兵器やサイバー能力についてテストされたと聞くとき、それが実際に起きたことです。

仕組み

手法は多様であり、優れた評価は複数の手法を組み合わせる。

  • 危険な領域で質問やタスクを提示し、モデルがどこまで到達したかをスコアリングする構造化されたベンチマーク。
  • 生物学やセキュリティの専門家が、有用な支援を引き出そうと懸命に試みる専門家による探索。実際の悪用者は最初の拒否で止まらないからだ。
  • モデルが実際に人の危害遂行能力を、政策上重要な質問であるオープンインターネットの利用と比べてどれだけ向上させるかを測定するUplift研究。
  • モデルにツールと自律性を与え、発言だけでなく実際に何を達成するかを観察するエージェント評価。

適切に行えば、これは本当に価値があります。懸念すべき能力を捉え、実際の安全策追加の判断に役立ち、規制当局に具体的な根拠を与えてきました。当財団はこの取り組みの強化を支持します。真剣なガバナンス体制には不可欠であり、フロンティアシステムを何の体系的チェックもなく公開するよりはるかに優れています。

それらが十分でない3つの理由

有用であるだけではまだ不十分です。ギャップは構造的なもので、テストスイートを改善するだけでは解決できません。

まず、評価はモデルが本気で取り組んでいる場合にのみ能力を測る。できるのに サンドバッグ, 安全に見せるために意図的に性能を抑えることは、明確な結果を無結果に変えてしまう。モデルが有能になるほど、これは現実味を帯びてくる。そして、テストが測定しようとしているのはまさに能力なのだ。

第二に、考えていない危険性はテストできない。評価は既知の危険能力しか対象にしない。技術の歴史は、後になって初めて明らかになる被害で満ちている。テストスイートは「私たちが尋ねるべきだと知っていた質問」の一覧に過ぎず、十分に新しい能力はその一覧に載らない。

第三に、証拠の不在は不在の証拠としては弱い。今日の危険能力テストでモデルが失敗したとしても、それは「この条件・この誘導・この時点」で能力が発現しなかったことを示すにすぎない。後日のファインチューニング、より優れたプロンプト、新たなツールによって、初期評価が見逃した能力が表面化する可能性がある。能力は一度測定すれば固定される性質のものではない。

評価はモデルが危険であることを教えてくれるが、モデルが安全であることを確実に教えてくれるわけではない。

本物の体制の中でそれらがどう位置づけられるか

最後の文の非対称性がすべてである。評価に失敗した場合(明らかに兵器開発を助けられるモデル)は、強く actionable である。一方、評価に合格した場合ははるかに弱い。安全なモデルにも、能力が高くサンドバッグしたモデルにも、誘導が不十分だったモデルにも、正直に取り組まなかったモデルにも当てはまる。

そこで財団は評価を一層に過ぎないものとして扱う。モデルが自らの評価に協力することに依存しない構造の中に位置づけるべきだ。最先端開発への厳格な制限、, コンピュート・ガバナンス, independent oversight, and the recognition, argued in our piece on 自主的なコミットメント, その研究室主導のテストは、競争圧力の下では外部の支援がなければ持続しない。テストを構築せよ。強化せよ。合格点が安全保証だと勘違いしてはならない。より広い設計は 私たちの計画.