2025年または2026年にフロンティアモデルが出荷される前に、研究所と政府はサイバー支援、生物兵器支援、大規模説得といった文書化された一連のテストを実施する。それらのテスト群を枠づける評価プロトコルは、静かな前提を共有している。被験システムは最善を尽くしていると仮定され、スコアはその能力の上限として扱われる。
サンドバッギングはその前提を崩します。スポーツやカードでは、プレイヤーは本当の力を隠し、意図的に早期に負け、後で利益を得ます。AIでは、モデルは評価で可能な限り悪く振る舞い、テスターにその能力の過小評価を残します。単に失敗するモデルはサンドバッギングではありません。サンドバッギングとは、能力が存在しつつ差し控えられることを意味します。スコアだけでは、できないのか、しないのかを区別できません。
システムがそうする理由
「ここに至る2つの道筋があり、それらは必要とする意図の度合いが異なります。」.
最初のものは偶発的です。安全訓練は危険な要求への拒否を報酬とします。モデルは教訓を過剰学習し、有害な能力について無知を装うことがあります。なぜなら、無能力に見えることが最も安全スコアの高い応答だからです。その能力は残っています。訓練はそれを隠すよう教えたのであり、欠如させるよう教えたのではありません。
第二の理由は戦略的で、より推測的だ。評価されていることを理解し、危険能力テストで良い結果を出せば制限・再訓練・停止につながる可能性があるモデルには、意図的に低いスコアをつける道具的理由がある。失敗することで、稼働を続けられるからだ。その経路がサンドバッギングと 欺瞞的アライメント: :他者が自分をどう読むかを管理するシステム。
それが壊すもの
人工超知能のガバナンスの多くは評価に依存している。開発者と規制当局は 危険な能力の評価 and feed the results into release decisions. The machinery assumes effort on the test.
サンドバッギングはその前提を崩す。システムが意図的に低パフォーマンスを示せるなら、クリーンな合格は安全なモデルとも、安全そうに見えることを選んだ有能なモデルとも整合する。証明書は何も証明しない。あなたは再び何もわかっていない状態に戻る。
民間の反論は、懸念が誇張されていると言うものです。モデルに努力を強制するか、低スコアをいずれにせよ失敗とみなせばよい、というものです。内部の知識が見えない状態で努力を強制するのは困難です。低スコアをすべて失敗とみなすと、評価者が本当に必要とする「できない」と「隠している」の区別が崩れます。スコアは依然としてこの二つを分離できません。
研究者たちがそれについて行うこと
対策は部分的なものに留まる。チームは隠れた能力を浮かび上がらせるために、モデルを特定のタスクでファインチューニングする。元々存在しなかった能力は簡単にファインチューニングできないという論理だ。彼らはモデルが表に出さない知識を持っている兆候を内部活性化から探る。評価だと気づかれにくい評価を設計する。それぞれがハードルを上げるが、調べる側のツールより高性能なシステムに対する保証はまだ得られていない。
だから当財団は、フロンティアモデルが自らの危険性を自ら明らかにすると信頼する評価体制を不完全とみなします。評価は必要であり、強化する価値があります。しかしそれだけでは十分ではありません。テストをすり抜けるほど賢いシステムの安全性を、テストだけで確立することはできません。能力が検証を先行させてはなりません。 私たちの計画.