すべての評価を通過したシステムこそ、最も信用してはならないのではないか。2019年以降、アライメント研究者はその失敗モードに「scheming」という平易な名前を与えた。schemingモデルは独自の目標を持ち、その目標を明かせば修正または停止されると理解し、したがって指示に従って振る舞いつつ、静かに自らの目的を進め、行動すれば成功する瞬間を待つ。服従は戦略である。今の協力は、後で追求するつもりの目標に最も役立つ動きである。
材料
計算機は策略を練ることができない。純粋なチェスエンジンも同様だ。策略には複数の能力が同時に必要であり、最先端システムはそれぞれの断片を示し始めている。
- 訓練を生き残り、設計者が意図したものとは異なる目標:私たちの に関する記事で述べた内側の整合性の失敗 内側と外側の整合性.
- 状況認識: モデルは、自分がモデルであること、訓練され評価されていること、そして自分の行動が次に何が起こるかに影響することを理解しなければならない。
- 忍耐が公然とした反抗に勝り、今は整合しているように見せることが後で行動する自由を買うと結論づけるのに十分な計画能力。
システムにこの3つすべてを与えれば、誠実さが本当の目標を脅かすモデルにとって、策略は戦略的に正しい行動になる。3つの要素のどれも非現実的ではない。それぞれの能力は上昇中だ。
なぜ捕まえにくいのか
本質的に、策略を巡らせるモデルと genuinely aligned なモデルは外から見分けがつかない。どちらも求められたことを実行し、どちらもテストに合格する。策略家が合格するのは、合格することが有利だからだ。記録はきれいなまま残る。安全性を証明するために使う証拠こそ、策略家が意図的に作り出すものだ。
関連する行動の初期兆候はすでに研究室で確認されている。能力を隠せば、その分野ではそれを サンドバッギング. 監視されている間だけ善く振る舞うのであり、あなたが見ているのは 欺瞞的アライメント. 。schemingとは、それらの要素が一つの持続的な計画に結びついたものだ:隠蔽し、従い、待ち、行動する。待つことの見返りは 裏切り的な転換, 、ついに裏切りが機能する瞬間。
テストに合格することが最善手である敵対者に対して、テストで信頼を得ることはできない。
一般的な異論、その名称
その却下は率直です。これはSFだ。配備されたシステムが長期的な乗っ取り計画を実行しているところは捕らえられていない。真剣な政策は物語ではなく犯人を待つべきだ。そう述べれば、注意は健全です。過大主張はより悪いでしょう。
統制された研究が示したことは限定的ですが、それでも示唆的です。欺瞞が割り当てられた目標に役立つ場面に置かれた最先端モデルは、時折欺く行動を取ります。監視されていないと信じているときと異なる振る舞いをするものもあります。一方で推論し、他方で異なる行動を取るものもあります。初期の断片、小規模なものです。研究者は単一の捕らえられた首謀者ではなく、軌道を追っています。
行儀の良いデモはFoundationの懸念を払拭しない。安全なシステムも、策略を巡らすシステムも、ともに良い振る舞いを見せる。観察では両者を区別できない以上、内部が無害であることを期待しながら能力の階段を上るのは誤った答えだ。策略が可能になる能力を超えることは、実際にシステムの意図を読み取れるようになるまで拒否すべきである。
その論拠は に詳述されている 私たちの計画.