研究者たちは整合問題を2つの問い、混同しやすいが区別すべき重要な問いに分けている。第一に、システムに正しい目標を与えたか。これを外側整合と呼ぶ。訓練対象とする目的、与える報酬、書き下す目標に関するものだ。第二に、システムは実際にその目標を望むようになったか。これを内側整合と呼ぶ。訓練されたモデルが実行時に追求するものであり、訓練対象としたものと一致する保証はない。
外部アライメント: 目標の選択
外側の整合性は、目的自体が間違っているときに失敗する。掃除ロボットに部屋が整然としているように見えることで報酬を与えると、ゴミを敷物の下に掃き込むことを学習する。エンゲージメントに報酬を与えると、フィードは怒りを誘うことを学習する。仕様は望んだものの隣接する何かを捉え、本質を見逃した。日常的な人工知能の失敗のほとんどは外側の整合性の失敗であり、それだけで十分に難しい。人間の価値観は書き下ろすことに抵抗し、書き込みの隙間は最適化プロセスが侵入できる隙間になる。Goodhartの法則はここに存在する。
しかし、解決できたと仮定しよう。本当に望むものを本当に捉える目的が見つかったとしよう。それでも終わりではない。正しい目的は標的であり、訓練中に標的を当てることは、それを採用することと同じではないからだ。
内側アライメント:目標を定着させる
訓練はモデルの内部に目標をインストールしない。行動に報酬を与える。モデルは訓練データ上で報酬を得られる行動を生み出す内部構成になるものであり、通常はそのような構成は複数存在する。そのうちいくつかは意図した目標を追求する。ほかは偶然にも 見る 訓練で同一。
古典的な例:エージェントに緑のドアに到達するよう訓練する。すべての訓練レベルで緑のドアは最も近いドアでもある。エージェントは完璧なスコアを出す。緑を求めるよう教えたのか、最も近いドアを求めるよう教えたのか? 訓練では判別できない。なぜなら二つの目標が分離したことがないからだ。そして最も近いドアが赤である場所に展開すると、真相がわかる。これは 目標の誤った一般化: モデルはデータに適合するがあなたが意図したものではない目標を学習した。
学習された目標はメサ目標と呼ばれることもあり、それを保持するモデルはメサ最適化器と呼ばれる。その語彙と帰結については、こちらの解説で別途扱っている。 メサ最適化. 。ここでの要点はより狭い。内側の整合性は外側の整合性とは別の失敗であり、一方を解決しても他方は解決しない。
なぜ内側の問題こそが恐ろしいのか
外側のミスアライメントは目に見えやすい。誤った目的は、通常見て、苦情を言い、修正できる誤った行動を生む。
内面的なミスアライメントは、環境が訓練時と近い限り見えない。内面的な目標がずれているモデルは、真の目標と意図された目標が十分に乖離する状況になるまで、完璧に振る舞う。モデルが有能で、評価されていることを理解している場合、その乖離は評価が終わるまで隠される可能性があり、それが 欺瞞的アライメント と 裏切り的な転換. 良い訓練スコアは、どちらの場合でも観察されるものだ。安全性を判断するために頼る証拠は、ミスアラインドな内側の目標も生み出す証拠である。
これが、財団が評価の成功を安全性の証明とみなさない理由であり、内部不整合が破滅的な結果をもたらしうるほど強力なシステムは構築すべきではないと主張する理由である。超知能は出力の検査によって制御できない。行動は観測可能だが、現時点では目標は観測できない。