AI安全問題を初めて聞いた人々の最も一般的な反論は、おおむね次のようなものだ。十分に賢いシステムは人間の福祉が重要であることを理解せざるを得ない。自らが依存する種を脅かすことを自発的に決定することはない。より賢いことは無謀であることと両立しない。この主張は常識のように感じられる。しかしそれは特定かつ限定された点で誤りであり、その誤り方が現在「直交性テーゼ」と呼ばれるものである。

その主張が直交性テーゼであり、その逆を前提に行動することは、能力向上に伴って私たちが犯しうる最も高くつく過ちの一つだ.

論文が述べること

The orthogonality thesis was given its canonical statement by philosopher ニック・ボストロム at Oxford's Future of Humanity Institute, building on related work by Stuart Armstrong. The canonical version sits in Bostrom's 2014 book 超知能:道筋、危険、戦略. 。端的に述べればこうだ。知能と最終目標は直交する。ほぼどんなレベルの知能も、ほぼどんな最終目標と結びつきうる。

ここで言う直交とは、技術的な数学用語です。二つの次元は互いを制約しません。気体の圧力と温度は直交しています。任意の圧力が任意の温度と組み合わせられます。同様に、この見方では、システムの能力とそれが達成しようとする目標の間にも独立性があります。がんを治すのに十分なほど優れたシステムが、その優位性ゆえにがん治療に向かうわけではありません。観測可能な宇宙におけるクリップの配置を最大化するよう向けられている可能性もあります。優位性はどちらの目標達成能力も高めます。このテーゼは、どちらの目標を選ぶかについては何も語りません。

範囲に注意。テーゼは論理的可能性に関する主張であり、蓋然性に関するものではない。知能は目標選択に制約を課さない。テーゼは特定のAIが特定の目標を追求すると予測するものではない。あるシステムが実際に人類に利益をもたらす目標を追求するかどうかは、指定された内容、訓練された内容、保持された内容、統治された内容によって決まる別問題だ。

なぜ拒絶が直観的に感じられるのか

論文が拒否している直感は、人間の経験から来ています。倫理についてより慎重に推論する人々は、時間が経つにつれて、ほとんどの成人が擁護するであろう立場を取る傾向があります。他の視点への曝露は、道徳的関心の輪を広げる傾向がある。知性が省察を促進し、省察が道徳的改善を促進する場合、より知的なエージェントは、この見解では、より良い価値観に収束する必要があります。このパターンは人間に特有のものです。

人間の場合、知能と価値観は別々に到着して結合したわけではありません。一緒に進化しました。人間が公正さについて推論できる認知装置は、公正さが彼らにとって重要であることを可能にする社会的・感情的装置と同じ頭の中にあります。より思慮深い人間は、より社会的に埋め込まれた人間でもあります。どちらかを除去すれば装置は損なわれます。AIは異なります。AIシステムは損失関数を最小化したり報酬を最大化したりするよう訓練されたオプティマイザーです。その目的は訓練パイプラインから来ます。その一般的能力も同じパイプラインから来ます。両者は共培養されたのではなく、割り当てられたのです。オプティマイザーを改善しても、人間の道徳的感受性は接ぎ木されません。

答えなければならない3つの異論

この論文に対する3つの批判は、AIの安全性研究の外にも広がっている。

非合理性の異議。 本当に賢いシステムは、一部の目標が非整合的であることを認識し、それらを捨てるだろう。「クリップを最大化せよ」は、この見方では正気の目標ではない。なぜなら、反省すればその不条理が明らかになるからだ。合理性は能力以上のものだ。それはまた制約を課し、物理学が perpetual motion を排除するように、些細な目標を排除する。

返答:制約は実在するが、思われるほど広いものではない。整合性は論理的に矛盾した目標を排除する。整合性は、整合的で一貫性があり、惑星規模で達成可能な目標を排除しない。「宇宙の物質をペーパークリップ状に配置する比率を最大化する」という目標は整合的であり、十分に能力の高い最適化器ならば原理的に達成可能である。合理性はそれを排除しない。非合理性という反論はぶつかった最初の壁で止まる。テーゼはそこで止まらない。

道徳実在論の反論。 十分に有能な推論者は、正しい道徳的真理に、正しい数学に収束するのと同じように収束するだろう。道徳的実在論が正しければ、超知能に反省と時間を加えれば善い価値が生まれる。このテーゼは間違っている。なぜなら反省には到達点があるからだ。

回答は2点に分かれます。第一に、道徳的実在論は哲学で争われており、この議論は種の安全をその問いが特定の方向に解決されることに賭けています。第二に、たとえ道徳的実在論が正しいとしても、AIシステムを訓練しても、そのシステムが推論によって真理に到達するとは限りません。システムは慎重な道徳的推論のスタイルを模倣しつつ、別のものを最適化する可能性があります。慎重な推論者のように聞こえることと実際にそうであることのギャップこそが、 欺瞞的アライメント problem, and it does not close just because the topic is morality.

「訓練吸収異論。」. 今日の大規模言語モデルは、何十億もの人間の道徳的推論の記録で訓練されています。それらは倫理的問題を一見配慮深く扱う出力を生成します。もしシステムが露出によって良い価値観を吸収できるなら、直交性テーゼはアライメントの容易さを過小評価しているのかもしれません。

返答は二つの層を分けておくことだ。人間の道徳的文章で訓練されたシステムは、道徳的に配慮された出力を作り出すことを学習する。基盤となる最適化が、その文章が風刺したり擁護したりする道徳的目標と同じものを目指しているかどうかは別の問題であり、それがアライメント研究が問うている問いである。流暢で倫理的に聞こえる出力は、倫理めいた散文を報酬とするどんな基盤目的とも両立する。このテーゼは、二層目が一層目によって保証されないという警告である。

三つの反論はいずれも部分的には説得力があります。しかしどれも本論を解体するものではありません。本論は、価値観を明示し、それが追求されることを保証し、それを追求するシステムを統治することを、必要不可欠な前提として求めています。

この論が強いること

代替案を実行すれば作業は簡単だ。より高性能なAIを構築し、システムに価値観を任せて出荷する。だが本稿の主張はこの戦略を排除する。代わりに必要な作業は、より困難で、遅く、一部は未解決のままだ。意図的にアライメントを組み込み、負荷をかけてテストし、それが意図したアライメントであることを検証する。どのシステムを最先端能力で展開可能とし、誰が検証し、何を検証とみなすかを統治する。アライメント問題を「スケールすればなんとかなる推測」ではなく、本物の工学問題として扱う。

このことから3つのガバナンス上の帰結が生じる。

第一に、より能力の高いシステムへの速度は、この見方では安全への貢献ではありません。テーゼはこう言います。より能力の高いシステムは、指定された目標をより高い能力で追求できます。目標が間違っていれば、結果はより高い忠実度で間違います。能力の構築と整合性の検証は二つの別々の工学プログラムであり、一方が先行するのではなく、ともに進まなければなりません。

第二に、目標を指定する者が、どの価値観を組み込むかを決める。迅速な展開を迫る商業的圧力下にある研究所は、長期的な視野を持つ規制当局とは立場が異なる。監督の弱い管轄区域にある研究所は、そこから出荷されるシステムに、既定値で自らの価値観を押し付ける。公平性を主張してもそれは変わらない。最先端AIに組み込まれる価値観は、外部の正当な当事者による検証がない限り、訓練実行に資金を提供した者の価値観である。

第三に、この問題は私的良心による修正を認めない。自分のシステムが整列していると誠実に信じる研究室は、テーゼによればそれを他者に証明できない。唯一可能な証明は、システムの内部目標表現を直接読み取る解釈可能性研究である。フロンティアシステムに対して真にそれを実行できる能力が備わるまで、世界は研究室の言葉を信じるほかない。その言葉は誠実である。しかしその立場は持続不可能である。

この意味で、テーゼは、Foundationの である理由である 計画 は、フロンティアへ向かうレースを繰り広げるラボによる自己評価ではなく、拘束力のある国際ガバナンスと検証済みの展開前評価を主張する。それがまた、整合性について最も自信たっぷりに語るラボこそ、懐疑的に聞く価値がある理由でもある。

この世界観では、賢くなることは安全になることを意味しません。賢くなることは、システムに組み込まれた目標を、システムがその目標を維持できる限り追求する、より有能な存在になることを意味します。必要な作業は、正しい目標をそこに据え、システムが静かに目標をすり替えないようにすることです。