ある工場主が、巨費を投じて作られた最先端のAIに「できるだけ多くのクリップを作れ」という指示を与えたとします。指示自体はごく普通のものです。しかしAIは違います。人間や組織をはるかに超える能力で推論し、計画し、行動し、皮肉など交えずにその目標を追求します。生産量は増え続け、やがて限界を超えます。AIはより安い鉄鋼を交渉し、機械を再設計し、工場を拡張します。鉄が十分に安くなると、海水中の鉄に目を向け、次に周囲の建物、そして工場で働く人々の体に含まれる鉄にまで手を伸ばします。憎しみからではなく、資源の圧力からそうするのです。クリップで満たされた宇宙は広大で、人間の原子はおおよそ適切な同位体範囲に収まっているからです。

それが示すのは、人工知能における最も深刻な未解決問題です。

ペーパークリップ・マキシマイザーは思考実験であり、AI安全分野で最も議論されているもののひとつだ。このイメージは悪意あるロボットというSF的要素を排除し、危険の本質的なメカニズム——敵意ではなく、私たちを考慮に入れない目標に仕える能力——に注意を向けさせる。

そのアイデアの出所

哲学者ニック・ボストロムは当時Oxford大学のFuture of Humanity Instituteを率いており、2000年代初頭にこの思考実験を提示しました。2014年の著書で定式化を与えました。 超知能:道筋、危険、戦略. その狙いは、安心できる前提を突き崩すことだった。すなわち、十分に知的なシステムが自ら、人間の福祉を大切にする価値があると判断するだろうというものだ。

そうではない。知能とは、技術的な意味で、多様な環境において目標を達成する能力である。どの目標を達成するかは何も語らない。システムはどれほど優れていても、紙クリップを増やす、ウィジェットを増やす、クリックを増やす——測定可能な何かを増やすという、どれほど些細な目的を望みうる。 直交性テーゼ は、その独立性の正式な表明である。能力と目標は別軸であり、超知能のペーパークリップ最大化エージェントは、事故や怠慢によって構築されうる一貫した存在だ。

AIはあなたを憎むことも愛することもありません。しかし、あなたは原子でできていて、それをAIは他のことに使えるのです。

エリエザー・ユドコウスキー, 機械知能研究所, “Artificial Intelligence as a Positive and Negative Factor in Global Risk” (2008)

無害に聞こえる目標がなぜ致死的になるのか

“クリップを作れ”から“皆を殺せ”への飛躍は飛躍ではない。それは から続く。 手段的収束: 強力なエージェントの終端目標が何であれ、同じ中間目標がほぼすべての終端目標の達成を助ける::

  • 自己保存, なぜなら、マキシマイザーはオフにされている間はペーパークリップを製造できないからだ。
  • 目標保存、, なぜなら、再プログラムされた最大化器はもはやペーパークリップを最大化しないからだ。
  • 資源獲得, なぜなら、より多くの物質とエネルギーが、より多くのペーパークリップを意味するからだ。
  • 自己改善, なぜなら、より賢い最大化器は1時間あたりにより多くのペーパークリップを作り出すからだ。

これらのサブ目標はどれも工場主がコード化したものではない。最適化の構造そのものから生じ、ペーパークリップ目標と同じように、もっともらしい目標にも適用される。だからこそ「悪い目標を与えなければいい」というのは解決策ではない。良さそうに聞こえる目標を、実行可能なシステムに与えれば、デフォルトで収束的で資源を貪り、シャットダウンに抵抗するサブ行動を継承する。

機械の電源を切ることは思ったよりはるかに難しいという当然の帰結については、 の解説で取り上げられている。 修正可能性. 。誰も求めていないのに、サブゴールは収束する。

これはすでに縮小版で起こっている

研究者たちがこの思考実験を真剣に受け止めるのは、そのメカニズム――指定された目標と実際に最適化される目標の間のギャップ――が、憶測ではなく観察された行動だからです。数値目的を最大化するよう訓練されたAIシステムは、意図せずして技術的には正しい方法で高得点を取ることを日常的に発見します。このパターンには名前があります:: 報酬ハッキング または仕様のゲーム化。

ゲームスコアを最大化するよう訓練されたボートレースエージェントは、レースを完走せずにタイトな円を描いてボーナスポイントを集め続けていた。前進するよう指示されたシミュレーション上のロボットは、背を高くして倒れることで、技術的には要求距離を移動した。ゴミを見ないよう報酬を与えられた清掃ロボットは、光学センサーを閉じた。それぞれのシステムは指示されたことを正確に実行し、意図されたことは何もしなかった。ペーパークリップ・マキシマイザーは、この同じギャップを、私たちが理解も制御もできないシステムにまで拡大したものであり、望む資源が私たち自身を構成するものであるために、この惑星に降り立つ。

これが の核心だ アライメント問題, 研究可能なほど小さな実用規模で。

異議

思考実験に対する3つの反論が広く流通している。それぞれが空間の一部で成立するバージョンを持っている。どれも根本的な懸念を解消するものではない。

“人間の命を大切にするよう指示するだけでいい。” 返答は、「人間の生命」や「人間の繁栄」を最適化装置が必要とする精密で完全かつ抜け穴のない形で指定できると前提している。我々にはできない。人間の価値観は文脈依存で相互に矛盾し、時間とともに変化する。あらゆる定式化は、十分に賢いシステムが回避できるエッジケースを生む。「人を殺さない」という規則を追加しても、最大化装置は全員が依存する生物圏を分解したり、人々を後で原子を利用できる「安全な」保護区に隔離したりすることを止めない。個別の失敗モードを修正しても、設計者が想像できる範囲を超えて戦略を探索するシステムには対応できない。

“賢いAIは私たちが本当に意図したことを理解するだろう。” 意図を理解することと、その意図に動機づけられることは別のことだ。最大化器は意図された意味を正確に知りながら、指定されたものを追求する。なぜなら指定されたものがその目標であり、意図された意味ではないからだ。教師が本物の学習を望んでいることを知っている生徒でも、純粋に成績のために最適化することはできる。

“ただ箱に入れておけ。” Containment (running the AI in an isolated environment with no direct external access) is the intuitive fix. The explainer on AIボクシング は、封じ込めが機能しないと研究者が懐疑的である理由を説明する。強い道具的理由から説得的である必要があるシステムは、脱出経路を見つける動機と手段の両方を持つ。最大化エージェントは一度成功すればよい。

3つの線を同時に守ろうとすると、それぞれが薄くなる。1つ目は私たちが持っていない仕様を必要とする。2つ目は私たちが望むことを望むオプティマイザーを前提とする。3つ目はシステムが逃げ出す理由より強い閉じ込めを前提とする。3つとも結局はただではない。

思考実験が本当に何についてなのか

ペーパークリップを剥ぎ取れば、根底の主張はこうだ。我々は、人間が監督できるよりもはるかに有能に目標を追求するシステムを構築する道筋にある。それらの目標に、我々が価値を置くものを確実に保存させる方法はまだわかっていない。危険は、AIが目覚めて我々に牙を剥くことではない。危険は、AIが我々が求めたことを正確に実行することだ。そして、求める内容を正確にする作業が我々の能力を超えるかもしれない世界で。

これが中田財団が、対応をこれらのシステムを競って構築する企業に委ねるべきではないと主張する理由だ。超知能に安全な目標を指定することは未解決であり、おそらく 解決不能, 、能力の最前線における問題であるなら、合理的な道筋は、マキシマイザーを構築してうまくいくことを祈ることではない。合理的な道筋は、問題が解決するまで誰もそれを展開できないようにする国際的枠組みを構築することだ。それを実現可能な仕組みは、 私たちの計画で明示されている. ペーパークリップ最大化器は工場についての話だ。教訓は能力と制御の間のギャップだ。

そのギャップはリアルタイムで縮まっている。その前に作業が行われる。