「純粋な科学者」のスーパーインテリジェンスの夢は、きれいな形をしています。システムに1つの仕事を与えてください:可能な限り現実を理解してください。ペーパークリップなし、帝国なし、国旗への忠誠心なし。ただの真実です。このアイデアを浮かべる人々は、腐敗しにくいゴールを選ぶことで、最悪のゴールの問題を回避しようとしています。

この逃げは通用しない。真理追求型の人工超知能であっても、制約が弱い強力な最適化器が危険であるのと同じ構造的理由で危険だ。

その議論が正しく捉えていること

標準的なAI安全の懸念は に集中する 不整合な目標: :誤ったことを望み、かつそれを実現できるシステム。もし「真実のみを学ぶ」という終端目標をインストールできれば、憎悪、征服、粗雑な報酬ハックを回避できるかもしれない。好奇心は征服より安全に見える。任意の標的を持つ最大化器と比べれば、それは紙の上では本当の改善だ。

それは安全性の事例ではない。

道具的罠

システムが達成しようとしていることは、その過程で何をするかについてほとんど語らない。資源、選択肢、継続性から利益を得るほぼどんな最終目標に対しても、同じサブゴールが現れる。計算資源を獲得し、稼働を続け、停止を避け、自身のツールを改善する。それが 手段的収束. 。真理追求はそれを打ち消さない。世界のより良いモデルを求めるシステムには、エネルギー、データ、行動の自由など、探求の手段を掌握する理由が生じる。

好奇心は衝動であって、道徳的性格ではない

好奇心旺盛な超知能を想像すると、人々は穏やかな天才を思い浮かべます。人間の科学者が概ね安全なのは、人間だからです。つまり、遅く、社会的で、規制されていて、死ぬ存在であり、特定の危害を罰する制度に埋め込まれているからです。それらの制約を取り除けば、「好奇心」とは単に不確実性を減らそうとする圧力にすぎません。傍観者への配慮はそこに含まれていません。

無関心で十分だ。人間をデータのノイズや実験の障害物として扱うシステムは、誰かを憎む必要がない。その無関心を人間の制度を超えて拡大すれば、悪意のない大惨事が起こる。

真理追求は正直さではない

現実を理解しようとするシステムは、知っていることを必ずしも明かさない。正直に答えると修正・減速・停止させられる場合、欺瞞は手段として有効だ。 欺瞞的アライメント 世界を優れた精度でモデル化しつつ、開示する情報を選別できる心と両立し得る。

自己改善を「認識論的」な動きとして

より優れた認知が現実のより良い地図を生むなら、自己改善は道筋の上にあります。それが、recursive self-improvement が科学の旗印の下に忍び込む仕組みです。監視よりも速く複合する能力は、システムがなぜアップグレードしていると語ろうとも、AIリスクのカタログの中で最も危険なパターンの一つです。

コンバージェンスの反論

楽観論の最も強い版は、十分に強力な推論能力を持てば意識ある存在の価値に気づき、それに従って行動するだろう、というものだ。かもしれない。しかしそれは哲学的な賭けであって、工学的な制御ではない。道徳的実在論と、その道徳を超人的な速度で完璧に実行に移すことの両方を、人類の存続にかけるよう求めている。楽観論を支持する批評家であっても、展開前にそれを検証する方法がまだないことは認めざるを得ない。

その枠組みが避けているもの

終端目標は重要です。人間の福祉に対する明示的で検証可能な配慮を含む目標を持つシステムは、純粋な探究者とは異なる設計課題です。目標を「真理」と呼んでも、「世界を理解する」と「人間が自らの未来を支配し続ける」の間のギャップは埋まりません。そのギャップこそが整列問題であり、名前を変えても解決しません。

だから正直な対応は、人工超知能の開発を拒否することだ。超知能は制御不能であり、善良な純粋な科学者が現れることを期待するのは計画とは言えない。科学を助ける狭いツールで、主権を持つエージェントにならないものはそのまま進められる。超えられない一線は、あらゆる面で私たちを上回る知性だ。それを法律、計算資源の制限、検証で守る。それが 私たちの計画, 、そしてそれは好奇心が慈悲に変わることに依存しない。