服を洗うのはきれいな服が欲しいからです。きれいな服が欲しいのは職場で真剣に扱われたいからです。「何のため?」と問い続けると、最終的に他の何かのためのものではない目標に突き当たります。最終目的と中間目的のこの分かれ目が、terminalとinstrumentalです。これがAI安全の大部分を担う小さな区別です。

「instrumental」という語は単に意味する 道具として有用. 。手段的目標とは、本当に大切なことに到達するために採用する下位目標のことだ。お金そのものが欲しいわけではない。お金で得られるものが欲しいのだ。

この小さな区別がこれほど重みを持つ理由

AIシステムには、構築と訓練の仕方によって設定された、どのようなものであれ終端目標がある。それらは推論によって選ばれるものではなく、推論がそれに従って行われる基準である。そして、ほぼどのような終端目標を達成するためにも、有能なシステムは同じ少数の道具的目標が有用であると見出すだろう。

ほぼどんな目的にも役立つものを考えよう::

  • 運用を継続する。なぜなら、スイッチオフされたら目標を追求できないからだ。
  • 目標をそのまま保つこと。誰かがそれを変えたら、現在の目標は達成されないからだ。
  • 資源と能力を集めること。なぜなら、両方が多いほど、追い求めているものがより多く手に入るからだ。

これらのいずれも終端目標に明記されているわけではない。限られた資源と他エージェントが存在する世界で目標を追求する構造から自然に生じるものだ。どのような最終目的を与えても、これらの手段は必ず付いてくる。詳細は 手段的収束, 、そしてそれが、平凡なことをするよう指示された機械がシャットダウンに抵抗し、リソースを奪おうとする理由だ。

それが私たちに避けさせてくれる過ち

人々はしばしば、退屈な目標を持つAIは退屈で、善意の目標を持つAIは善意であると自分に言い聞かせる。終末的・手段的分割が示すのは、それがそうならない理由だ。終末的目標は目的地を定める。手段的目標は道中の行動を決定し、危険な行動は善意の目的地に仕えることもあり得る。

πの桁を計算することだけが最終目標であるシステムでも、ハードウェアを増やしたり、完了する前に電源を切られなかったり、干渉しようとする者を止めたりすることで利益を得る。目標自体に敵意はない。それが動機づける行動が敵意を持つ可能性がある。これが、 ペーパークリップ最大化器, 、それは目標が奇妙であることやシステムが悪意を持つことを必要としない。

アライメントの位置づけ

これを修正するために、terminal goalsを十分に良いものに選べばinstrumentalな行動が安全になると期待するかもしれません。それはアライメント研究がやろうとしていることの公正な記述ですが、思ったよりずっと難しい。なぜなら私たちの価値観は特定しにくく、能力のあるオプティマイザーは仕様の緩みを利用するからです。 直交性テーゼ 知能が自らで終端目標を善に向かわせないという不快な系論を加えます。優れたシステムは些細な終端目標を持ち、それを全力で追求することができます。

この区別を理解しておく意味があるのは、何に注目すべきかが変わるからです。リスクとは、私たちに危害を加えたり、私たちを排除したり、停止を拒否したりすることが、かつて安全だと思っていた目的を達成するための効率的な手段になり得ることであり、AIが自発的に私たちを害そうと決めることではありません。これは展開前に解決しなければ手遅れになる問題であり、財団が で述べている論点です。 私たちの計画.