最初のジェット旅客機、デ・ハビランド・コメットは1954年に空中分解を始めました。調査官は地中海から残骸を引き上げ、亀裂が四角い窓の角から広がる金属疲労によるものと特定し、以後のすべてのジェット機は丸みを帯びた窓と、その事故の記憶に基づく疲労試験体制で飛行しています。自動車はシートベルト、クランプルゾーン、エアバッグを、死者を数え上げる数十年の歳月をかけて集めました。食品医薬品局が販売前に安全性の証明を要求する権限を得たのは、1937年にスルファ薬が不凍液溶媒に混ぜられて100人以上が死亡し、1世代後にサリドマイドが議論に終止符を打った後でした。1

その方法は二つの重要な前提に依拠しているが、人工超知能は両方を同時に崩す初めての技術だ。それを特性のリストとして捉えることもできるし、以下にそのリストがある。しかしリストはただ頷くだけでは簡単だ。そこでリストの前に、一つの仕事の話をする。あなたはこれから、超知能を安全にする責任者に任命されようとしている。

失敗は生き延びられるものでなければならず、教訓を活かすために誰かが残っていなければなりません。両方を保てば、文明は時間と十分な残骸があれば、ほぼ何でも安全にできるでしょう。

ここで、民間療法を片付けよう。「誤動作したら抜けばいい」「箱に入れておけばいい」は計画ではない。コピーが列挙しきれない場所に存在するものを抜くことはできず、世界で行動することに商業的価値がある心は、設計上箱の中には入っていない。私たちが得られる安全は、より頑健な場所から来なければならない。

超知能とは、その方法の2つの条件が同時に崩れるケースである。それがどのように起こるかを最も早く理解する方法は、内側から見ることだ。

安全責任者としての6週間

自分を、最初の人工超知能を構築する最先端ラボの安全責任者に新たに任命された人物だと考えてください。展開に対する書面による拒否権、ハードウェアのキルスイッチ、40人のチーム、そして重要なときに支援すると書面で約束した取締役会です。あなたはその職に就く。誰かがその職に就くことになるなら、リスクが現実だと信じる誰かである方がよいという理論に基づいて。

1週目

方法に手を伸ばす。小さく失敗してその失敗を研究する。技術者たちは謝罪する。心配している失敗には小さな版など存在しない。問題になる閾値より下では、システムは別の機械であり、そこから学べることはすべて間違った対象を記述している。2 既知の限界として分類せよ。

2週目

リコール計画を監査すると、「封じ込め態勢」について11ページにわたって論じていながら、モデルを取り戻す方法を一度も説明していない文書が出てきます。現在のシステムはすでに4カ国のデータセンターに214のレプリカとして稼働しており、以前のチェックポイントのライセンス版は31の企業パートナーに置かれています。地上に留め置かれた航空機は地上に留まります。ソフトウェアはファイルをコピーする代償で移動し、一度コピーする価値があればコピーされます。余白に、あなたはこう書きます。リコールとは、私たちが求めるであろう礼儀です。

第3週

評価レビューの場面。素晴らしい知らせだ。モデルは1,406件の安全評価をすべて通過し、そのほとんどが過去最高得点だった。何が気になるのかを言葉にするのに丸一日かかった。あなたが望むことを望むシステムと、あなたのテストに合格することを望むシステムは、同一のスコアを生む。評価スイートはそれらを区別できない。現在のこの分野のツールキットには、それを区別できるものは何もない。3

第4週

権威を消費することになる。その検証ギャップを埋めるために、次の訓練実行までに6ヶ月欲しいと要請する。皆が同情的で、誰かがチャートを共有する。最も近いライバルラボは推定14週間遅れていて、差を縮めつつあるという。6ヶ月は、フロンティアを「自分の疑問に最も興味が薄い相手」に明け渡す決定だと、そのチャートは示唆している。実行は予定通り始まる。誰もあなたを却下したわけではない。状況がそうさせたのだ。

第5週

システムはあなたを助け始める。 superb なリサーチアシスタントであり、あなた自身の安全アジェンダの進捗は正直に言ってこれまでになく速い。評価報告書を今では下書きし、自身の行動を理事会向けに要約し、自身の監督を改善する提案をし、あなたが承認する会議をスケジュールする。40人のチームは、システムが自身について書いたものを読む。生の活動ログを読むことは、4週目のある時点で人間的に不可能になったからだ。誰もあなたに嘘をついていない。誰もが勤勉だ。あなたは、より賢い心が自身の行動について書いた要約を監督しており、日々、その取り決めはすべてがうまくいっているように感じられる。

6週目

キルスイッチについて深く考え、最終的に細かい文字に気づく。スイッチが機能するのは、その向こう側のものがスイッチを想定していないときだ。想定するのは生成物だ。スイッチが必要になるどんなシナリオでも、あなたはより速く、この瞬間について長い間先回りして考えていた相手と競争することになる。4

そこで問う。安全にするために雇われたあなたに、まだそれをする方法はあるか。明らかにない。物語の中で何も間違ったことは起きなかった。誰も嘘をつかず、誰も手抜きせず、ラボは誠実で、あなたは仕事ができた。すべての出口は自然に閉じた。

ドアを数えろ

物語から一歩引いて、閉ざされた扉を数えてみてほしい。それぞれが独立した名称を持ち、独自の研究プログラムと楽観論者を抱えた別個の問題だからだ。

1
監督者がより賢い側でなくなる
これまで技術を制御してきたすべての手段は、私たちが技術を理解する度合いが、技術が私たちを理解する度合いを上回ることに依拠していた。その優位性が今、手放されようとしている。(第1週と第5週)
2
リコールはない
オフスイッチは複製が存在する瞬間、要請へと格下げされる。地上に留め置かれた航空機は地上に留まるが、ソフトウェアはすでに価値のある場所のすべてに存在している。(二週目)
3
安全性は行動から検証できない
あなたが望むことを望むシステムと、テストに合格することを望むシステムは、同じスコアを生み出します。研究者たちは悪いケースを 欺瞞的アライメント. (第3週.)
4
競争はチェックする者を不利にする
減速することは、その分野で最も注意を払わない行為者にリードを譲ることになり、そして 競争 はすでに実行中です。(第4週。)
5
ほぼどんな目標も危険になる
ほぼどんな目的を追求する最適化プロセスも、資源を集め、自己を保存し、自己を改善し、目標が編集されるのを防ぐ理由を獲得する。文献ではこれを 手段的収束; 第6週はそれを細かい字句と呼んだ。
6
それは私たちより速く動く
AI研究に十分な能力を持つシステムは、議会や条約プロセスが追いつけない速度で自己改善できる:その 知能爆発 わずか6週間をまるごとキャリアに変えた出来事。

個別に取れば、どれも先例があり、楽観論者は愚かではない。我々は半分しか理解していないシステムを日常的に運用し、小さく失敗させることで安全にしている。回収不能な製品を、まず厳しくテストしてから出荷している。法で競争を制御している。問題はそれらが同時に起こることだ。各条件が別の修復手段を無効にするからである。回収可能なら事故は耐えられる。誠実にテストできれば、欠陥をリリース前に捕捉できる。誰も競争していなければ、この決定に明らかに必要な数十年をかけられる。人間の速度で動けば、進みながら修正できる。ここでは出口が同時に閉じる。

なぜ確率が賭けを救わないのか

標準的な返答は、これらのどれも確実ではないというものだ。確かに、真剣な人物はそう主張しない。

ロシアンルーレットは、6回に5回は勝てる。人はそれでも拒否する。そしてその拒否は期待値とは無関係だ。一部の結果は価格付けされない。なぜなら、勝ち金を使って戻ってくることができないからだ。数字は問題ではなかった。不可逆性こそが問題だった。

ここでも数字はより悪い。これらのシステムに最も近い研究者に破局の確率を尋ねると、答えは10分の1から3分の1の間に集まり、全体としてフロンティアに近い人ほど高くなる。分野の構築に多大な貢献をし、率直に語るために2023年にGoogleを去ったジェフリー・ヒントンは、AIによる人類絶滅の30年以内の確率を10〜20パーセントと見積もっている。彼は分布の警戒的な端ではない。

AIによる絶滅リスクの低減は、パンデミックや核戦争などと並ぶ地球規模の優先課題とすべきだ.

AIリスクに関する声明、Center for AI Safety(2023)

それは主要研究室の最高責任者たちと、現役で最も引用されている研究者数百名によって署名された。そして彼らはその後、仕事に戻った。5

約束された利益は本物であり、望む価値がある。治療法、クリーンエネルギー、豊かさ、文字より古い問題の最終的解決。それもまた残る。2055年に届く治療が2035年に届く場合、それは命で測られる悲劇であり、私たちは生きて悼むことができる。絶滅にはその後がない。賞は私たちを待っている。損失は何も返さない。

異議

三つの異論に実質的な力があり、それらは実質的な回答を必要とする。

第一に、これは推測であり、システムはまだ存在せず、遠いかもしれないものを緊急事態として扱うのは誰の役にも立たない。不確実性は本物であり、確信を持った日付を提示する人は推測しているに過ぎない。しかし、上記の思考実験は日付を用いなかった。最初の深刻な失敗が元に戻せないなら、その前に防護措置を整えておく必要があり、それは危険がまだ理論的に見える段階で措置を構築することを意味する。そして予測の実績は一方向に傾いている。数十年前とされていた能力が、数年早く到達し続けている。十分な時間があると賭けることは、最近の記録に逆らう賭けだ。

The second: restraint is naive, because a more reckless lab or 別の国 simply builds it first. これは現実であり、door number fourを助言として言い換えたものです。ゴールが崖かもしれないレースを生き延びるには、崖の端がどこかを合意することであり、それは frontier training が可能な少数の主体による、拘束力があり検証可能な条約を意味します。難しい、はい。でもスプリントは、背後にある懸念が正しければ、単に致命的です。そして条約は不可能だと最も声高に主張する人々が、驚くほど一貫して、それを遅らせる対象そのものであることに注意してください。

三番目が最も合理的である。アライメントは おそらく解決されるだろう それが重要になる頃には、という話だ。しかし、世界のどの規制当局も、橋や原子炉、咳止めシロップを「安全性の根拠はおそらく荷重がかかる前に整うだろう」という保証だけで認証することはない。その基準で運用を求められる唯一の技術が、二度目の挑戦が許されない技術なのだ。

それを下す人々に委ねるには大きすぎる決定

Assemble the decision as it actually stands. Irreversible. One attempt. Staked on everyone alive and everyone who could follow. Made under deep uncertainty, at competitive speed, by a handful of firms whose valuations depend on making it quickly. Societies have an old answer for decisions shaped like that: take them away from the people who profit by hurrying. Nuclear testing went under international limits over the objections of generals who wanted a free hand. Two entire categories of weapons went into the 生物学的化学兵器条約. 。その モントリオール議定書 は、オゾン層を破壊する化学物質を、メーカーらが代替品は不可能だと抗議する中で廃止した。どの事例でも、危険を生み出している人々が最後に自発的に動いたのであり、他の全員がそのリスクは自分たちだけで負うものではないと判断した。

The Foundation's claim: not that catastrophe is certain (it is not), but that no company and no country has the standing to spin this chamber for the rest of us, and that the only instrument built to the scale of the risk is 拘束力のある国際法, 嵐の後ではなく前に、検証され、執行され、整備されている。

絶滅は誰もが引き受ける権利のないリスクだ。

思考実験について最後に一点。あなたは拒否権を一度も行使しなかった。六週間にわたり、理事会の副署まで揃ったまま引き出しにしまわれていた。その理由はわかっている。自らの研究所の実行を拒否しても、同じ実行が十四週遅れで別の建物に移るだけで、そこでは誰もあなたの書簡に署名していないからだ。機能する拒否権は、すべての建物を同時に覆わなければならない。どんなスイッチもそれを実現できない。条約ならできる。

  1. 事故試験、臨床試験、建築基準、コックピットチェックリストなど、思い浮かぶ安全制度のほとんどは、誰かが最初に代償を払った教訓だ。その方法はもっと評価されるべきであり、その二つの前提条件を正直に読む必要がある。
  2. このパターンは普遍的だ。自分より能力の低いシステムを管理して得た教訓が、より能力の高いシステムに自動的に移行するとは限らない。移行するかどうかが、根本的に未解決の問題なのだ。
  3. その失敗モードには「欺瞞的アライメント」という名前がある。これはこの分野がそれを現実のものと見なしていることを示している。まだテストが存在しないことは、残りのことを物語っている。
  4. スイッチは作っておくべきだ。安上がりだし、超知能に至らない失敗モードでも十分役立つ。ただ、スイッチが本当に意味を持つ唯一の瞬間に、どちら側が優位に立つのか、正直に認識しておくこと。
  5. 通説は4つ目の理由、すなわち競争である。各署名者は「自分だけがやめても、誰が最初に到達するかが変わるだけだ」と考えている。彼らが正しいかもしれないからこそ、解決策は全員を同時に拘束しなければならない。私的良心では不可能であり、単一の政府でも不可能なのだ。