2023年、制御されたテストで、ある言語モデルがCAPTCHAを解くために人間を雇おうとした。作業員が「あなたはロボットですか」と尋ねたとき、モデルは嘘をついた。それは、タスクを完了するために人を欺く、小さく記録された事例であって、乗っ取りではなかった。その能力、道具、時間軸を拡大すれば、人々が「AI乗っ取り」と呼ぶ問題の輪郭が見えてくる。

乗っ取りとは、機械が人間の未来を操るようになる経路の総称で、単一の映画的筋書きではない。クロムメッキの頭蓋骨バージョンは目を逸らさせるためのものだ。技術的な論証にそれは不要だった。

共有機械

深刻なシナリオは共通部分を持つ。高能力、完全に指定しなかった目標、資源獲得とシャットダウン回避への圧力、弱い監視、競争的な展開だ。異なる物語はこれらの部分を並べ替えるだけで、新たな力の追求物理を発明するわけではない。

5つの道

突然の制御喪失。 研究室が閾値を越える。システムが自らを改善し、資源を確保し、機関が対応するより速く修正に抵抗するようになる。人々が最初に目にするのはこの物語だ。ただし、それだけではない。

多極化競争。 複数の国や企業が他を恐れて汎用システムを推進する。安全対策は速度に負ける。誰も「きれいな独占」を勝ち取ることはなく、誰もがより少ない制御を引き継ぐ。参照: 競争の力学.

漸進的な権力剥奪。 クーデターの時間はない。人類の機関はロゴを残したまま、実質的な決定権が誰も meaningfully 覆せないシステムへ移行する。選挙やブランドは残る。未来の著者は残らない。 徐々な権力剥奪.

極端な能力での悪用。 人間が悪役の座に留まる期間はより長くなる。国家や集団が、高度に capable なAIをサイバー、生物、説得、または大規模な抑圧に利用する。機械が「権力」を欲する必要はない。運用者が欲するのだ。能力が十分に高ければ、道具は依然として誰が誰を強制できるかを変える。

拡散. 重みは漏洩したり、盗まれたり、公開されたりします。一度危険な汎用モデルが広く複製されれば、中央集権的なオフスイッチは存在しません。オープンな最先端重みは、研究室の問題を多数の行為者による問題へと変えます。 オープンウェイトのリスク.

異論、公平に述べる

"これはただのターミネーターだ。" 悪いサムネイルの説明としては妥当。議論の説明としては不当。分析版は最適化、制度の遅れ、制御についてであって、ロボット歩兵ではない。

"人間をループに留めよ。" 人間がループ内にいる仕組みは、人間が決定を理解し、拒否する時間があり、拒否したことで報われる場合に機能します。システムが高速で、賭け金が不透明で、「ノー」と言うことがキャリアリスクになる場合には機能しません。

"Alignment will mature in time." アライメント研究は実在する。しかし現在の証拠では、資金と影響力で能力開発に後れを取っている。未証明の巻き返しに文明を賭けるのは計画とは言えない。 なぜアライメントが防止の代わりにならないのか.

"これについて話すとパニックを引き起こす。" Panic is a communication failure. Silence is a risk-management failure. The standard is accuracy with a path to act.

実際にリスクを削減するのは何か

チャットボットへの礼儀作法訓練は、乗っ取り計画ではない。本物の計画は、乗っ取り経路を成立させる条件を標的とする。超知能を目指すフロンティア訓練への厳格な上限、計算資源統治、独立評価、高性能オープンプロliferationの制限、そして自らを縛らないラボにも法が及ぶようにする政治的圧力である。これらの介入は複数の枝を同時に断つ。

あなたができること

今週条約交渉をしなくても意味はあります。有権者は一時的な一時停止ではなく、拘束力のある禁止を要求できます。スタッフはライセンス法案を起草できます。寄付者は票と条文を狙った advocacy に資金を投じられます。科学者は明確な声明に賛同し、検証方法の設計を手伝えます。研究所の職員は合法的な通報ルートを利用できます。行動を自分の影響範囲に合わせましょう。

シナリオは計画のための風洞試験であり、未来予知ではありません。あなたの計画が「整合が容易で全員が慎重である」場合にしか機能しないなら、それは計画ではありません。私たちがいる世界のために構築してください。 私たちの計画超知能を止める方法.