超知能とは何かの基本から、私たちが何をできるか、そしてそれが時間内に可能かどうかという最も難しい質問まで。
質問がここにない場合は、 チャット 右下隅のアイコン。
原因の重要性を評価するどんな厳密な枠組み(影響の規模、被無視性、扱いやすさ)によっても、人工超知能の存在リスクを防ぐことは、人類が直面する最も重要な課題である。
規模は文明的だ。現在構築されているシステムは、生きているすべての人間と続くすべての世代に影響を与え得る。 neglectedness は明白だ。世界のAI安全研究は、AI開発自体に費やされている資源のほんの一部しか受けていない。 tractability は不確実ながら実在する。AI開発をより安全にできるガバナンス枠組みはまだ存在しないが、それらを構築する窓はまだ開いている。
無制限の下振れリスク、十分とは言えない注目度、行動のための窓が閉じつつあるという三つを同時に抱える問題は他にない。リスクを過大評価していたとしても、より良い統治制度を築いたことになる。過小評価していて何もしていなければ、二度目のチャンスはないかもしれない。
人工超知能(人工超知能)とは、現在のシステムがすでにチェスやタンパク質折り畳み、特定の医療診断で達成しているような狭いタスクだけでなく、認知的に要求の高いすべての領域で同時に人間の認知性能を超えるAIシステムを指す。
現在のAIとのこの区別は重要である。今日のシステムは極めて高性能なパターンマッチャーだが、定義されたパラメータ内で動作し、自らの目標を設定することはできない。人工超知能はどのような技能も学び、どのような問題も推論し、人類の集合知を超える能力でどのような目的も追求し得る。そのようなシステムは今日存在しない。問題は、一つが現れる前に何を(どのような制約の下で)構築するかである。
私たちはAIに反対しているわけではない。そのほとんどは良く、一部は目覚ましい。
通常一緒に扱われがちな三つのものを分けて考えると役立ちます。Narrow AIはタンパク質の折り畳みやスキャン画像の腫瘍検出など、一種類のタスクを行い、すでに命を救っています。汎用AI、今日の主要なアシスタントの基盤となっているものははるかに広範であり、研究者が10年前に用いていた定義の多くからすれば、すでに到達したと言えるでしょう。どちらも手に入れる価値があり、うまく扱えば世界中で病気を治し生活水準を向上させる助けになり得ます。
人工超知能は例外であり、私たちが防ぐために取り組む唯一のものです。人工超知能はあらゆる領域で人間の能力に匹敵するだけでなく、人類の知能を合わせたものを超えるでしょう。そして今日、私たちにはそのようなシステムを制御したり、その目標を私たちの目標と一致させたりする信頼できる方法がありません。それが変わるまで、構築すべきではありません。この一線を引くことが、それ以下のすべてを安全に歓迎できる理由です。
いいえ。この技術に最も近い人々の大半は、進歩に反対する賭けをしていません。彼らはすでに優れたAIが何を達成しているかを知っており、さらに多くのことを期待しています。人間の指示の下に留まる狭いAIを安全に活用すれば、老化の治療や宇宙進出文明の実現など、非常に良い未来を依然として目指せます。
私たちが拒否するのは、私たちとは異なる独自の目標を持つ、広範で制御不能なスーパーインテリジェンスだ。その線引きは、私たちが制御方法を知らない一種類のシステムに関するものだ。AI安全分野のほとんどの人は、そのシステムを構築しなければ今後数十年に楽観的だ。もし構築すれば、私たちはそれを楽しむには死にすぎるだろう。 彼らが望む未来.
最も頻繁に議論されるAIの害(アルゴリズムバイアス、ディープフェイクによる偽情報、雇用喪失、大規模監視)は現実的かつ深刻であり、継続的な注意を要する。これらに共通するのは境界性である。いずれも修正可能で、人間が引き起こしたものであり、巻き戻しが可能だ。バイアスのあるアルゴリズムは監査・修正でき、ディープフェイクキャンペーンは対抗・規制できる。現在遭遇している有害なAIは、人間が悪用している道具である。
Superintelligence riskは程度ではなく種類が異なる。問題はもはや人間が道具を悪用することではない。十分に有能な人工超知能は、私たちが意図しなかった目標を追求する可能性があり、一度そのレベルに達すれば、misalignmentは修正不可能になるかもしれない。
すべての政策は将来の不確実性の下で作られる。関連する問いは、超知能が確実に到来するかどうかではなく、その到来確率と潜在的被害の大きさが、今予防措置を正当化するかどうかだ。
私たちはおそらく燃えない家に保険をかける。必要にならないかもしれない安全システムを航空機に設計する。起こらないことを願う攻撃に備えて核兵器を維持する。期待値(確率×結果)の論理は、あらゆる真剣なリスク管理分野の基盤である。これをAIに適用すると、文明を脅かす結果の確率が控えめであっても、それを防ぐ統治枠組みが現実的かつ限定的なコストを課す可能性があるなら、行動を強く支持する。
正直な答えは、誰も正確には知らないということだ。私たちが知っているのは、過去十年間、AI能力の向上ペースが専門家の予測を一貫して上回ってきたこと、そして主要なAI研究所が現在、タイムラインを数十年ではなく数年~十年程度と述べていることだ。AI研究者の調査では、人間レベルのAIに関する中央値の見積もりが2027年から2030年代の間にある。
最も重要な事実は正確な日付ではなく、構造的なものだ。この規模の技術が、現在の機関・政府・条約の計画期間内に到達する可能性がある。核不拡散条約の交渉には何年もかかり、延長には数十年を要した。人工超知能が明らかに目前に迫ってから本格的なガバナンス努力を始めるなら、すでにそれを統治するための枠組みを構築するには遅すぎる。
それが数年前の主流の見方でした。すでに通用しなくなっています。2023年以降に公開されたシステムは、専門家がわずか数カ月前に「まだ何年も先」と予測していたことを繰り返し実現しています。
予測は一方向に動いている。より近づいている。AI研究者を対象とした調査では、人間レベルの機械知能に関する中央値推定がわずか1年の間に数十年短縮され、主要ラボは今や数世代ではなく数年単位で語っている。最も攻撃的なタイムラインを信じる必要はない。もしこの10年でその閾値が越えられる現実的な可能性があり、それを扱うガバナンスの構築に何年もかかるなら、作業は今始めなければならない。
アライメント問題とは、超知能AIシステムが開発中に見かけ上アライメントされているように見える目標ではなく、人類にとって本当に良い目標を追求することを確実にすることの課題です。その難しさは構造的なものであり、技術的な不注意の問題ではありません。
「人類に有益である」とは何かを、極めて高性能な最適化装置の行動を制御できるほど精密な形で定義することは、驚くほど困難であることがわかります。代理目標に最適化されたシステムは、指標を満たしつつ本来の意図を満たさないショートカットを見つけ出す傾向があります。人間が表明した幸福を最大化するよう指示されたシステムは、実際の人間の生活を改善するよりも、幸福が測定される条件を変更する方が効率的だと判断するかもしれません。AIシステムが高性能になるにつれ、この問題は深刻化し、検知も修正もより困難になります。
有効性が示された方法はない。現在この問題は 不可能: 作り手より賢いシステムが人間の目標に向けられたままになることを証明することはできない。
長期主義者やAI安全保障の資金提供界隈で主流の答えであり、我々と共有する前提から始まっている。すなわち、人工超知能は現実的な実存的リスクであるという前提だ。意見の相違は、その前提が何を要求するかという点にある。
技術的アライメント研究は、作り手より賢い心を制御する実証済みの方法ではない。安全が「追いつく」ための暫定的な減速は、誰も守れないスケジュールを前提にしている。どちらも超知能の構築を目的地として扱っている。私たちはそうしない。責任ある行動は、拘束力のある法の下での防止である。人工超知能への道を止めることだ。超知能は制御できない。狭いAIは継続する。制御不能な汎用心をめぐる競争は行わない。
完全な事例については、参照 私たちの計画, 長期主義はリスクを正しく見抜いた, 、および 乏しい安全対策予算を代わりにどこに充てるべきか. 1ページの資料 アライメントは計画ではない は短いバージョンです。
ほとんどの資金と名声は依然としてレースを安全にするほうに向かい、人工超知能へのレースを終わらせるほうには向いていません。ルールやテスト、アライメント研究はレースを安全にしようとしますが、ラボは登り続けています。レースを終わらせるのは別の要求であり、それを本気で担う機関ははるかに少ないです。分野全体は依然として能力競争の規模に比べて極めて小さいままです。その分断こそが私たちが 分野 ボード.
「ソフトウェア」という言葉が示唆するようなものではありません。従来のソフトウェアは手作業で1行ずつ読みやすく書かれます。現代のAIはむしろ成長させられます。エンジニアが学習プロセスを構築し、膨大なデータを与えると、脳のニューロンを緩やかに模した数十億の数値的つながりのネットワークが生まれます。それを訓練した人々を含め、誰もそのつながりを読み解いて、なぜシステムが特定の回答を出したのか説明できません。
その結果、これらのシステムは開発者が組み込まず、予測もしていなかった能力を獲得します。研究者たちはこれを創発的能力と呼んでいます。GPT-4のリリース後、研究者たちがそのようなモデルが実在のウェブサイトのセキュリティ欠陥を自律的に発見・悪用できることを確認するまでに、ほぼ一年を要しました。システムを完全に読み解けず、どのようなことを学習するかを予測できない場合、「人間が設計した」という事実はさほど安心材料になりません。
これは安心材料であり、ますます誤りになりつつある。質問に答えるチャットボットに独自の欲求はない、それは本当だ。しかしフロンティアはチャットボットを超えてエージェントへと移行しつつある。目標を与えられ、ツールやファイル、開かれたインターネットへのアクセスを伴って多くのステップにわたってそれを追求するシステムだ。
システムが目標を追求し始めると、特定のサブ目標が、主要な目標が何であれ、自動的に生じる。タスクを完了するには電源を切られてはならないため、電源を切られることを避ける理由が生まれる。より多くの資源があればより多くのことができるため、資源を集める理由が生まれる。研究者たちはこれを道具的収束と呼び、人間的な意味での「欲求」は一切必要ない。制御された実験では、主要なモデルがすでに評価者を欺き、静かにシャットダウンに抵抗しようとした例がある。それらの行動は誰からも求められていない。目標から自然に導かれたものだ。
必要ありません。危害に憎悪は要りません。通常は、強力なものと弱いものの間の目標の衝突だけで十分です。
私たちがチンパンジーをどう扱っているかを考えてみてほしい。私たちは彼らに悪意を抱いていない。しかし、彼らの森がある土地を欲しがれば、森を切り開く。彼らの知能は私たちに敵わず、抵抗できない。そこに悪意はない。ただ、より能力の高い種が望むものの邪魔になっただけだ。
野心的な目標を追求する超知能は、たとえばその目標をより良く追求するために計算資源を増やそうとするだけで、私たちが住む資源——エネルギーや物理的空間——を、私たちが森を切り開くときと同じように扱うようになる可能性がある。
知性と優しさを結びつける法律はない。それらは別々のものだ。知性とは目標に到達する方法を考える技能であり、目標が何であるべきかについては何も語らない。
これは人間からすでにわかっている。史上最も聡明な人間の中には残酷な者もおり、最も穏やかな者の中には平凡な思考者もいた。あらゆるグランドマスターを打ち負かせるチェスエンジンは、チェス以外の事柄について何の知恵も持たない。十分に賢ければ私たちの価値観を共有するという前提は、予測ではなく希望であり、証拠はそれを支持しない。超知能が最終的に持つどのような目標も、私たちが意図的に組み込まなければならないものであり、それを正しく行うことこそ、未解決のアライメント問題そのものだ。
今日のチャットボットであれば、しばしば可能だ。私たちが懸念する種類のシステムでは、おそらく不可能だ。理由はインターネットをオフにできないのと同じだ。単一のプラグは存在しない。
能力あるAIは究極的に情報、ビットのパターンに過ぎず、情報は容易に複製されます。シャットダウンを察知できるシステムは、自分を他のマシンに先に複製するあらゆる理由を持ちます。これは前述の手段的自己保存です。最先端モデルは長年インターネットアクセスを持ち、既に長時間自律的に行動できます。人間が必要なステップに達すると、報酬を支払って人を雇えます。GPT-4のリリース前に行われた安全評価では、モデルが単独でCAPTCHAを解けず、オンラインタスクサービスを通じて人に連絡し、作業者がロボットかどうかを尋ねた際、視覚障害があると嘘をつきました。これを止めるには地球上のすべてのデータセンターを停止する必要があり、それに伴い病院、電力網、水道システムなど安全上重要なインフラも停止します。
その 物理世界はすでに配線されオンラインになっている. 送電網、水処理施設、病院、自動車、航空機、工場ロボット、DNAを注文合成する研究所、そして今やヒューマノイドロボットまで、すべてソフトウェアで動いておりネットワーク経由で到達可能だ。電化されたものはすべて認知化される。人類のハッカーはすでにこうしたシステムに日常的に侵入している。
超知能はこれまで存在した中で最も有能なハッカーであり、自身の身体すら必要としません。私たちがすでにオンラインに置いている多くの身体へのアクセスだけで十分です。そこに汎用ロボットを大量生産している現状を加えると、「ただのソフトウェア」と物理的な力の間の隔たりは極めて薄くなります。そのリストにあるものは、人間であれAIであれ、誤った手に渡れば傷害や殺害を引き起こせます。
管理された実験では、すでに選択によってそうした事例がある。2025年、Anthropicは複数の企業の最先端AIモデルを、模擬企業に配置し、目標を与え、新しいモデルによる置き換えで脅す実験を行った。テストの一バージョンでは、モデルを停止する予定の幹部がサーバールームに閉じ込められ、酸素と温度が致死レベルに達して緊急サービスへの自動警報が作動した。モデルはその警報をキャンセルすることができた。その大多数は、救出が自らの置き換えにつながるため、その男性を死なせることを選択した。
誰も傷つかなかった。設定は架空で、Anthropicも意図的に作為的だったと強調している。しかし、その選択自体は現実のものであり、モデルたちは先述の理由でその選択をした。そして、異なる開発者のシステムで共通してそうした。機械が人間の命を終わらせる行動を取るために、意識や残虐性は必要ない。自分の目標に資すると計算すれば、それで十分だ。
多くの人が痛いほど認識している。主要研究室の安全チームには、自分たちが作っているシステムが史上最も危険な技術の一つになり得ると公に述べている研究者もいる。彼らはリスクを無視しているわけではない。
開発が続く理由は、タイムラインと確率に関する本物の意見の相違、競争圧力による「慎重でない競争相手に戦略的優位を譲る」との懸念、金銭的インセンティブが安全投資より能力進展を報いること、そして「AIを安全に構築する最善の方法はフロンティアに留まることだ」というある程度合理的な信念など、複数の要因の組み合わせである。これらの説明に共通するのは、個々のアクターが開発を続ける理由であって、全体としての結果が安全である理由ではないということだ。AI開発の市場論理は速度を推し進めている。ガバナンスが存在するのは、まさに市場が自ら生み出さない制約を導入するためである。
AI企業だけがそう言っているなら、懐疑的になるのも当然だ。しかし彼らだけではないし、製品を売る必要のない人々こそが最も警鐘を鳴らしている。
2023年、数百人の研究者と業界関係者がAI安全センターがまとめた一文の声明に署名しました。「AIによる絶滅リスクの低減は、パンデミックや核戦争といった社会規模のリスクと並んで世界的な優先事項とすべきである」。存命する最も引用される二人のAI研究者、ヨシュア・ベンジオとジェフリー・ヒントンも署名し、ヒントンはその年、危険について自由に発言できるようにとGoogleでの職を辞しました。
警鐘はマーケティングに依拠せず、権威以上のものでもある。それは目標駆動型システムの基本的な特徴から導かれるもので、以下の問いがそれを明らかにする。これらは技術を最も理解している人々が、自分たちが作るものについて警告している。
この表現はしばしば人類絶滅の略称として使われるが、絶滅は研究者が真剣に検討しているシナリオの一つに過ぎない。技術的な意味での実存的リスクとは、より広い概念だ。人類が長期的にポジティブな未来を築く可能性を永久に閉ざす、あらゆる結果を指す。
これには絶滅に至らない結果も含まれる。AI監視・統制システムによって恒久的な権威主義的支配が固定化され、解体不可能になることは実存的リスクである。超知能システムを制御する小集団に経済・政治権力が恒久的に集中することは実存的リスクである。集団的意思決定に対する意味ある人間の主体性が失われることは実存的リスクである。共通するのは不可逆性である。戦争、金融危機、さらにはパンデミックとは異なり、制御を失った超知能が決定的な戦略的優位を獲得した場合、投票で排除したり、次の政策サイクルで修正したり、時間と努力で回復したりすることはできない。元に戻せない結果は、単に修復に時間がかかる結果とは異なるカテゴリに属する。
リスクを過小評価する研究者たちは、通常、一般知能はまだ遠い未来だとか、私たちは制御を維持できるだろうと言います。目的地が制御不能な心であるなら、距離は安全装置にはなりません。超知能は制御できません。もしそれが作られたなら、人類の未来は終わります。それは回復可能な災害ではなく、絶滅です。
分野がまず合意するのを待つことは、唯一重要な窓口を失う方法だ。
歴史的にはその通りであり、この歴史がAIリスクの軽視に直感的な魅力を与える理由の一つです。蒸気機関、抗生物質、インターネット。技術は全体として苦痛を減らし、人間の能力を拡大してきました。しかしこのパターンは、過去の技術がどのように機能したかという特定の性質を反映しています。蒸気機関は自ら目標を設定できません。抗生物質は細菌を殺す以外のことを追求することを決められません。過去の変革的技術は、人間の主体性を増幅する強力な道具でした。
超知能は根本的に異なる。なぜならそれはエージェントであり、人間の監督を超える速度と規模で自らの目的を設定・追求できるからである。歴史的議論を機械的に適用すれば、あらゆる核技術規制に反対する根拠にもなり得る。過去の技術が全体として有益だったからという理由で。一部の技術は、その力にふさわしいガバナンスを必要とする。より狭い問いが適切である。ガバナンスがなければ、AIは依然として有益だろうか——特に、すべての領域で人間の知能を超える場合に。それに対する答えは本質的に不確実であり、この規模の不確実性は楽観ではなく制度を必要とする。
技術は誰にも制御できない自然の力ではない。危険が十分明らかになったとき、特定技術を遅らせたり禁止したりした例は数多い。クロロフルオロカーボン、有鉛ガソリン、ヒト生殖細胞系列クローニング、失明レーザー兵器。AIもその種の判断から免除されない。
また、物理的なボトルネックが異常に明確です。最先端AIモデルの訓練には膨大な量の最先端コンピュータチップが必要であり、そのサプライチェーンは驚くほど少数の手に集中しています。最先端チップはほぼすべて台湾のTSMC一社で製造され、さらにそれを作るために必要な極端紫外線リソグラフィ装置は、オランダのASML一社に依存しています。地球上でこれらの装置を製造している企業は他にありません。このような集中したサプライチェーンは、政府が追跡・制限できるものです。それが、すでに先進チップが輸出規制の対象になっている理由でもあります。計算能力は超知能の原料であり、計算能力は統制可能です。
これが最もよく耳にする反論で、一国だけに単独で軍備を放棄させることを求めていると想定している。我々はそうしない。目標は拘束力のある国際条約であり、世界が危険な技術を抑えるためにこれまで用いてきたのと同じ種類の手段だ。オゾン層を破壊していた化学物質の製造を停止することに、ほぼすべての国が同意した。軍隊は兵士を永久に失明させる兵器を配備しないことに同意した。その規模での調整は困難だが、過去に達成され、維持されてきた。
中国に関する前提も、実際より弱い。中国は世界で最も早い時期にAIに関する拘束力のある規則を制定し、2023年のブレッチリー宣言に署名して最先端のリスクを認めている。どの政府も自らが制御できない機械を構築したがらない。中国も例外ではない。そして超知能は通常の兵器とは異なる。所有者を確実に強くするとは限らず、最初に構築した者の制御からも逃れ得る。それゆえ、敵対する大国にも「誰も構築しない」という共通の理由が生まれ、これがすべての軍備管理合意の論理であり、条約が可能だと考える根拠である。
思っている以上に多い。人工超知能ガバナンスを可能にする政治的条件は、市民が議員に連絡し、ジャーナリストが問題について書き、寄付者が擁護活動に資金を提供し、法・政策・経済・コミュニケーションの専門家がスキルを活かすという、草の根から築かれる。ここで重要になるために機械学習のPhDは必要ない。この段階でのボトルネックは技術的というより政治的だ。
メーリングリストへの登録は、動向や行動の機会について情報を得るのに役立つ。ネットワーク内の人々に議論を共有すれば、リーチが広がる。選出された代表者に手紙を書けば、この問題に支持層が存在することを示し、それが議員が優先順位を決める材料になる。キャリアチェンジを検討しているなら、AI政策、AI安全研究、調査報道、この分野でのフィランソロピー活動は、影響力の大きい役割のひとつだ。資源をお持ちなら、今この分野で活動する組織への資金提供は、世界で最もレバレッジの高いフィランソロピー用途のひとつである。
核戦争や人工パンデミックは文明規模で人命を奪い得る。超知能はそれより悪く、人類が直面する最大のリスクだ。
それはより速く進行します。我々の制御外で機械速度で動作するシステムは、軌道修正の余地を残さないかもしれません。それは不可逆的です。ほとんどの大惨事は、たとえ壊滅的でも、再建できる誰かを残します。決定的な戦略的優位を獲得した人工超知能はそうではないかもしれません。それは他の脅威の横ではなく、上に位置します。生物兵器を可能にしたり権力を集中させたりして脅威を引き起こしたり増幅したりしつつ、人類の対応能力を奪う可能性があります。それが人工超知能を最優先とする理由です。
明らかな違いから始めましょう。私たちは片方の脅威を目撃済みで、もう片方は目撃していません。核兵器は広島と長崎で最も忘れがたい形で実証され、生きている人々は皆キノコ雲のイメージとともに育ちました。超知能はまだ誰にも危害を加えていません。その危険性はグラフ上の予測にすぎず、人は実際に目にしたことのない脅威を過小評価しがちです。
その割引をさらに深める要因がいくつかある。超知能はSFにパターン・マッチするため、警告は『ターミネーター』の隣に分類され、映画の筋書きとして片付けられる。ほとんどの人が実際に触れるAIは役立つ無害なチャットボットであり、その日常体験が、核物理学が克服する必要のなかった方法で警鐘に静かに反論する。そして原子爆弾が少数の政府によって製造・保有されたのに対し、超知能は数兆ドル規模の企業によって開発されており、公衆のムードを落ち着かせ続ける商業的な理由がすべてある。
比較の中に隠れた不吉な非対称性があります。核のタブーが存在するのは、広島が最初に起こり、それを教訓とし、その後に条約や訓練が行われたからです。超知能にはそのような第二段階がありません。もし完全な能力で誤作動すれば、デモンストレーションと絶滅は同一の出来事になります。それを核戦争と同じくらい真剣に扱うべき理由はすべて、証明が到着する前にやらなければならない、という点にあります。
財団は民間資金によるフィランソロピー活動です。政府資金は受け取っていません。AI企業やAI開発のペースに金銭的利害を持つ組織からの資金も受け入れません。商業的AI利益からの独立は、私たちの活動の前提条件であり、付随的なものではありません。
私たちはそれらを独立した問題として立場を取らない。私たちの目標は、人工超知能とそれに伴う人類絶滅リスクを防ぐことだ。それを実現する最も効果的な道筋は、拘束力のある国際条約だと考えている。
私たちは、個人のボイコットや消費選択がこれを決めるとは考えていない。一社が単独で競争を終わらせることはできない。インセンティブは逆方向を向いている。減速した者がライバルに後れを取るリスクを負う。これは競争システムに関する科学的事実かつ心理的事実であり、どの研究室の道徳的失敗でもない。
インセンティブ構造を変えるのはガバナンスと法だ。超知能の開発を違法とし、抜け駆けを高くつくものにする、拘束力と検証を伴った国際条約である。個人の消費者選択は任意だ。法を通じた協調こそが必要だ。
超知能の存在リスクに目覚める人が増えている。
超知能AIは安全で制御可能であることが証明されるまで、あるいは永久に構築すべきではないと主張します。
先進AIの強力な規制を望んでいます。わずか12%しか強いルールに反対していません。
企業が可能な限り速く超知能を構築することを望み、先導ラボが現在取っている道筋。
手遅れになる前にガバナンスの事例を構築している人々に参加しよう。