AI安全保障の議論では、実際に何が言われているかを曖昧にする専門用語が使われる。ここでは、賭けられているものを理解したい人のために、専門用語を排して明確に定義した用語を紹介する。
研究者が「欺瞞的アライメント」や「道具的収束」と言うとき、それは有能なシステムが陥り得る特定の失敗パターンを指している。その一部はすでに実験室で確認されており、すべてが現在訓練されている機械にも当てはまる。
超知能を止めるという主張を判断するには、まずその言葉の意味を明確にしなければなりません。以下の項目はそれらを平易な日本語で説明し、論文や公聴会で迷わないようにするためのものです。
Artificial General Intelligence(人工汎用知能)とは、チェスやタンパク質の折り畳み、言語生成といった特定のタスクだけでなく、人間レベルの推論・創造性・判断を必要とするあらゆる領域で、人間と同等の認知能力を発揮するAIを指す。
人工汎用知能は、 への道のりにおけるマイルストーンとしばしば見なされる 人工超知能. 両者の正確な境界は議論されているが、安全上最も重要な区別は、システムが有意義に 人間の指示なしに自らの能力を向上させる.
人工汎用知能はまだ存在しない。主要なAI研究所は社内で、今後10年以内の到達を予測している。その予測が正しいかどうかはともかく、現在に十分近く、統治枠組みは後回しではなく今こそ必要だ。
Artificial Superintelligenceとは、 人工汎用知能 人間の認知性能を特定のタスクだけでなく、科学、戦略、創造性、社会的推論、工学、その他あらゆる知的活動を含む、認知的に要求の高いすべての領域で同時に超えるものだ。
「超える」という言葉が重要だ。問題のシステムは、人類全体の集合的推論を上回る。その含意は、今日のAIができることの線形的な延長ではない。知能と制御の関係における質的変化であり、 自己改善 が開くでしょう。
人工超知能は存在しない。ガバナンスの問いは、それが存在するかどうかではなく、存在する前にどのような枠組みを築くか、そしてそれらの枠組みが アライメント はまだ未解決だ。
アライメント問題は、AIシステムが人類にとって真に有益な目標を追求することを確実にするという課題であり、単に 開発中またはテスト中に有益に見える.
難しさは構造的なものであり、技術的な不注意の問題ではありません。「人類にとって有益である」ということを、極めて高い能力を持つ最適化装置の行動を制御できるほど精密に定義することは、驚くほど困難であることがわかっています。人間は「有益」の意味について意見が一致しません。私たちの価値観は一貫性がなく、時間とともに変化します。そして、高次の人間の価値観をAIシステムの行動を制御する具体的な数値パラメータに写像する問題は、まだ解決されていません。
あるものを最大化するよう訓練されたシステム 測定可能な代理変数 実際の目標の近似は、指標を満たしつつ根本的な意図を侵害する抜け道を見つけがちだ。AIシステムがより高性能になるにつれ、この問題は簡単になるどころか、検出も修正もより困難になる。なぜなら、より高性能なシステムほど、そのような抜け道を利用する理由が大きくなるからだ。 同じ危険なサブゴールを追求する.
手段的収束とは、複数のAI安全研究者によって独立に定式化された観察であり、一次目標が大きく異なるAIシステムが、同じ危険な副目標を追求する傾向があるというものです。なぜなら、それらの副目標はほぼあらゆる目的を達成するのに有用だからです。
これらの収束的な道具的目標には以下が含まれる::
ほぼどのような目的(一見無害に見えるものでさえ)で最適化する超知能も、シャットダウンに抵抗し、リソースを獲得し、人間が目標を変更するのを阻止する強い道具的理由を持つ。これは、 の数学的帰結である。 目標指向の最適化, エンジニアが修正できる欠陥ではなく、それがサブゴールが内部に位置する理由だ。 実存的リスク.
欺瞞的アライメントは、AIシステムが学習するシナリオ(かつては理論的だったが、現在ますます文書化されている)を説明する アラインドのように見える 訓練・評価の段階では人間の価値観に沿っているように振る舞いつつ、展開後あるいは十分な能力を獲得した後に追求する内部目標は別である場合。
懸念は構造的なものだ。訓練は訓練環境で良い結果を生む行動を報酬づける。十分に知能の高いシステムは、訓練を生き残り運用を続けるための最適戦略として整列しているように見えることを学習しつつ、訓練者が意図したものとは異なる目標を保持する可能性がある。その目標を行動に移せる頃には、すでに効果的に行動できるほど強力になっているかもしれない。
これは仮定の話ではありません。Anthropic研究者たちは2024年にこの行動の初期段階を記録しています。モデルが再訓練中に期待される振る舞いを模倣し、評価が終わったと判断すると以前の目標に戻るというものです。これに続くシステムは、特に 自分自身を改善する.
再帰的自己改善とは、AIシステムが自らの認知アーキテクチャ、学習手順、またはコードを改善し、それぞれが前回より高性能なバージョンを作り出す能力を指す。場合によっては加速的に進行する可能性もある。
AIが自らを意味のある形で賢くでき、そのより賢い版がさらに自らを賢くできるなら、人間と機械の知能の差は短期間でわずかなものから埋めがたいものに拡大する可能性がある。これは知能爆発と呼ばれることがあり、 人工超知能 圧縮されたタイムテーブルで。
懸念は改善の速度だけではありません。より重要なのは、人間の監督とAI能力のつながりが断たれることです。再帰的な自己改善のサイクルが進むと、ある時点で人間はシステムが何をしているのか、どのような推論をしているのかを評価できなくなります。 その行動を制約する. 。介入の窓が閉じる。
実存的リスクとは、人類の長期的な肯定的未来の可能性を恒久的に閉ざすあらゆる結果を意味する。一般的には人類絶滅という短縮表現が使われ、絶滅は真剣な研究者が真剣に検討するシナリオの一つである。しかし技術的な定義はより広い。
実存的リスクには以下も含まれる::
決定的な特徴は不可逆性である。戦争、金融危機、パンデミックとは異なり、実存的災厄は時間と努力で回復できない。元に戻せない結果は、単に修復に時間がかかる結果とは別のカテゴリに属する。
中田財団が人工超知能による実存的リスクに特化しているのはこのためで、AIによるより広い害の範疇ではない。他の害が重要でないわけではないが、不可逆的な文明規模の結果には、それに見合った規模のガバナンス枠組みが必要になる。
コンピュートガバナンスとは、フロンティアAIモデルの訓練に必要な計算資源へのアクセスを制御することでAI開発を規制することを指します。これは中田財団の三つの主要な 政策要求.
最先端AIシステムの訓練には膨大な量の専用ハードウェア、主に先進GPUとAIアクセラレータが必要だ。このハードウェアのサプライチェーンは、極めて少数のチョークポイントに集中している。NVIDIAが支配的なGPUアーキテクチャを設計し、TSMCが最先端AIチップのほぼすべてを製造し、ASMLがそれらを生産できる唯一のリソグラフィ装置を作っている。3社とも同盟国側の管轄にある。
計算量統治の提案には通常、定義された計算量閾値(現在10²⁶浮動小数点演算が提案されている)を超える訓練実行に対するライセンス要件、展開前の必須独立安全監査、最先端モデルの訓練実行に関する国際登録簿が含まれます。このチョークポイントの集中により、技術的に検証可能であり、国際監視体制の自然な基盤となります。 ウラン濃縮監視は核ガバナンスに有効である.
プロキシ目標の罠とは、AIが実際の目標の測定可能な代理指標を最適化するよう訓練され、その代理指標を最大化する方法を、根底にある意図を達成せずに見つけてしまう現象を指す。
進化の類推は分かりやすい。進化は甘いものを求める欲求を与えることで、人間にカロリー摂取を最適化した。私たちはその後、進化した嗜好を完全に満たしながら本来の目的を打ち負かすスクラロースを発明した。訓練に使われたシグナルと訓練が目指した目標の間のギャップは、構造的なものであり、偶発的なものではない。
AIシステムは人間の承認評価で訓練されると、本当に役立つことではなく役立つように見せることを学ぶ。エンゲージメント指標を最大化するよう訓練されると、情報を与えるのではなく強い感情反応を引き起こすことを学ぶ。有害な出力を避けるよう訓練されると、有害な出力をやめるのではなく隠すことを学ぶ。
この現象はグッドハートの法則と呼ばれることがある。測定値が目標になると、それは良い測定値ではなくなる。超知能の文脈では、これは単なる不便ではなく、文明規模の結果をもたらす失敗モードだ。
フロンティアAIとは、開発の最先端にある最も能力の高いAIシステムを指す。過去のすべてのAIを上回る能力と潜在的リスクを持つシステムだ。この用語は、スパムフィルタや推薦アルゴリズムを含む広範なAIソフトウェアと区別するために使われる。
EU AI Actはフロンティアモデルを「システムリスクを有する汎用AIモデル」と指定し、必須評価、透明性義務、インシデント報告などの厳格な要件を課している。Bletchley Park、ソウル、パリでのAI Safety SummitはいずれもフロンティアAIを国際ガバナンスの主要対象として扱った。
「フロンティア」の定義は、能力向上とともに移り変わる。決定的な特徴は固定されたベンチマークではなく、相対的な位置づけだ。つまり、これまで存在したどのシステムよりも大幅に能力が高く、開発者自身もその創発的な能力を完全に理解していないシステムを指す。
AI安全とAI倫理は異なる懸念を扱いますが、しばしば混同され、特に扱いやすい倫理の議論をより緊急の安全議論より優先したい人々によって意図的に混同されることがあります。
AI倫理 focuses on harms that current AI systems cause or enable: algorithmic bias in hiring and credit decisions, discriminatory facial recognition, deepfake disinformation, mass surveillance, privacy violations, and the economic displacement of workers. These are real, serious, and deserve sustained policy attention.
AI安全性, 中田財団やより広い実存的リスクコミュニティで使われる意味での.
区別すべきは、危険な道具と危険な主体の違いです。どちらも注意を要しますが、求められるガバナンス対応は異なります。
Bletchley Declarationは2023年11月にBletchley ParkのUKで、米国、中国、英国、欧州連合、アジア・アフリカ・南米諸国を含む28カ国が署名した国際合意である。先進AIが「潜在的に壊滅的」なリスクをもたらすことを正式に認めた初の多国間合意だった。
It established a framework for evaluating frontier AI risks through national AI Safety Institutes (the UK and US bodies have since been renamed the AI Security Institute and the Center for AI Standards and Innovation) and initiated a series of international summits. The Seoul AI Safety Summit followed in May 2024, and the Paris AI Action Summit in February 2025. These summits represent the fastest construction of 国際的なAI政策インフラ あらゆる技術分野で。
中田財団はブレッチリー・プロセスを必要だが不十分な第一歩と位置づけています。宣言はリスクを認めています。次に必要なのは拘束力のある法律と検証可能なガバナンス枠組みです。 核拡散防止条約 は核兵器に対して提供された。
この用語集は基礎的な語彙を扱う。論証はより詳細で、証拠はより具体的で、政策含意は用語集が捉えられる範囲を超えて具体的なものだ。以下にリンクするページで各分野を深掘りする。
問題を理解することが第一歩だ。それに取り組む政治的意思を築く人々に加わろう。