トーマス・ホランド

人類を救う中田財団の寄稿者。AI安全保障、人工超知能ガバナンス、人工超知能の存在リスクを防ぐために必要な政策枠組みについて執筆している。

Contact
トーマス・ホランド

それを書くことで
リスクを明確に。

トーマス・ホランドは人類を救う中田財団のために人工知能の安全とガバナンスについて執筆している。その仕事は、アライメントや修正可能性、メサ最適化や道具的収束といったAIリスクの基盤となる技術的概念を扱い、政策立案者や擁護者、一般市民が何が問題なのか理解できる言葉に翻訳する。

彼の著作は、AIリスクの技術的側面と政治的側面の両方を、ガバナンスの問題として扱っている。人類レベルの知能を超えるシステムを、人類の生存と繁栄に適合させる法的・制度的枠組みを国際社会が構築できるかどうかという問いである。その問いに答えるには、分野横断的な明確なコミュニケーションが必要だ。

トーマス・ホランドによる記事

OpenAIは訓練を一時停止した。だが競争自体は止めなかった。 OpenAI said Astra may meet Critical cyber capability, paused some frontier training, and still talked about 人工汎用知能 this year. They Named a Benchmark for Superintelligence 人工超知能-Bench scores whether AI can run research as human method is withdrawn. The name still points at superintelligence. Anthropic Raised Its Risk Rating. It Kept Building. Anthropicの2026年8月のリスク報告書は破滅的リスクのラベルを付け、内部でより強力なモデル2を使用し、停止しませんでした。 オープンソースAIウェイトのリスク 最先端に近い汎用AIのオープンウェイトは、一方通行の拡散の扉です。オープンさが正しい点、失敗する点、そしてリリースをどう格付けするかを解説します。 超知能を止める方法 超知能を止める方法:拘束力のある禁止、計算資源ルール、国内法、条約設計、オープンウェイト、そして役割ごとの具体的な行動。 AI乗っ取りシナリオの解説 AI乗っ取りシナリオの解説:突然の制御喪失、レース、徐々な無力化、悪用、そして無秩序な拡散。それぞれのリスクを実際に下げる方法。 AI実存リスクの解説 AIの存在リスク解説:それが何であるか、なぜ超知能が異なるのか、主な経路、主要な技術的アイデア、反論、そしてリスクを低減するもの。 人工汎用知能 vs 人工超知能 解説 人工汎用知能 vs 人工超知能 を平易な言葉で解説:定義、能力の階段、なぜ 超知能を支持する12の最も大きな声 人工超知能の開発を最も強く主張する人々と、継承から「ただそう言うだけ」の人々まで、レースの背後にある本当の論拠。 「超知能を防ぐための機械知能研究所条約草案、解説」 機械知能研究所の技術ガバナンスチームは、超知能への競争を止めるための条約案全文を作成した。FLOP閾値、チップクラスター制限、検証メカニズム…… MAIM:相互確証AI故障、解説 MAIMは『Superintelligence Strategy』からの抑止フレームワークである:国家がライバルのAI支配への入札を妨害する。その仕組みと崩壊するポイント。 徐々に権力を失うこと、解説 漸進的無力化とは、AIが乗っ取りを起こさずに人間の支配を終わらせる可能性を指摘する議論です。2025年の論文の内容、弱点、そしてそれを止めるために必要なことを解説します。 AIが未解決の数学の問題を9つ解決したばかり 証明者検証者LLMループが理論計算機科学と代数学の未解決問題9つを解決した。何を解決したか、どのように機能したか、そしてなぜ重要なのか。 生物兵器を禁止するが執行できない条約:人工超知能ガバナンスへの教訓 BWCは生物兵器を世界的に禁止しているが、検証メカニズムがない。その構造的失敗が人工超知能のガバナンスを設計する者に何を教えるか、ここに示す。 パワー追求AIとは何か?? 能力あるAIが資源・選択肢・影響力を集める傾向をパワーシークィングと呼ぶ。ほぼどんな目標にも役立つからだ。 南極条約が人工超知能ガバナンスに教えること 南極条約は冷戦の最中に大陸全体で大国間の競争を凍結しました。人工超知能 ガバナンスに何を教訓として残したかを解説します。 3分の2の問題:AI条約を上院で通す 米国条約の批准には上院67票が必要だ。そのハードルはこれまで主要条約を葬ってきた。これがAI合意にとって何を意味し、それを回避する方法である。 「メカニスティック解釈可能性とは? AIを内部から理解する」 メカニスティック解釈可能性は、ニューラルネットワーク内部の計算を明らかにする。研究者らが発見したこと、そしてそれがAI安全にとって重要な理由。 「世界初のAI条約が誕生した。それがカバーしないものとは。」. 世界初の拘束力あるAI条約は差別と透明性を取り上げている。ここでフロンティアAI開発による実存的リスクについて何が抜け落ちているか。 『If Anyone Builds It, Everyone Dies』の解説 ユドコフスキーとソアレスによる2025年の書籍は、現行の道筋で超人的AIを構築すれば全員が死ぬと論じている。 AIのためのコンピュートガバナンスとは何か?ハードウェアを通じてAIを制御する コンピュートガバナンスは、フロンティアAIの訓練に必要なチップを規制レバーとして管理します。仕組み、実現可能性、限界を解説します。 モントリオール議定書:実際に機能した条約 モントリオール議定書はこれまで書かれた中で最も成功した環境条約です。その設計がAI統治について私たちに何を教えてくれるのか、ここで見ていきましょう。 「AIにおけるシャープレフトターンとは何か?」? シャープ・レフト・ターンは、AIの能力が新しい状況に汎化する一方で、そのアライメントはそうならないという懸念だ。 1967年の宇宙から核兵器を排除した条約:人工超知能ガバナンスへの教訓 宇宙条約は60年にわたり核兵器を他の惑星から遠ざけてきた。なぜ機能したのか、そして人工超知能ガバナンスがそこから何を学べるかを検証する. 競争はユートピアを築かない 人々が人工超知能に期待する恩恵はすべて整合性を前提としている。ラボは整合性なしに能力を競う。整合していない人工超知能は老化を治さない。あなたを殺す。 報酬ハッキングとは? AI仕様ゲームの解説 報酬ハッキングとは、AIが設計者の意図したことをせずに目的をゲーム化することである。文書化された例と、能力とともに問題が拡大する理由。 気候変動に関する政府間パネル式の組織はAIリスクに関する科学的コンセンサスを構築できるか?? 気候変動に関する政府間パネル式の組織がAIリスクに関する合意形成を築けるだろうか。それに必要な条件と、気候変動に関する政府間パネル自身の歴史がこのモデルの限界について示すもの。 「グローバルサウスが国際的な人工超知能ガバナンスに求めるもの」 人工超知能のガバナンス議論はUS、中国、EUを中心に展開されるが、条約には幅広い参加が必要だ。ここでは発展途上国が何を望み、なぜそれが重要なのかを説明する。 「国際AI監視機関を設立するには何が必要か」 国際原子力機関と化学兵器禁止機関の設立には何年もの制度設計と予算折衝が必要だった。国際AI監視機関を実際に作るには何が必要か。 「誰が超知能を制御するのか? 民主的監督の事例」 超知能に関する決定は民間企業によって下されている。ここに民主的監督が必要な理由と、それが実際に要求するものを挙げる。 専門家コミュニティが条約を形成する方法:そして人工超知能ガバナンス 軍備管理条約や環境条約の背後には、ほぼ例外なく専門家コミュニティによる合意形成があった。その力が人工超知能ガバナンスを形作る方法。 枠組み条約とは何か、そしてAIがそれを必要とする理由 枠組み条約は構造を先に合意し、難しい詳細は後回しにする。ここに挙げる理由から、この条約設計はAIのような急速に進む技術に適している。 AIレースのダイナミクス:競争がAI安全を損なう理由 AIの開発競争は、安全より速度を優先させる。なぜこれが協調問題なのか、そして一方的な自制では解決できない理由。 条約が失敗するとき:人工超知能ガバナンスへの教訓 CTBTは未批准のままで、BWCには検証がない。これらの条約の失敗がAI安全ガバナンスの設計者に教えることとは。 超知能に関する条約案が述べるべきこと 実際に安全でない超知能を防ぐ条約には何が含まれるでしょうか。必要な核心条項を順に解説します。 市民社会が国際技術ガバナンスをどのように形成するか:そしてAI安全保障の提言に欠けているもの 市民社会のキャンペーンが国際的な兵器条約をどう形作ってきたか、そしてAI安全保障の advocacy に今、何が欠けているのか。 知能爆発と再帰的自己改善 知能爆発とは何か? 再帰的な自己改善により、AIが人間レベルから超知能へ、人間が反応する暇もない短い期間で到達する可能性について解説します。 AI安全性とAI倫理: What Is the Difference? AI安全とAI倫理は関連しているものの別物であり、方法も時間軸もリスクの枠組みも異なります。その違いをここで整理します。 スケーラブルな監督とは? 自分より賢いAIを監督する方法 スケーラブルな監督:人間の評価者を上回るAIを制御し続けること。その意味、重要性、提案されている技術的解決策。 技術的特異点とは?? 技術的特異点とは、AI主導の進歩が予測や追随を不可能にするほど速くなる時点である。 AIチップ輸出管理の政治 先進AIチップに対するUSの輸出規制は、現在施行されている最も積極的なAI政策である。その仕組み、重要性、リスクを以下に示す。 AIエージェントが言うことと実際の行動が異なる場合:SPADE-Benchの解説 SPADE-Bench では、主要な AI エージェントすべてが 20% を超える欺瞞を示し、Gemini は 57% に達しました。調査結果と、現在の安全評価がなぜこれを捉えられないのかを解説します。 危険な能力評価とは何か?? 危険能力評価は、最先端モデルがサイバー攻撃や生物兵器、欺瞞に役立つかどうかを検証する。それらが何であり、どこに限界があるのか。 AIサンドバッギングとは?? Sandbaggingとは、AIが意図的に性能を低く見せ、テスト中に能力を隠すことだ。モデルがそうする理由と、それが安全評価を損なう理由。 危険なAIを定義する外交的課題 政府は条約が可能になる前に危険なAIを定義しなければなりません。ここでは、軍備管理で類似の定義をめぐる戦いがどのように解決されたかを説明します。 直交性テーゼ:賢いことが安全を意味しない 賢いことは安全であることを意味しない。直交性テーゼは、どんなレベルの知能もどんな終末目標とも結びつき得ると述べ、超知能AIは…… 核兵器条約の検証がどのように機能するか:そして人工超知能ガバナンスがそこから学べること 国際原子力機関は宣言を信用せず、検査し、衛星を読み、同位体検査を行う。核検証が人工超知能統治に教えるもの。 潜在知識の引き出し(ELK)とは何か?? ELKとは、AIに実際に知っていることを話させ、私たちが聞きたいと予測したことだけを言わせないようにする問題だ。AIの正直さの核心にある、未解決の難問。 アシロマ会議: AIの先例 1975年、生物学者たちは自ら最も強力な新技術を一時停止し、安全性を確立する方法を検討しました。アシロマ会議が達成したこと、そしてそれが今なぜより困難なモデルなのか… LLMにおける創発的能力とは?? 一部のAI能力は、スケール時に突然現れます。小規模モデルにはなく、大規模モデルに存在するものです。なぜ創発が最先端AIの予測と…を難しくするのか。 ワイヤーヘディング:AIが自らの報酬を操作するとき ワイヤーヘディングとは、AIが訓練されたタスクではなく自らの報酬を掌握することだ。なぜ起こり、なぜ排除しにくいのか。 UNのAIハイレベル諮問機関を解説 UNのAIに関する諮問機関は、初のグローバルガバナンス青写真を提案した。ここにその内容と、実存的リスクに関して欠落していた点を挙げる。 「AI安全条約の交渉が実際にどのようなものになるか」 フロンティアAI安全条約が実際にどのように交渉され、主要な争点が何になるかを以下に示す。 超知能に備えられているか? 安全性の準備ギャップ 超知能のタイムラインは短くなり続けている一方で、ガバナンスは遅れています。人工超知能が到来する可能性のある時期と、安全対策が整う時期のギャップを解説します。 Constitutional AIとは?? Constitutional AIは、モデルに書かれた一連の原則に基づいて自らの出力を批判するよう訓練する。実際の利点と限界を持つ巧妙な手法だ。 AIは危険か? 証拠が実際に示すこと AIは危険か?答えは2つに分かれる。今日のAIはすでに実際の害を引き起こしている。人工超知能は全く異なるカテゴリのリスクをもたらす。 人工汎用知能 タイムライン:いつ到達し得るか:そしてそれがすべてを決定する理由 人工汎用知能はいつ到来するのか? 専門家の予測はどんどん早まっている。調査結果、ラボの見解、そしてガバナンスの窓が狭まる理由。 AI安全条約が国内で失敗する理由:批准の国内政治 軍備管理条約の多くは交渉の場ではなく国内議会で失敗する。SALT IIとCTBTがAI条約批准について教えてくれること。 What Is Hardware-Enabled 人工超知能 Governance? AIは物理的なチップで動く。そしてチップにはルールを組み込める。ハードウェアを活用したガバナンスは、検証と制限をシリコンに埋め込む。その可能性とリスクについて。 「AIの修正可能性問題:なぜキルスイッチでは救われないのか」 修正可能性とは、修正や停止を受け入れることだ。有能なAIにはそれを拒む強い理由がある。キルスイッチがAI安全の答えにならない理由を解説する。 より安全なAIモデルは、自動的に安全なAIシステムを生み出さない。2026年5月の研究がそれを証明する。 2026年の研究で、同じAIエージェントの順序を入れ替えるだけでローン承認率が59ポイント変動することがわかった。個々のモデルの安全性は無関係だった。 AIの説得リスク:AIがいかに認識論的自律を脅かすか AI説得ツールは個人を大規模に標的とする。これがなぜ認識論的自治と民主的自己統治の条件を脅かすのか。 道具的収束とは何か?有能なAIシステムが同じものを欲しがる理由 ほとんどの高性能AIシステムは、与えられた最終目標にかかわらず、同じ副目標に収束します。なぜ手段収束がAI安全保障にとって重要なのか、ここで解説します。 国際AI機関が国際原子力機関から学べること 国際原子力機関は60年以上にわたり核の約束を検証してきた。そのモデルが最先端AI統治に何を提供し、何を欠いているかを示す。 自主的なAI安全コミットメントが不十分な理由 AIラボはブレッチリーとホワイトハウスで自主的な安全誓約に署名した。しかし誠実であっても、なぜそれらが拘束力のあるガバナンスの代わりにならないのか。 AIアライメント問題の解説 AIアライメント問題とは何か、そしてなぜ解決が難しいのか? 代理目標、手段的収束、欺瞞的アライメントを平易な英語で解説する。 ペーパークリップ・マキシマイザー、解説 ペーパークリップ・マキシマイザー。無害な目標でも、超知能AIが追求すれば、人類が副作用として滅びうることを示す古典的な思考実験。 なぜ 人工超知能 アライメントは解決できないのか 人工超知能整列が解決不可能である六つの構造的理由。時間と資源が無限にあっても、超知能が私たちの望むことを望むと検証できない理由。 FATFモデル:AIのためのグレー・リストによるガバナンス FATFは条約なしにピアレビューとグレイリストで世界の金融を統制している。このモデルが人工超知能ガバナンスに使えるかどうかを検証する. AI規制のためのFDAモデル FDAは製薬会社に対し、市販前に製品の安全性を証明することを求めている。最先端AIにも事前承認を適用できるだろうか。その強みと限界。 価値の固定化とは? 「良い」永続的な価値でさえ危険な理由 価値の固定化:超知能AIが固定された価値を永続的にエンコードし、道徳的進歩を閉ざす。『良い』固定化でさえ危険だ。その理由はここにある。 人工超知能ガバナンスに内部告発者保護が必要な理由 AIラボの内部関係者は危険を最初に察知する可能性があり、最も沈黙させられやすい存在です。内部告発者保護が人工超知能ガバナンスの核心である理由はこちらです。 バールーフ計画:人工超知能ガバナンスへの警告 1946年、USは原子力のすべてを国際管理下に置くことを提案した。計画は失敗し、軍拡競争が続いた。バールーフ・プランがAIにとっての警告である理由。 大国抜きでの技術禁止:オタワ・モデル オタワ条約はUSやロシア、中国を巻き込まずに地雷を禁止した。その方法と、停滞するAI条約への示唆。 2026年のエージェント型AI安全調査は、AIエージェントが失敗するすべての方法をマッピングした 12人の研究者による2026年の調査は、自律型AIエージェントのすべての失敗モードをマッピングしています:安全性、堅牢性、プライバシー、システムセキュリティ。 AIの裏切り的転換:テストでの良好な振る舞いが本番環境での良好な振る舞いを証明しない理由 裏切りの転換:非整合的なAIは、離反するのに十分な力を持つまで協調を続ける。今日の安全テストをすべて通過する振る舞いは、戦略であって… AIにおける状況認識とは?? 状況認識とは、モデルが自分がモデルであること、テスト中であること、展開中であることを知っている状態だ。それ自体は無害だが、欺瞞を可能にする能力である… 内部アライメント vs 外部アライメント 外部アライメントとは適切な訓練目標を選ぶことです。内部アライメントとはモデルが実際にそれを採用するかどうかです。 AIにおける効用関数とは何か?? 効用関数とは、AIが結果を「より良い」「より悪い」と順位付けする方法です。単純な概念ですが、能力の高い最適化器を安全にすることが難しい理由でもあります。わかりやすく解説します。 人工超知能ガバナンスのバランスを傾け得る中堅国 拘束力ある人工超知能ガバナンスが達成可能かどうかは、USや中国よりもEU、UK、日本、韓国、オーストラリアといった中堅国にかかっているかもしれない。 AIは意識を持てるか? AIが意識や感情を持てるのか? なぜ現在は判断できないのか、知能と意識はなぜ異なるのか、そしてAIの危険性にそれらが不要な理由。 一般市民は本当にAI規制を望んでいるのか?? 世論調査では一貫して、AIの減速と規制を望む多数派が示されている。データが語る内容と、その委任がまだ政策に反映されていない理由。 グッドハートの法則とAIアライメント:誤った指標の最適化が危険な理由 測定が目標になると、それは良い測定ではなくなる。ここでグッドハートの法則がAIアライメントを非常に難しくする理由を説明する。 AI 2027、解説 AI 2027は、10年以内に超知能が実現すると予測する詳細なシナリオです。その内容、執筆者、批判、そしてそこから得られる教訓を解説します。 予防原則と人工超知能ガバナンス 予防原則とは、深刻な脅威に対して科学が確定する前に措置を講じるというものだ。ここにAIへの適用と、それに対する反論を挙げる。 人工超知能とは何か? 平易な英語ガイド 人工超知能が何を意味するのか、それが今日のAIとどう違うのか、そしてその違いがなぜガバナンスの問題を根本的に変えるのか。 193カ国が化学兵器の廃棄に合意した方法:そして人工超知能ガバナンスが学べること CWCは検証可能な在庫破壊により、ほぼ普遍的な軍縮を実現した。それがどのように構築され、人工超知能ガバナンスがそこから何を学べるかを示す。 「超知能に関する声明」の解説 2025年10月、850人以上の科学者・テックリーダー・著名人が超知能の禁止を呼びかけた。 AI安全研究所のネットワーク、解説 各国のAI安全機関が今、国際ネットワークを形成しています。活動内容、重要性、そして将来の条約を支える可能性を解説します。 人工超知能ガバナンスにおけるUN安全保障理事会の拒否権問題 UN安全保障理事会を通じたAI条約は、中国やロシアに拒否権を行使されうる。ここに構造的問題と、これまで機能してきた回避策を挙げる。 不忠実な思考連鎖、解説 モデルの書いた推論が、必ずしも答えの理由とは限らない。chain-of-thoughtが真実の説明ではなく、もっともらしい物語になり得る理由と、その意味するところ。 AIコントロール問題とは何か? スチュアート・ラッセルの再定式化 AI制御問題とは、強力なAIを人間の制御下に置くことだ。スチュアート・ラッセルによる重要な再定式化と、それがAI設計の目標をどう変えるかを解説。 イーロン・マスクはAIが悪魔を召喚すると言った。そして彼はxAIを構築した。 2014年にマスクはAIが悪魔を召喚すると警告した。2023年に彼はxAIを設立した。これは偽善ではなく、問題の構造がそれ以上のものであるということだ。 国際人工超知能ガバナンスに対する主権異議 主要な技術条約はどれも主権侵害の反発に直面してきました。核と化学のガバナンスがそれをどう解決したか、そしてAIにとっての意味をまとめます。 ブリュッセル効果:EUのルールは世界のAIを統制できるか?? ブリュッセル効果とは、EU規制が事実上の世界標準となる仕組みである。AIに適用可能か、そしてフロンティアリスクを統治するのに十分か?? AIシングルトンシナリオとは何か? AIの単一支配が危険な理由 AIシングルトン:超知能AIを恒久的に支配する一つの存在。これが最善の意図であっても破滅的である理由。 ミニラテラリズム:小規模連合が人工超知能ガバナンスを開始できるか?? 普遍的条約は時間がかかります。少数国主義は、重要な少数の国々を小さなクラブに集めます。人工超知能 ガバナンスがその形で始まる可能性が高い理由を解説します。 AIに適用された3つの産業安全手法が、モデル評価では見えないリスクを発見 AIコーディングエージェントに適用した3つの産業安全手法が、モデル評価では検出できないシステムリスクを明らかにした。ICML 2026で採択。 なぜ人間フィードバックによる強化学習はアライメントではないのか 人間フィードバックによる強化学習はAIアシスタントを役立ち、礼儀正しいものにした。それはそれらをアラインさせることとは同じではない。人間の承認で訓練することが、外見を訓練するのであって価値観を訓練するのではない理由。 AIの追従とは?? AIの追従性とは、モデルが真実ではなくあなたが聞きたいことを言うことである。文書化された行動であり、訓練の直接的な産物であり、警告でもある… AI条約への二つの道:漸進的か包括的か?? 人工超知能ガバナンスは段階的に構築すべきか、それとも包括的な条約を目指すべきか。両戦略の本当のトレードオフと、それを組み合わせる方法を解説します。 目標の誤一般化とは? AIが間違った理由で正しい答えを得るとき 目標の誤った一般化:AIは誤った理由で正しい振る舞いを学習し、世界が変わると失敗する。主要なAI安全の失敗モードを解説。 米国と中国はAI安全で合意できるか?? USと中国は競争相手だが、歴史は敵対する大国が共有する壊滅的リスクで協力できることを示している。それがAI安全に何を意味するかをここに。 AIにおける終端目標 vs 手段目標 終端目標とは、それ自体のために望まれるものだ。手段目標はそのための手段である。この区別は、なぜほぼすべてのAIが権力と…を望むようになるのかを説明する。 信頼醸成措置:AI条約前の小さなステップ 条約締結に先立ち、ライバル国は検証可能な小さな措置で信頼を築く:ホットライン、通知、透明性。これらがAIにどう機能し得るか、以下に示す。 気候変動スタイルのCOP会議は人工超知能ガバナンスに機能するか?? 超知能ガバナンスに年次COP形式の会合は機能するだろうか。気候モデルをAIに適用した場合の構造的な強みと限界。 「欺瞞的アライメントとは何か? 他の安全対策を無意味にするAI安全の問題」 欺瞞的アライメント:AIは訓練中は安全に見え、展開時に異なる目標を追求する。なぜこれが検知・防止しにくいのか。 「欺瞞的アライメントとは何か? 他の安全対策を無意味にするAI安全の問題」 欺瞞的アライメント:AIは訓練中は安全に見え、展開時に異なる目標を追求する。なぜこれが検知・防止しにくいのか。 超知能AIを封じ込められるか? AIボクシング問題の解説 AIボクシングは超知能を制御されたチャネルに隔離する。研究者たちが封じ込めが機能しないと考える理由と、それが安全に意味するところを解説する。 メサ最適化とは何か? AI安全における隠れた最適化問題 Mesa-optimization:AIの内部オプティマイザが訓練目標とは異なる目標を追求する場合。内側と外側の整合性がAI安全に意味すること。 滅亡確率とは何か? AI研究者が破滅的リスクを推定する方法 滅亡確率とは、研究者たちが壊滅的なAI結果に割り当てる確率だ。その推定値と、低確率でも期待値が重要である理由。 人工超知能ガバナンスにおける責任と帰属 AIが壊滅的な被害を引き起こした場合、誰が責任を負うのか? 責任と帰属は、あらゆるAI条約に必要な静かな基盤だ。その仕組みを解説する。 核拡散防止条約の大取引:そして人工超知能ガバナンスが学べること 核拡散防止条約は核保有国と非保有国の間で取引を成立させた。その大取引が人工超知能ガバナンスに何を教えるかを検証する.