AI Safety Instituteとは、国家安全保障と公衆安全に対するリスクを評価し、政府自身がフロンティアAIに関する専門性を構築するために設置される政府機関である。第一波は2023年の国際AIサミット周辺に集中した。現在、各研究所はSeoulおよびその後の会合で推進された国際ネットワークを通じて手法と知見を共有している。
いくつかの主要首都では今、研究所やそれに相当するものを運営している。そのほとんどは依然として危険なモデルを保留するよう命じることができない。
名称に関する注記:設立時の2つの機関は改名されている。UK機関は2025年2月にAI Security Instituteとなった。US機関は現在、NIST内のCenter for AI Standards and Innovation (CAISI)である。「AI safety institute」は依然として標準的な一般用語であり、本ガイドでも一貫して使用する。
長年、フロンティアモデルを深く理解していたのは、それを構築する企業だけでした。研究所は、政府内に独立した技術的能力を置き、公的機関が開発者のブリーフィングを最終判断として受け入れるのではなく、自らシステムを評価できるようにするための試みです。
彼らが実際にすること
彼らの研究は少数の分野に集約される。
- フロンティアモデルの危険な能力を、サイバー、生物学、自律性などの領域で、時にはリリース前にテストする。 能力評価.
- 評価の科学自体を発展させること。これらのリスクを適切に測定することは、まだ解決された手順ではなく、未解決の研究課題だからだ。
- 政府への助言——実際にシステムを検証した人々の知見が政策に反映されるように。
- 国際的に調整することで、ある国でテストされたモデルを他国で一から作り直す必要をなくし、基準の収束を促します。
これは本物の制度的進歩だ。最先端AIを理解する国家能力の構築は、それを統治するための前提条件である。評価できないものを規制することはできず、最近まで政府はほとんどできなかった。
彼らが主に欠く力
大多数のAI安全機関はテスト、アドバイス、出版が可能だ。強制できるものは少ない。モデルへのアクセスはしばしば研究室の協力に依存する。調査結果は通常、拘束力を持つのではなく情報を提供する。ほとんどの場合、機関は危険なモデルを差し止めるよう命じることはできない。これらの機関はリスクを見て対応を推奨できる。要求することはめったにない。
その評価と権限の間のギャップこそが構造的な限界だ。深刻な危険を発見しても助言しかできない機関は、政府が商業的・競争的圧力に抗して行動する意志があるかどうかにしか効果を発揮しない。現在の枠組みの多くは警告システムにすぎない。警告システムは、権力を持つ誰かが警報に応答するまで、セーフガードにはならない。
技術的能力があれば十分で、政治は後から追いつくという俗説がある。権限のない能力は、政府が悪い知らせを遅く知り、さらに遅く行動する原因になる。停止を強制できないテストは、ガバナンスの準備であってガバナンスそのものではない。
彼らがなり得ること
AI Safety Institutesの lasting な価値は、後で拘束力ある体制が依拠するものを今から集めている点にあります。独立した技術的能力、共有された基準、そして政府間の国際的チャネルです。その意味で、それらはFoundationが主張する種類の機関の初期形態です。私たちの記事「 国際監視機関 はこれがどこにつながるかを説明している。 気候変動に関する政府間パネル モデル は、共有された科学的評価が国際政策を支える方法を示している。
変えなければならないのは権限です。評価を執行につなげる必要があります。国内法で研究機関の承認を展開の条件とするか、国際枠組みで検証済みの知見に実効性を持たせるかです。これらの機関に専門性に見合った権限を与えれば、本格的なガバナンスの基盤はすでに一部できあがっています。その移行こそが 私たちの計画: 法律の下で超知能を停止させ、公共の評価能力をインフラとして位置づける。ただし禁止と検証の代替ではなく、補完として.