AI安全研究所是政府设立的机构,旨在评估前沿AI系统对国家安全和公共安全的风险,并建立国家自身对前沿AI的专业知识。第一波集中于2023年国际AI峰会。研究所现通过首尔及后续会议推动的国际网络共享方法和发现。

如今已有数个主要国家首都设立了相关机构或等效组织。其中大多数仍无法下令叫停一个危险模型。

名称说明:两家创始机构已更名。UK 机构于 2025 年 2 月更名为 AI Security Institute。US 机构现为 NIST 下的 Center for AI Standards and Innovation (CAISI)。“AI safety institute”仍是通用标准术语,本指南全程使用该表述。

多年来,唯一深入理解前沿模型的机构是那些正在构建它们的公司。研究所试图在政府内部建立独立技术能力,使公共机构能够自行评估系统,而非把开发者的简报当作最终结论。

他们实际在做什么

他们的工作集中在几个领域。

  • Testing frontier models, sometimes before release, for dangerous capabilities in domains such as cyber, biology, and autonomy, using the methods behind 能力评估.
  • 发展评估科学本身,因为良好衡量这些风险仍是一个开放的研究问题,而非既定程序。
  • 向政府提供建议,让政策由真正研究过系统的人来指导。
  • 国际协调,使在一个国家测试过的模型不必在各地从头重建,也使标准开始趋同。

这是真正的制度进步。建立国家能力以理解前沿AI是治理它的先决条件。你无法监管无法评估的东西,而直到最近,政府基本上都做不到。

他们大多缺乏的力量

大多数 AI 安全研究所可以测试、建议和发布。很少能强制执行。对模型的访问往往取决于实验室合作。发现通常提供信息而非约束。在大多数情况下,研究所无法下令扣押危险模型。这些机构能看到风险并建议应对措施,却很少能要求执行。

评估与权威之间的差距是结构性限制。一个发现严重危险却只能提出建议的研究所,其效力仅取决于政府对抗商业和竞争压力继续推进的意愿。目前的大部分架构是一个预警系统。预警系统在有人掌握权力回应警报之前,不是保障。

民间反对意见认为,技术能力就已足够,政治会随后跟上。缺乏权威的能力,正是政府迟迟得知坏消息、行动更晚的原因。无法强制叫停的测试只是治理的准备,而非治理本身。

它们可能成为什么

AI安全研究所的持久价值在于为后续有约束力的机制积累独立技术能力、共享标准与政府间国际渠道。在这个意义上,它们正是基金会所主张的那类机构的早期形态。我们关于 一个国际监测机构 描述了这可能导致的结果。The IPCC 模型 展示了共享的科学评估如何支持国际政策。

必须改变的是权威。评估必须与执行挂钩,无论是通过国内法使研究所的签字成为部署条件,还是通过国际框架赋予核查结果真实后果。赋予这些研究所与其专业知识相匹配的权力,严肃治理的大部分框架就已经部分建成。这一转变是 我们的计划: :依法停止超级智能,将公共评估能力作为基础设施,而非禁止和核查的替代。