ASI治理中一个反复出现的问题是,政府历来缺乏内部专业知识来评估他们本应监管的系统。安全研究所的存在正是为了弥合这一差距。它们是政府或政府支持的机构,由技术研究人员组成,其工作是评估前沿模型的能力和风险,国家终于建立起能力去看到实验室在构建什么,而不是只听他们的话。

从2023年末的UK和US开始,各国AI安全研究所不断增多,并连接成一个国际网络。它们并不引人注目,却可能是迄今为止最重要的治理基础设施。

该网络的起源

英国在2023年11月布莱切利峰会前后宣布成立AI安全研究所,这是首个此类机构。美国随后在NIST成立了类似机构。2024年5月首尔峰会期间,包括日本、新加坡、加拿大、韩国、EU等在内的更多政府同意建立研究所,并将其连接成国际网络以协调工作。最初的两个国家机构逐渐成为合作体系的种子。

名称说明:两家创始机构已更名,UK现为AI Security Institute,US机构于2025年成为Center for AI Standards and Innovation (CAISI)。网络及其评估工作在新名称下继续。

这些研究所实际在做什么

  • 评估前沿模型。 他们测试先进系统是否具有危险能力(包括在高风险领域),开发测量模型实际能力的方法。
  • 发展评估科学。 对人工智能进行严格、标准化的测试是一个尚未解决的技术问题。这些机构正在构建可靠治理所需的方法论。
  • 向政府提供建议。 它们让各国拥有关于AI风险的独立技术判断,降低对开发者自身评估的依赖。
  • 跨境合作。 通过这一网络,各研究所共享方法、协调测试,并朝着共同标准努力,开启了可互操作的国际评估。

为什么它们对条约很重要

研究所与未来具有约束力的协议之间的联系直接且未被充分认识。每一项严肃的人工智能条约提案都依赖于评估系统是否跨越危险阈值以及核查是否遵守安全义务的能力。这种能力不会凭空出现,必须被构建出来。安全研究所正在构建的正是这一点。实际上,它们正在建设一个核查机制日后会使用的技术器官。

它们还解决了排序问题。若条约规定了评估要求,却没有独立机构能执行评估,该条约将毫无价值。通过现在(条约尚不存在时)发展这一能力,研究所确保工具在政治协议到来时已就绪。该网络是约束性治理最终得以立足的实际基础,且正在高层外交并行推进时悄然铺设。

需要坦诚面对的限制

这些研究所不能替代约束性治理,把它们当作替代品是错误的。它们获取模型通常依赖开发者的自愿合作,无法强制一家公司测试它拒绝分享的系统。它们的职权和资源在各国差异很大,网络协调仍处于萌芽阶段且不具约束力。而且评估本身在科学上仍不成熟,可靠判定一个模型是否危险确实困难,现有方法存在真实差距。

一项要求安全评估的条约如果无人能执行就是空谈。安全研究所正在打造任何真实核查机制所需的眼睛。这项工作必须在条约之前完成,而非之后。

可执行治理的基础设施

安全研究所代表从讨论AI风险转向构建衡量风险能力的转变。这一转变很重要,因为没有衡量的治理只是空谈。现实路径是让该网络成熟,通过法律授权而非善意获得前沿模型的保障访问权,在共享标准上趋同,并建立核查机制所需的独立、资源充足的评估能力。这些研究所无法独自拯救世界。但它们正在组装没有这些工具任何有约束力的条约都无法运作的仪器,而在更大协议仍在谈判时加强它们,是各国政府能做的最具体、最立即有用的事之一。