在商用客机机型获准载客前,监管机构要求结构化的安全论证:主张、推理和证据需厚实到足以被驳回。在英国,核设施许可仍需通过核监管办公室接受的安全案例才能运行。许多医疗器械遵循相同负担。运营者不得先运行再解释。许可须在安全案例经敌对审查后方可获得。

AI安全论证借用这种形式。它是一个结构化、有证据支持的论点,证明特定系统在特定环境中训练或部署足够安全。应用于前沿模型时,它迫使构建者提出肯定性论证。其他人不再需要在任何人踩刹车前证明危险。构建者必须证明安全,否则停止。

真正的AI安全案例会包含什么

严肃的论证不止是清单。它有其形态。

  • 一项声明:该模型以这种方式使用,不会造成特定危害的不可接受风险。
  • 论证:把证据与主张联系起来的推理,包括如何处理已识别风险,以及为什么保障措施足够。
  • 证据:来自 能力评估, 红队测试、安全措施以及论证所依赖的分析。

它还必须说明假设和失效点。一个好的论证是可证伪的。它告诉审阅者结论成立需要哪些条件为真,以便审阅者检查这些条件是否实际成立。没有这一点,就是表演。

为什么这一学科有价值

把论证写下来,会暴露出自信的发布说明能掩盖的漏洞。当你必须构建明确的推理来应对风险时,风险就更难一笔带过。这种方法与其他高危领域提升安全性的方式一致:先在操作前推理风险,而非只在事后统计事故。它也契合 负责任的扩展政策, ,当跨越能力界限时,应触发足以证明下一步合理的案例。

民间异议,命名

反对声音是务实的:再给科学研究几年时间进行评估和可解释性分析,安全案例就会自然形成;现在就要求只会拖慢有用系统的开发。在这种看法中,文书工作应追踪证据,而非引领它。

在航空领域,安全论证可以依托成熟的科学、已知的故障率、已知的物理原理以及数十年的机队数据。而对于前沿模型,诚实的论证却会撞上我们目前能证明的东西实在太少。我们尚无法证明一个有能力的模型没有产生欺骗性对齐。我们无法排除那些没人想到要去测试的能力。我们也无法证明评估中的行为在实际部署中依然成立,尤其是当系统 故意低估.

对一个足够先进的模型做出严谨的安全论证,需要当前科学无法提供的保证。因此,一次诚实的尝试往往真正产出的,是清晰说明该系统为何尚无法被证明安全。当文件拒绝为缺口盖章时,它就完成了自己的工作。

安全论证的价值在于拒绝的许可权。

基金会为何支持它们

建立在安全论证基础上的治理制度,不会把“无法证明危险”当作继续推进的许可证。举证责任在建造者身上。如果建造者无法满足要求,答案不是训练下一代跳跃并心存侥幸。安全论证必须强制要求、独立评审而非自我打分,并且必须在最大规模训练运行之前完成,而非产品发布之后。

以这种形式使其具有约束力,它们就成为可用的有力工具之一。这也是它们出现在更广泛设计中的原因: 我们的计划.