在一次严重未遂事故后,国家运输安全委员会的调查员不会要求航空公司私下写个备注就了事。该事件会进入一个系统。调查结果的撰写方式让设计者、培训师和监管者都能据此改变行为。乘客从未听说过这个故事,却仍能从更新中受益。这种共享记忆是商用航空变得如此安全的重要原因。

人工智能事件报告试图为这一领域赋予同样的习惯:系统地记录、分享和调查系统造成伤害或接近造成伤害的案例。当模型在部署中失效、在误用下突破护栏,或在测试中表现出危险行为时,目前仍无一致的记录义务、无必须接收报告的共享平台,也无标准的调查路径。本可保护所有人的教训仍留在一家公司内部,或消失无踪。

该提案在纸面上很简单:定义伤害和接近失误的类别,要求报告至共享系统,并让整个领域共同学习一次。

一个良好系统会捕捉什么

有用的版本比头条灾难更广泛。

  • 已部署的危害,即真实世界中的系统造成损害或严重故障。
  • 险些失误,即出了问题但 narrowly 避免了伤害。航空业把这些视为与坠机同样有价值的信息。
  • 测试中发现的危险行为,包括由 浮现的失败 红队测试 和评估,因此一个实验室的危险警告能传达到其他实验室。
  • 安全事件,例如试图窃取模型权重或绕过安全措施。

报道必须结构化,并在适当处受保护。当安全调查与追责表演分离时,组织才会更诚实地披露。航空业正是因此才学会这一区分。没有它,理性选择就是保持沉默。

为什么值得去做

共享事件数据让整个领域能发现任何单一组织都看不到的模式。监管者获得基于实际出错情况而非猜测的证据基础。一个实验室的失效模式会在被发现的那一周成为所有人的警告。随着时间推移,行业会获得它至今仍缺乏的机构记忆。在ASI的治理措施中,这一条成本低、广受欢迎,且早就该做了。基金会希望它成为强制性要求。

民间异议,命名

乐观版本认为航空业证明了这一方法:持续报告、持续调查,灾难性风险就会像机体损失率一样下降。在这一观点下,事故系统是主要安全引擎,而在获得更多坠机数据前,预期性限制只是干扰。

注意引擎运行的时态。事件报告是回顾性的。它从已经发生的伤害中学习。当故障无论多么悲惨,在行业层面仍可幸存时,这一机制就能发挥作用,每一次事故都能让整个系统吸取教训。系统通过一次次事件逐步改进。

这种逻辑在基金会最关心的风险面前失效了。A 超级智能系统的灾难性失效 不是事后才召开的委员会。存在风险的核心主张是,最严重的失败可能是无法恢复、因此也无法吸取教训的那一次。事件报告能很好地处理累积的、可幸存的伤害。它在设计上无法应对不可恢复的那一次。

从失败中学习的前提是你能活下来。对于最重要的失败,这个假设本身就是问题。

它位于何处

构建系统。强制执行。保护诚实披露。然后让它远离工具箱的顶层位置。它应与文中所述的预防性限制和核查并列。 我们的计划, 它们之所以存在,正是因为有些失败无法事后处理。