最先发现危险训练运行的人通常在实验室内部,受保密协议约束,看着发布日程。举报人保护能让这些人成为预警系统,而非沉默系统。在外部检查员出现前,内部人员就是烟雾探测器。
前沿AI研究人员拥有目前任何监管者或检查员都无法比拟的优势视角,但他们常常受合同和非贬损条款约束,公开发声代价高昂甚至断送职业生涯。保护他们发出警告的能力,是ASI治理中最切实且被低估的杠杆之一。
为什么内部人士对AI如此重要
前沿 AI 有一个不寻常的透明度问题。最关键的决策——模型如何训练、接受了何种安全测试、出现了哪些令人担忧的行为、警告是否被否决——都发生在私人组织内部,外界无法看见。监管者缺乏独立观察所需的准入,往往也缺乏专业知识。在这种环境下,只有直接掌握知识的科研人员和工程师,才能在事情以最糟糕的方式公开之前发现并报告问题。
这一担忧并非假设。2024年,一群现任和前任领先AI公司员工发表公开信《有权警示先进人工智能》,指出保密协议阻碍他们提出安全担忧,并呼吁提供保护以便他们发声。这封信本身的存在就证明了问题:最接近风险的人感到在法律和职业上无法谈论它。
是什么在阻碍他们
- 限制性协议。 广义的保密与非贬损条款(有时与价值数百万美元的既得股权挂钩)可能让公开发声在经济上变得毁灭性。
- 法律风险。 Without a clear protected channel, an employee who discloses concerns risks being sued for breach of contract or trade-secret violation.
- 现行法律的空白。 传统举报人法规保护对非法活动的举报,但前沿AI中许多危险行为尚未违法,导致对合法但鲁莽开发的披露不受保护。
- 职业风险。 在一个小领域,被视为不忠的非正式代价即使在正式报复被禁止的地方也可能终结职业生涯。
有效的保护会是什么样子
受保护的披露渠道
为 AI 从业者提供合法保障渠道,使其能向监管机构或监督机构报告安全担忧,且免于责任追究,即使所披露行为本身并不违法。
限制禁言合同
限制使用保密和非贬损条款来压制善意安全担忧,以便举报危险不会让员工失去既得报酬。
反报复保障
对受保护披露提供强有力、可执行的保护,防止解雇、黑名单或其他报复,并附带切实救济措施。
接收警告的机构
一个拥有授权和专业知识、对披露采取行动而非让其消失的监督机构(监管机构或安全研究所)。
在能从外部检查实验室之前,内部人员就是我们的烟雾探测器。一部允许公司压制研究人员披露灾难性风险的法律,就是一部拆除警报的法律。
可处理,且通往更多
举报人保护在ASI治理中有一个罕见优点:它可以通过普通的国内立法实现,无需条约、无需国际共识,也无需解决门槛和核查等难题。任何拥有前沿实验室的司法管辖区都可以单方面制定这一法律,这样做将立即增强世界发现危险开发的能力。它也是通往更难治理的桥梁:受保护的披露能产生监管机构乃至最终国际核查机制所依赖的那类内部信息。建立外部核查需要数年时间,而保护那些能及时发出警告的内部人士是立法机构现在就能做到的事,并且是在条约出现前杠杆效应最高的安全措施之一。