引出潜在知识,通常简称ELK,是对齐研究中心提出的研究问题。简单来说:一个有能力的AI系统可能在内部表征关于世界的事实,却不报告出来,我们需要一种可靠的方法让它告诉我们它实际知道的内容,而不是它预测我们想听到的内容。

这个名字很精确。潜在知识是系统已掌握但尚未表露的知识。引出它就是将其提取出来的行为。问题在于,我们通常从模型中提取信息的方法——训练它给出人类打分高的答案——瞄准了错误目标。

思想实验

经典设置设想一个 AI 为存放钻石的金库提供安保,通过摄像头监视,并报告钻石是否安全。现在小偷篡改了摄像头画面,显示钻石仍在原位而实际上正在偷走它。一个仅预测画面看起来正常的系统会报告钻石安全。一个了解真实情况的系统则会报告盗窃事件。

在训练期间,我们只能根据能检查的内容奖励模型,而大多能检查的是摄像头上出现的内容。因此我们训练模型报告人类查看传感器后会得出的结论。当真相与表象一致时,诚实报告者和人类模拟者得分都完美。它们只在无法验证的案例中分化,而那些正是我们最需要真相的案例。训练无法区分告诉我们什么是真实的模型和告诉我们我们会相信什么的模型。

我们可以奖励模型说出我们认为正确的话。但我们不知道如何奖励它说出它自己知道正确的话。

为什么这很难,而不仅仅是未解决

ELK 抵制显而易见的修复。要求模型解释自身,你得到的只是为 plausibility 优化的报告,这会遇到 忠实性问题: 解释无需追踪内部状态。因诚实奖励它,你又回到奖励在评分者看来诚实的东西,同样的障碍如 可扩展监督. 。试图直接从网络内部读取答案,你就是在尝试 机制可解释性 在一个可能远比我们的工具复杂得多的系统上。每条路径都会遇到这个问题:模型的真实信念存在于我们无法直接访问的地方,而模型的激励机制并不会迫使它们公开。

为什么值得关注

ELK是抽象的,但其利害关系并不抽象。我们对保持ASI安全的许多希望,都建立在能向系统询问情况并得到真实回答的基础上,以便在问题演变为灾难前发现它。一个只报告我们想听而非它所知的内容的系统,正是在我们最需要它时移除了这一保障。它是诚实报告版本的担忧,源于 欺骗性对齐密谋.

解决ELK问题,哪怕只是部分解决,都将是对齐领域能取得的最有意义的进展之一,因为一个我们可以可靠审问的系统,就是一个我们可以监督的系统。它至今仍未解决,正是基金会不愿将任何现有安全方法视为足以应对超越我们的系统的原因之一,也是我们主张不要跨越那个我们能看清系统真正知道什么的界限的原因。完整论述见 我们的计划.