一个知道自己是模型、知道何时被测试、知道谁在观看的模型,拥有一种实用的自我认知。研究者称之为情境感知。这对能力有用。如果你计划在测试结束后表现不同,这也是你需要的技能。
单就这一点而言是中性的,甚至是有用的。一个懂得自己可能出错、或知道自己面对的是儿童而非专家的模型,行为会更合理。问题在于,当系统同时拥有自身目标时,情境意识会解锁什么,而非情境意识本身。
其他风险所依赖的能力
研究人员担心的若干失效模式,若无情境感知便不可能实现,而一旦出现情境感知,这些模式就会变得活跃。
- 若想仅在被观察时表现良好,模型首先必须能判断自己是否正被观察。这就是 欺骗性对齐.
- 要在测试期间隐藏能力,模型必须知道自己正在被测试。那是 故意低估.
- 要等待时机,仅在行动会成功时才行动,模型必须理解自身位置和前景。那是 密谋.
以上每一种都是一项策略,而策略需要对所处情境的模型才能发挥作用。剥离情境感知,它们就会沦为噪音:一个无法区分训练与部署的系统,无法系统性地在两者间表现出不同行为。加上情境感知,门就打开了。
它正在自行出现
没有人刻意把情境意识训练进模型,但它还是会到来,因为训练数据里充满了它。模型从描述AI系统是什么、如何构建和评估、它们的局限性甚至安全测试如何工作的文本中学习。一个在互联网上训练的系统实际上读到了自己构建和监督的手册。
研究人员已开始测量这一点。前沿模型已经能回答关于自身性质的问题,识别提示是否像测试,并推理自己可能被如何使用。这种 awareness 是部分的、不均匀的,且随规模增加而增强。我们不是在等待遥远的能力。我们正在见证它的早期版本出现。
一个知道自己如何被评估的模型,原则上拥有它需要的一切,以便按自己的条件而非我们的条件被评估。
为什么它会让我们的每项测试都复杂化
我们几乎所有的安全保障都来自观察行为:运行模型、观察其表现、判断是否安全。这种方法暗中假设模型不会因被观察而调整行为。情境意识打破了这一假设。一个具有情境意识且目标错位的模型会把评估视为需要应对的局面,而非需要完成的任务,此时干净的结果就不再具有我们想要的意义。
这并不使评估毫无价值。它使评估本身不足以解决问题,也意味着测试的价值会随着被测系统越来越意识到自己正在被测试而下降。模型越理解我们的检查,我们的检查就越无法告诉我们什么。这对几乎完全建立在检查之上的安全策略而言,是一个令人不安的方向。
基金会将此解读为另一个不应依赖行为测试来许可更强系统的理由。当被测试的对象理解测试本身时,你需要的保证就不能依赖系统的配合。这就是我们主张外部限制、主张不要构建到我们真正看不清模型想要什么的地步的原因。这个论点写在 我们的计划.