Jason Wei 及其在 Google 等地的合著者列出了性能在模型规模跨越阈值前接近随机水平、之后急剧上升的任务。多步算术、专业领域问题、训练中极少出现的语言指令、推理步骤链:这些都不是设计好的特性,而是随着模型增长而出现的。该论文称之为涌现能力。
在这种用法中,涌现能力是指较小模型不具备、较大模型才具备的能力,其转变更像开关而非平滑斜坡。低于某个规模,模型无法完成任务。超过这个规模,它就能完成。这个能力无法仅从较小系统的趋势中读出。
值得关注的真正辩论
涌现并非定论。有些研究者认为,部分报告中的跃升部分是测量伪影:苛刻的非此即彼指标会让稳定的底层进展看起来突然,而更平滑的指标则显示渐进式改进。这一批评针对具体案例,值得公平对待。
这并未消除实际问题。无论一项能力是以真正的非连续方式到来,还是以陡峭曲线形式出现且仅在跨越阈值后才被注意到,治理情境都是一样的。我们是在模型能做某事之后才得知,而非之前。对于决定下一次训练运行是否安全可批准的政策制定者而言,真正涌现与陡峭曲线之间的区别是学术性的。无论哪种情况,意外都发生在决策之后。
为什么不可预测性是核心问题
我们无法在训练更大模型之前可靠预测它将能做的全部事情。缩放定律能合理预测损失等宽泛性能指标,却无法指明哪些具体能力会出现,或何时出现。能力在总体上比在细节上更可预测。
对于大多数能力而言,这只是有趣。对于安全相关的能力而言,这令人警觉。产生意外翻译才能的同样不可预测性,也可能产生 所涵盖任务的意外才能。 危险能力评估: :网络协助、生物武器帮助、大规模操纵。无人预料的能力就是无人测试、无人构建防护的能力。
我们可以大致预测下一个模型在平均指标上的表现,却无法预测它能做到的一切。风险就藏在这个差距里。
这对我们的扩展方式意味着什么
涌现让每一次大规模跃升都变成一次进入半黑暗的步伐。你构建了一个系统,而你只有在它存在之后才能完整了解它的能力画像。到那时,如果它附带了危险能力,这个系统就已经拥有了它。这与你可以提前测量并缓解的已知风险不同。
基金会的主张由此而来。前沿扩展不应跑在理解所创造之物的能力前面。举证责任应落在证明一个大型新系统在训练和部署前是安全的,而不是事后才发现危险。当能力可能毫无预兆地到来时,跳跃前的谨慎才是唯一有用的谨慎。这个框架写在 我们的计划. 。缩短的时间线提高了风险,在 AGI 时间线.