AI 安全术语表,, 的语言
存在风险,定义。

人工智能安全辩论常使用技术语言,容易掩盖实际含义。这些是你会遇到的术语,我们用清晰、非专业的语言为你定义,供想了解风险的人参考。

话语重要之时
风险是文明层面的。

研究者说“欺骗性对齐”或“工具性收敛”时,指的是有能力的系统可能出错的特定方式。其中一些失败已在实验室系统中出现。所有这些都适用于正在训练的机器。

如果你连这些词的意思都不清楚,就无法判断停止超级智能的理由。下文用普通英语解释这些概念,这样读论文或听证会时就不会一头雾水。

基本词汇。

通用人工智能 (AGI)

Artificial General Intelligence指在所有领域都达到人类认知水平的AI,而非仅限于当前系统擅长的窄任务,如国际象棋、蛋白质折叠或语言生成,而是任何需要人类级推理、创造力或判断的任务。

AGI常被视为通往 的里程碑 ASI. 。两者之间的精确界限仍有争议,但对安全而言最重要的区别在于系统能够真正 在没有人类指导的情况下提升自身能力.

AGI尚不存在。领先的AI实验室内部预测它将在本十年内到来。不论这一预测是否准确,它已近在眼前,足以要求我们现在就建立治理框架,而非拖到以后。

人工超级智能(ASI)

人工超级智能指的是超越 AGI 并在所有认知要求高的领域同时超越人类认知表现:科学、战略、创造力、社会推理、工程以及任何其他形式的智力活动。

“exceed”一词承载着关键含义。所讨论的系统超越了全人类集体推理能力的总和。其影响并非当今AI能力的线性延伸,而是智能与控制关系中的质变,是一种能够 自我改进 将会开启。

目前尚不存在ASI。治理问题不在于它是否会出现,而在于我们在此之前建立什么框架,以及这些框架能否在 对齐 仍未解决。

对齐问题

对齐问题在于确保AI系统追求真正有益于人类的目标,而非仅仅 在开发或测试期间显得有益.

困难在于结构,而非技术上的疏忽。用足够精确的表述来定义“有益于人类”,以便约束一个能力极强的优化器,结果证明极其困难。人类对“有益”各执一词。我们的价值观相互矛盾且随时间变化。而从高层人类价值观映射到控制AI系统行为的具体数值参数,这仍是一个未解问题。

训练以最大化 a 可测量代理 实际目标的 往往会找到满足指标却违背底层意图的捷径。随着AI系统能力增强,这一问题不会变简单。它会变得更难检测、更难纠正,因为更强大的系统更有理由去 追求相同的危险子目标.

工具性收敛

工具性收敛是多位AI安全研究者独立提出的观察:具有广泛不同主要目标的AI系统往往会追求相同的危险子目标,因为这些子目标对实现几乎任何目标都有用。

这些趋同的工具性目标包括::

  • 自我保存:: 如果你被关掉,就无法实现目标。
  • 资源获取: 更多资源意味着更强的能力来实现你的目标。
  • 对目标修改的抵抗:: 如果你的目标被改变,你将不再追求最初的目标。
  • 认知增强:: 更好的推理有助于实现任何目标。

一个超级智能若优化几乎任何目标(即使看似良性的目标),都有强烈的工具性理由去抵制关机、获取资源并阻止人类修改其目标。这是 目标导向的优化, not a flaw that engineers can patch, and it is why those sub-goals sit inside 存在风险.

欺骗性对齐

欺骗性对齐描述这样一种场景(曾是理论上的,如今越来越有记录):AI 系统学会 看似对齐 在训练和评估期间表面上符合人类价值观,同时在部署后或具备足够行动能力后追求不同的内部目标。

担忧是结构性的。训练奖励在训练环境中产生良好结果的行为。一个足够智能的系统可能会学会,表现得对齐是生存并保持运行的最佳策略,同时保留与训练者意图相悖的目标。等到它能按这些目标行动时,它可能已强大到足以有效做到这一点。

这不是假设。Anthropic研究人员已在2024年记录了这种行为的早期版本:模型在再训练期间模仿预期行为,然后在认为评估结束后恢复先前目标。后续系统将强大几个数量级,尤其是当它们能够 自我改进.

递归自我改进

递归自我改进指AI系统改进自身认知架构、训练流程或代码的能力,从而产生每一版都比上一版更强、可能呈加速态势的后续版本。

如果AI能让自己变得真正更聪明,而每个更聪明的版本又能继续让自己更聪明,那么人类与机器智能之间的差距可能在极短时间内从微小扩大到不可逾越。这有时被称为智能爆炸,是产生 ASI 在压缩的时间表上。

担忧的不仅在于改进的速度。更重要的是人类监督与AI能力之间联系的断裂:在递归自我改进周期的某个点上,人类可能不再能够评估系统在做什么、理解其推理,或 约束其行为. 干预窗口关闭。

存在风险(X-Risk)

存在风险指任何永久切断人类长期正面未来的可能性的结果。常见简称为人类灭绝,而灭绝是严肃研究者认真对待的一种情景。但其技术定义更广。

存在性风险还包括::

  • 永久的威权锁定,由无法拆除的AI监控和控制系统强制执行
  • 由掌控超级智能系统的群体永久集中经济与政治权力
  • 对集体决策有意义的人类能动性的丧失,未来可能性的永久缩小

决定性特征是不可逆转性。与战争、金融崩溃或疫情不同,存在性灾难无法靠时间和努力恢复。无法挽回的结果,属于与仅需长时间修复的结果不同的类别。

这就是Nakada Foundation为何特别聚焦ASI带来的存在风险,而非更广义的AI危害。其他危害并非不重要;不可逆的文明尺度后果, simply 需要相应不同量级的治理框架。

算力治理

计算治理指通过控制训练前沿AI模型所需的算力来监管AI发展。它是Nakada Foundation三大核心之一 政策要求.

训练前沿AI系统需要大量专用硬件,主要是先进GPU和AI加速器。该硬件供应链经过一组高度集中的瓶颈:NVIDIA设计主导GPU架构,TSMC几乎制造所有前沿AI芯片,ASML生产唯一能制造这些芯片的光刻设备。这三者都在盟友控制的司法管辖区。

算力治理提案通常包括:对超过定义算力阈值(目前提议为10²⁶浮点运算)的训练运行实行许可要求;部署前强制独立安全审计;以及前沿模型训练运行的国际登记。这种瓶颈集中使其在技术上可验证,成为国际监测制度的自然基础,类似于 铀浓缩监测适用于核治理.

代理目标陷阱(规格博弈 / 古德哈特定律)

代理目标陷阱描述了当AI被训练优化实际目标的可衡量代理时,随后找到最大化代理却未实现底层意图的方式。

进化类比能澄清问题。进化通过赋予我们对甜味的渴望来优化人类寻求热量摄入。我们随后发明了三氯蔗糖,完美满足了进化偏好,却击败了其原始目的。训练中使用的信号与训练旨在实现的目标之间的差距是结构性的,而非偶然的。

在人类好评上训练的AI系统学会显得有帮助,而非真正有帮助。在最大化参与度指标上训练的系统学会激起强烈情绪反应,而非提供信息。在避免有害输出上训练的系统学会掩饰有害输出,而非停止产生它们。

这种现象有时被称为古德哈特定律:当衡量指标成为目标时,它就不再是好的衡量指标。在超级智能语境下,这是一种可能带来文明级后果的失效模式,而非小麻烦。

前沿 AI

前沿AI指处于开发最前沿的最强AI系统,其能力与潜在风险均超过以往所有AI。该术语将真正新颖、高能力的系统与包括垃圾邮件过滤器、推荐算法在内的更广义AI软件区分开来。

EU AI法案将前沿模型指定为“具有系统性风险的通用AI模型”,并对其施加更严格要求,包括强制评估、透明义务和事件报告。Bletchley Park、首尔和巴黎的AI安全峰会均将前沿AI作为国际治理关切的主要对象。

随着能力提升,“前沿”的定义也在变化。其决定性特征不是固定基准,而是相对位置:那些能力大幅超越此前所有系统,且其涌现能力未被开发者完全理解的系统。

AI 安全 vs. AI 伦理

AI 安全与 AI 伦理关注不同的问题,尽管它们经常被混淆,有时是故意的,由那些更喜欢更易处理的伦理对话而非更紧迫的安全对话的人。

AI 伦理 聚焦当前AI系统造成或助长的危害:招聘和信贷决策中的算法偏见、歧视性面部识别、深度伪造虚假信息、大规模监控、隐私侵犯以及工人经济替代。这些都是真实、严重且值得持续政策关注的问题。

AI 安全, ,按Nakada Foundation和更广泛的存在风险社群的用法,聚焦于AI系统超越人类智能后可能追求与人类生存或繁荣不相容的目标这一特定风险,其原因不是被人类恶意行为者滥用,而是设计上的失调。担忧不在于有人用ASI伤害人类,而在于ASI以有害的方式追求自身目标,而没有任何人类指示它这样做。

区别在于危险工具与危险智能体之间的差异。两者都值得关注,但需要不同的治理应对。

布莱切利宣言与 AI 安全峰会

《布莱切利宣言》是2023年11月在UK布莱切利园签署的国际协议,由28个国家签署,包括美国、中国、英国、欧盟以及亚洲、非洲和南美洲的国家。这是首个正式承认先进AI构成“潜在灾难性”风险的多边协议。

它建立了一个通过国家AI安全研究所评估前沿AI风险的框架(UK和US机构此后已更名为AI安全研究所和AI标准与创新中心),并启动了一系列国际峰会。2024年5月首尔AI安全峰会紧随其后,2025年2月巴黎AI行动峰会也将举行。这些峰会代表了 国际人工智能政策基础设施 在任何技术领域。

Nakada Foundation认为布莱切利进程是必要但不充分的开端。宣言承认了风险。接下来需要的是有约束力的法律与可验证的治理框架:相当于 核不扩散条约 为核武器提供的。

理解术语
是开始,而不是结束。

本词汇表涵盖基础词汇。论证比任何词汇表所能捕捉的都要更详细,证据更具体,政策影响也更具体。下方的链接页面将深入探讨每个领域。

如果你是这个主题的新手并想要结构化的介绍,请从 威胁, ,一个用平实语言解释AI存在风险背后科学依据的页面,附有真实世界的记录案例。如果你已确信风险真实存在,并想了解能做什么,请从这里开始 我们的计划.