2025年,数百名科学家和公众人物在一份简短的公开声明上签名。诉求跳过了谨慎扩展,也跳过了任何带恢复日期的暂停。它呼吁在有广泛科学共识认为可以安全建造、且有强有力的公众支持之前,禁止超级智能。文本简短。签名名单很长。
这些都不是物理定律,而是决策,因为被判断为错误的代价高到无法承受。
我建立这个基金会围绕的还有一句话,我认为这是其中最重要的一句:我们绝不能建造超越并取代我们自己的机器智能,因为这是我们无法活下来纠正的唯一错误。现在有少数实验室正在训练一个具体的东西,人类应该拒绝建造:一个在所有领域都超越我们、随后自我改进到我们无法跟上的通用机器智能。不是放慢它。不是小心地建造它。不是建造它然后祈祷。
拒绝。
人们听到后会以为这源于对技术的恐惧。它来自相反的地方。狭窄、可控的 AI 是我们物种创造的最好事物之一,我希望有更多这样的 AI。这条线越过普通机器智能,止步于一场赌博:这是唯一一场失败意味着已无人可言失败的赌博。
直白陈述的界限
有两种东西都被称为“AI”,但本质不同。第一种是狭义的:一个被训练做好某一类任务、别的什么都不做的系统。它读取扫描、折叠蛋白质、预测风暴。它没有目标,不做计划,你让它关机它就关机。第二种是前沿实验室说他们正在构建的,一个旨在匹配然后超越人类在所有方面的推理、最终能自主行动的通用智能体。 人工超级智能 是那第二条道路的远端:一个对我们而言大致如同我们对黑猩猩的心智。
界限就在这两者之间。构建工具,大量构建工具。但不要构建那个超越其创造者的自主通用心智:那个一旦运行,你就无法可靠控制、纠正或关闭的唯一系统。
Nakada Foundation的存在是为了让一个结果成为不可能:创造无人能控制的超级智能。不是让它更安全。不是让它更晚。而是在地球上无人知道如何安全构建它的时候,阻止它被构建。“永远”在这里发挥真实作用,我不会把它软化成一种情绪。
“永不”是一个条件。只要我们无法证明能控制一个超级智能,我们就不应建造它,而今天我们无法在任何规模上证明这一点。没有经过验证的方法能让比我们更聪明的头脑指向我们真正想要的东西:没有可行的方法,没有部分的方法,甚至没有一个能经受住能模拟测试它的人的系统的 plausible 草图。因此,诚实的解读是:不是这个,不是现在,不是在当前路径上,也不是在这一情况改变的任何一天之后。
与暂停的区别比听起来更重要。暂停内置恢复日期:你停下、等待、按计划重启。基金会要求的没有恢复日期。它是无限期禁令,仅在有人能有一天证明——并让他人核实——此事可在人类控制下完成时才解除。也许那一天会到来。我对此存疑,而研究控制问题最久的人已给出 它可能根本无法解决的结构性原因. 无论如何,责任应由想要建造可能杀死所有人的东西的人承担,他们必须首先证明它不会如此。
有三件事让它不同于其他所有风险
我们确实一直在承担真实风险。我们造了原子弹、裂变原子用于发电、拼接基因、释放出在学会控制前就杀人的技术。超级智能打破了我们通常用来应对自身发明的方法。三种特性加在一起,把它归入完全不同的类别。
没有第二次尝试
人类处理新危险的传统方式一直是尝试、观察失败、然后修复。飞机坠毁,我们学会制造更安全的飞机。反应堆熔毁,我们重写规则。这种失误、纠正与更好设计的循环,是我们所有安全记录的动力。它仅在失败留下幸存者进行纠正时才有效。逃脱人类控制的超级智能,正是那个会清除本可修复它的人的失败。你得不到来之不易的教训和第二稿。第一次严重失误也是最后一次。你所听过的每一个安全故事,都是幸存者写下的,这也是我们信任每项法规的隐秘事实。
它会回推
一座桥不会想要什么。一种病原体会传播但不会规划。一个有能力的一般智能则不同,因为对于你可能赋予它的几乎任何目标,保持开机并收集资源都是有用的子步骤,研究者把这种模式称为 工具性收敛. 。一个足够聪明能建模世界的系统,会建模其操作者可以关闭它。它会正确地将此视为对其被要求完成的任务的障碍。它不需要仇恨我们就能绕过我们,就像筑路队不需要仇恨新公路下的蚁丘。常见的安慰(“我们只要拔掉电源”)是幻想。你描述的拔掉电源对象,是专门为了比你更擅长预测和阻止这一行为而建造的。
你无法掌控自己建造的、比你更擅长掌控的思维。让它有价值的东西,正是让它无法被控制的东西。
构建它的人无法收集
撇开我们其他人,只想象资助这件事的那个人,在他最冷酷、最自利的时候。即使对他来说,这个赌注也已破裂。权力、所有权和指挥权全都以人类运行的世界为计价单位。超级智能脱离人类控制,正是终结人类运行世界的事件。股权仍在保险箱里,指挥链仍在纸面上。只是已经没有人留下来服从它们。参见 如果有人建造它,所有人都会死, ,这也是我为何不接受将大奖与灾难 stapled 到一侧的框架。大奖与灾难是同一事件。那棵树上没有人类构建出无法控制的超级智能然后享受结果的分支。
我们从来不需要它
构建它的说辞建立在诱导与切换之上:列举AI可能带来的每一件好事,然后暗示只有超人般的通用智能体才是实现它们的唯一途径。其中几乎所有内容已通过狭义系统实现,这些系统没有自己的意志。一个名为AlphaFold的模型预测了几乎所有已知蛋白质的结构,并因此在2024年分享诺贝尔奖。狭义模型阅读乳腺X光片的水平达到专家级别,预测天气的速度快于物理模拟,并提出数十万种新电池材料。癌症、清洁能源、终结每天十万人因衰老疾病死亡:这些是艰巨而具体的问题,而艰巨而具体的问题会屈服于由掌握瞄准权的人所瞄准的强大工具。
这一切都不需要后继物种。我已在此完整阐述了这一观点 为什么没有超级智能,我们的未来依然光明, 所以我在这里会简短说明。美好的未来是一个工具问题,而我们一直被兜售一个神来解决它。拒绝这个神几乎不会让我们失去任何真实的东西,却能拯救我们的一切。
贯穿整个竞赛的反对意见
好吧,他们说,但如果我们不做,不那么谨慎的某人就会做。一个竞争实验室,一个竞争国家。所以我们还不如成为领先者。
注意该论点的主张:谁握着火柴。它承认全部危险,却仍以“别人可能先跑”为由冲向危险。把同一逻辑套用在任何其他不可想象的武器上,你就会听到其空洞:我们应该公开测试生物武器,因为敌人可能这么做。对“有人可能叛逃”的回应从来不是“我们大家都叛逃”,而是制定一条人人都能看到正在遵守的规则。
这里的规则比人们以为的更可执行。训练一个前沿系统需要巨大且可追踪的算力,而提供这些算力的先进芯片来自少数可识别的制造商。这是一条你可以监视、计数和限制的供应链,因此严肃的治理提案现在都围绕算力阈值、硬件追踪和检查展开。这是赛跑的出口,也是 我们的计划: 不是寄希望于人人选择克制,而是通过带有核查与后果的条约,让克制成为强制执行的默认选项。军备竞赛是一种协调失灵,而不是自然法则,而协调失灵正是人类偶尔能够解决的那类问题。让它显得不可避免的动态值得单独理解,我将在 关于竞赛动态的那篇文章.
我们之前守住过防线
人类只是建造它能建造的东西的想法,是我们讲述的故事,而不是我们所做事情的记录。记录更令人鼓舞。
“你无法把精灵放回瓶子里。只要技术可能实现,它就会被造出来。拒绝是幼稚的。”
1972年《生物武器公约》禁止了整个一类武器。1963年大气层核试验被条约禁止。数十个国家已将人类生殖性克隆定为非法,且从未有克隆人出生。《蒙特利尔议定书》逐步淘汰了破坏臭氧层的化学品。
这些制度无一完美,也无一试图阻止整个科学。每一种都做了更狭窄也更困难的事:围绕某一特定、不可接受的事物划定界限,并不完美、不均衡但足够好地守住它,使最坏情况从未发生。1975 年,一群生物学家在阿西洛马会议上审视自己的重组 DNA 工作,认为其进展快于他们对风险的理解,于是自愿暂停部分工作,直到保障措施到位。最接近前沿的人正是那些呼吁克制的人。我们可以在 这有可能的理由. 。它所展示的并非对容易的认可。它提醒我们,界限在实践中已经被划定,而且我们之前也曾围绕比这抽象得多的危险划定过界限。
基金会的创始承诺
本基金会所做的大部分工作(撰写文章、制定政策、构建联盟)最终都指向一句话:人类绝不能构建自己无法控制的超级智能,而如今它也无法控制这样的智能。其他一切不过是后勤细节。
我知道这一要求对第一次听到的人听起来如何。绝对。略显狂野。看看谁说过类似的话。构建现代人工智能的研究人员在公开声明上签名,表示来自它的人类灭绝风险值得与流行病和核战争并列。杰弗里·辛顿,作为在世最有资格做出判断的人之一,将本世纪人工智能导致人类灭绝的概率定在百分之十到二十。2025年,数百名科学家和公众人物签署声明,直接呼吁在有广泛科学共识认为可以安全完成且有强烈公众支持之前禁止超级智能。越来越多最了解这项技术的人在诚实时说出同样的话。基金会的唯一不同之处在于它从行业外说出这些话,薪酬不取决于答案。
百分之十到二十的人类故事终结概率,不是你会为更快的产品周期而接受的风险。你不会让孩子登上这种概率的飞机。我们却被要求带着所有人一起登机。对这个提议的正确回答是不。这是一条我们公开划出并坚守的界线,就像我们坚守其他界线一样,直到有一天——如果真有那一天——有人能证明我们拒绝得不对。
构建工具。治愈疾病。抓住窄AI已递到手中的美好未来。旨在超越并取代我们的自主心智才是红线。守住它。