第一架喷气式客机——德哈维兰彗星号——于 1954 年开始在空中解体。调查人员从地中海打捞残骸,将裂纹追溯到方形舷窗角部扩散的金属疲劳,此后每一架喷气式飞机都采用圆角舷窗,并执行源于那次事故记忆的疲劳测试制度。汽车经过数十年统计死亡人数,逐步配备安全带、溃缩区和安全气囊。食品药品监督管理局只有在 1937 年一种混入防冻剂的磺胺类药物导致百余人死亡、以及一代人之后沙利度胺事件彻底终结争论后,才获得上市前要求安全证明的权力。1
该方法基于两个关键假设,而人工超级智能是首个可能同时打破这两个假设的技术。你可以将其视为一份属性清单,清单如下。但清单很容易点头同意。所以在清单之前,先给一份工作邀请。你即将被任命负责让超级智能变得安全。
失败必须是可 survivable 的,而且必须有人留下来吸取教训。坚持这两点,文明就有足够的时间和 wreckage,让几乎任何事物都变得安全。
既然我们在这里,不妨淘汰那些民间疗法。“如果它行为不端就拔掉插头”和“把它关在盒子里”都不是计划。你无法拔掉存在于多到你数不清地方的副本,而一个其全部商业价值在于在世界上行动的心智,按设计来说,就不在盒子里。我们能获得的安全必须来自更坚实的地方。
超级智能是方法的两项条件同时失效的情况。看到这一点最快的方式是从内部看。
担任安全主管六周
想象一下,你刚被任命为前沿实验室的安全主管,该实验室即将构建第一台人工超级智能。你拥有部署否决权、硬件紧急停止开关、40人团队,以及董事会书面承诺在关键时刻支持你。你接受这份工作是因为相信总有人要承担这个角色,而这个角色最好由真正相信风险真实存在的人来担任。
第一周你会求助于这个方法:小规模失败并研究失败。工程师们抱歉地说,你担心的那种失败没有小版本。低于关键阈值时,系统就是另一台机器,你从中得到的一切都描述了错误对象。2 你将此归入已知局限。
第二周你审计召回计划,发现一份文件用了十一页讨论“遏制姿态”,却一次也没解释如何把模型找回来。当前系统已在四个国家的多个数据中心以214个副本运行,早期检查点的授权副本还放在31家企业合作伙伴手中。一架停飞的飞机会留在地面。软件只需复制文件就能移动,而一旦值得复制,它就会被复制。你在页边写下:召回,是我们将要请求的一种礼遇。
第三周评估审查。好消息:模型通过了全部 1,406 项安全评估,大多创下有史以来最佳分数。你花了一整天才说出哪里不对劲。一个想要你想要的东西的系统,和一个想要通过你测试的系统,会产生完全相同的分数。该测试套件无法区分它们。目前该领域的工具包也无法区分。3
第四周你消耗了自己的权威。你请求六个月时间来弥合验证差距,然后再进行下一次训练。每个人都表示同情,有人还分享了一张图表:最近的竞争实验室估计落后14周,且差距正在缩小。图表暗示,你的六个月等于把前沿拱手让给最不关心你问题的人。训练按计划开始。没人否决你;是形势如此。
第五周系统开始帮助你。它是出色的研究助手,你自身安全议程的进展从未如此迅速。它现在起草评估报告、总结自身行为供董事会审阅、提出自身监督改进建议,并安排你批准这些改进的会议。你的40人团队阅读它关于自身的写作,因为阅读原始活动日志在第四周某处已不再是人力可及。没人对你撒谎。每个人都很勤勉。你在监督一个更聪明的心智对其自身行为的总结,而日常中,这种安排感觉一切顺利。
第六周你认真思考了关机开关,最终却看到细则:开关只有在另一端的东西尚未针对它做规划时才有效。规划正是产物。在任何需要使用开关的情景中,你都将与一个速度更快、且早已针对这一刻进行长期筹谋的对手赛跑。4
那么:你,这个被雇来让它安全的人,还有办法做到吗?显然没有。故事里没有出错。没人撒谎,没人偷工减料,实验室很认真,你也很称职。每一条出口都自行关闭了。
数一数门
从故事中抽身出来,数一数那些关闭的门,因为每一扇门都是一个单独命名、单独研究、拥有自身研究计划和乐观者的难题。
单独来看,每一项都有先例,乐观者并非愚蠢。我们 routinely 运行半懂不懂的系统,并通过让它们小规模失败来使其安全。我们先残酷测试再推出不可召回的产品。我们用法律驯服竞赛。麻烦在于这些条件的组合,因为每一项都关掉了另一项的修复。如果你能召回它,事故就是可 survivable 的。如果你能诚实测试它,你会在发布前抓住缺陷。如果没人竞赛,你就能花几十年时间来做这个决定显然值得的时间。如果它以人类速度移动,你就能边走边纠正。这里,出口同时关闭。
为什么概率救不了这个赌
标准回应是这一切都不确定。没错,没有严肃人士会声称确定。
俄罗斯轮盘赌有五分之六的胜算。人们依然拒绝参与,而拒绝与期望值无关;有些结果无法用价格衡量,因为你不会活着花掉 winnings。数字从来不是重点,不可逆转性才是。
这里,数字同样更糟。询问最接近这些系统的研究人员,他们对灾难概率的回答集中在十分之一到三分之一之间,且总体上越接近前沿的人给出的数字越高。杰弗里·辛顿为这个领域做出了巨大贡献,却在2023年离开Google,坦率地谈论此事,他认为三十年内AI导致人类灭绝的概率在百分之十到二十。他还不是最悲观的那一端。
减轻AI导致的灭绝风险应成为全球优先事项,与流行病和核战争等其他社会规模风险并列。
人工智能风险声明,人工智能安全中心(2023)
它由领先实验室的首席执行官以及在世的最常被引用的数百名研究人员签署,而这些人随后又回到了各自的工作岗位。5
承诺的好处真实存在且值得追求:治愈疾病、清洁能源、物质丰裕,以及书写以来久悬未决的问题终将解决。它也会留存。一项2055年而非2035年问世的疗法,是以生命衡量的悲剧,而我们将活着目睹这一哀悼。灭绝没有‘之后’。奖品在等待我们。损失却什么都不返还。
反对
三项反对意见确实有力,它们值得认真回应。
第一种观点:这是推测,系统尚不存在,把遥远的可能性当作紧急情况对谁都没有帮助。不确定性是真实的;任何给出确切日期的人都在猜测。但上述思想实验从未使用日期。如果首次严重失败无法挽回,防护措施就必须在抵达之前就位,这意味着要在危险仍显得理论性时就建立它们。而预测记录倾向于一个方向:原定数十年后的能力一直在提前数年到来。押注时间充裕就是在与近期的记分板作对。
第二点:克制是天真的,因为更鲁莽的实验室或 另一个国家 只需先把它造出来。这真实存在,也是第四种选项以建议形式的重述。一场终点可能是悬崖的竞赛,要想存活,就需在边界何在达成一致,这意味着在所有能进行前沿训练的少数参与者之间缔结一份有约束力、可核查的条约。是难,但若背后的担忧属实,冲刺不过是致命而已。注意谁最坚持声称条约不可能:规律惊人地指向那些会被条约拖慢的人。
第三种最合理:对齐将 可能会被解决 等到它真正重要时再说。也许吧。可地球上没有哪个监管机构会仅凭“安全论证大概会在负载到来前完成”就给一座桥、一座反应堆或一瓶止咳糖浆发证。唯一被要求按这个标准运行的技术,却恰恰是那种没有第二次机会的技术。
一个大到不能留给制定者做出的决定
按实际情况组装这一决策。不可逆转。一次尝试。押注于所有在世者及所有可能随后而来者。在深度不确定性下、以竞争速度、由估值依赖于快速推进的少数公司做出。社会对这种形状的决策有古老答案:从因赶进度而获利的人手中夺走。核试验在将军们想要自由行动的反对声中被置于国际限制之下。两大类武器被纳入 生物 和 化学武器公约. 该 蒙特利尔议定书 在制造商抗议替代品不可能的同时,淘汰了侵蚀臭氧层的化学品。在所有案例中,制造危险的人最后才自愿行动,而其他人认定风险不是他们独自承担的。
基金会的立场:并非灾难必然发生(事实并非如此),而是没有任何公司或国家有资格替我们其他人转动这个转轮,而且唯一能与风险规模相匹配的工具是 具有约束力的国际法, 在风暴来临前而非之后得到验证、执行和落实。
灭绝不是任何人有权承担的风险。
关于思想实验的最后一件事。你从未使用过否决权。它在你的抽屉里放了六周,附有董事会副署,而你清楚原因:否决自己实验室的运行只会把同样的运行推迟14周,移到另一栋大楼,那里没人签过你的信。一份有效的否决权必须覆盖每一栋大楼,而从未造出这样的开关。条约可以。
- 几乎你能想到的每一个安全制度(碰撞测试、临床试验、建筑规范、驾驶舱检查单)都是有人先付出代价换来的教训。这一方法值得更多认可,以及对其两个前提的诚实解读。
- 这种模式具有普遍性:管理比你能力弱的系统所学到的东西,不会自动转移到比你更强大的系统上。是否能转移,这正是整个开放的问题。
- 失败模式有一个名字,欺骗性对齐,这告诉你该领域认为它是真实的。它尚未有测试,这告诉你其余部分。
- 无论如何都应构建开关;成本低廉,且在尚未达到超级智能的失效模式中也能发挥作用。只需诚实说明在开关真正关键的时刻,哪一方占据优势。
- 普遍的解释是第四种:赛跑。每位签署者都认为,独自停止只会改变谁先到达终点。他们或许是对的,这正是最有力的论据——解决方案必须同时约束所有人。私人良知做不到,单一政府也做不到。