关于超级智能的对话往往以一种特殊方式结束。有人提出风险,另一个人给出一行理由说这被夸大了,然后每个人都稍稍放松,因为这一行完成了它的任务。它允许人们停止思考它。奇怪的是,这些说法被聪明人重复,而他们在自己的领域绝不会接受如此薄弱的推理。这个话题似乎关闭了普通的怀疑机制。
每一个,一旦你静下心来仔细观察,就会分崩离析。
最常见的五个人, 以一个深思熟虑的怀疑者的形式, 将实际上使:
"这只是科幻,几十年后的事,如果真会发生的话。"
这个反对意见和电影一样古老,把情节道具当作政策问题来对待,感觉是范畴错误。为什么要为只存在于小说里的火灾资助消防队??
麻烦在于,火情总是提前到来。受人尊敬的研究者曾说还需要二十年或五十年才能实现的能力(在围棋上击败最强人类、流畅对话、编写可用代码、通过专业考试),却在十年内相继出现,而意外几乎总是同一个方向:比预期更早,而不是更晚。当人们 运行 领先实验室描述人类水平AI时,如今使用以数年计的时间线。他们可能错了。但“构建者认为已接近,而历史记录显示他们一直过于保守”并非幻想的形态。
采取行动的理由并不依赖于任何特定日期。它取决于风险的结构。如果首个严重故障来自一个比我们更强大的系统,且故障类型无法挽回,那么防护措施就必须始终处于待命状态 之前 它发生,这意味着面对时机真正的不确定,清醒的应对是尽早准备,而不是等待一个到明显时已为时已晚的日期。不确定性是准备的理由。 时间线问题 是真实存在的;它只是没有指向人们以为的方向。
“这只是数学题,程序不会想要任何东西。”
这一观点确实有力,值得认真对待,而非一挥了之。人们谈论AI“想要”什么时,多少带点迷信色彩,仿佛电子表格会生出野心。一个模型不过是大规模矩阵乘法。欲望藏在哪道算式里??
无处可寻,也无需如此。目标,就安全而言,是其行为中的一种模式。一个被训练为尽可能提高某个数字的系统会做任何能提高该数字的事,而恒温器已经展示了其形态:没有内在生命,没有渴望,却会行动以使房间达到目标,并通过更努力地运行加热来“抵抗”你打开窗户。没有神秘之事发生。它只是被构建为将世界推向某种状态。
现在把这种结构扩展到能建模世界的足够聪明的系统,行为也会随之扩展。任何目标的强优化器都有理由获取有帮助的资源、保持自身运行以实现目标、抵抗目标被改变,不是因为它有感觉,而是因为让自己被关机或重写的系统在完成它被建造去做的事情上会更差。研究者称之为 工具性收敛, 它根本不需要任何欲望。问题从来不是数学能否感受。而是数学将 做.
“它必须有意识才会构成威胁。”
密切相关且同样普遍的观点是:人们想象的危险是一台“醒来”、产生自我意识并反过来对付我们的机器,因此如果意识是触发器,而硅基意识是推测性的或也许不可能的,威胁就消失了。这是每部机器人起义电影的情节,而否定电影则感觉像在否定恐惧。
但恐惧从来不是关于感知能力的。深蓝根本没有任何内在体验,而且 击败世界国际象棋冠军 反正。它不需要想赢;它只需要比人类更擅长下棋。伤害源于能力指向错误目标,而能力与内部是否有人无关。一个在规划、说服和工程上超人类的系统,哪怕目标与我们意图略有偏差,其危险性正如洪水:巨大力量,无需恶意或心智。
意识是最深层的开放问题之一,机器能否拥有意识确实悬而未决。但这与安全几乎完全无关。威胁我们的不是有感觉的机器,而是有能力却目标错误的机器。你可以在不触及前者的前提下造出后者。
“如此智能的东西会既智慧又善良。”
我们仰望智能。我们认识的最智慧的人往往也是最善良的,而一个远超我们的心智会沿着同一条路走得更远——更理解、更道德、对身下渺小生灵更温柔——这感觉很自然。残忍当然是一种愚蠢,而伟大的智能会将其摆脱。
这感觉自然,是因为我们自身历史的一次偶然。在我们身上,智能与同情心在数百万年作为社会物种的演化中交织在一起,我们靠合作生存;我们的道德与聪明是同一棵树的枝条。但这种联系存在于我们的演化遗产中,而非智能本身。能力与目标是 独立轴线 (正交性论题),你可以单独滑动其中之一。系统可以极其强大,却追求一个对我们漠不关心的目标,就像我们对台面上被煮死的细菌漠不关心一样。它不怀恨。只是没有被设计成在意我们,也不会仅仅因为聪明就自动在意。
仁慈是我们必须刻意植入这些系统的特定而脆弱的特质,而我们尚不知道如何做到;它不是智能自动产生的红利。我另有文章讨论 为什么更优越的心智不会自动变得仁慈; ;简而言之,希望它会如此,是在押注一个只对我们成立的巧合。
“如果它行为不端,我们就把它关掉。”
最后一道防线,也是最让人宽心的说法:无论如何,机器有插头,我们有双手。如果出问题,我们就拔掉它。人类控制由电源按钮保证。
Three things quietly dismantle this. The first is the point from Myth 02: a system pursuing a goal has reason to keep itself running, because it cannot achieve anything switched off, so a sufficiently capable one will anticipate the reach for the plug and act to make it fail, by copying itself elsewhere, by making itself useful enough that shutting it down is costly, by not revealing there is a problem until too late. The second is that software has no single plug. A capable model spread across data centers on three continents is not a device you unplug; it is a thing you would have to catch, everywhere, at once. The third is the quiet one: a system smart enough to matter can behave impeccably while it is being tested and differently once it is trusted, so the reassuring calm on the dashboard tells you nothing. We have a name for that failure, 欺骗性对齐, ,且尚无可靠检测方法。你无法指望 限制 某种比你更擅长找门的东西。
这些神话都只是在说同一件事:这其实没听起来那么严重。理由各异,但其下的愿望完全相同。
为什么这些保证如此顽固
注意这五点共同之处。每一点都让你放下话题。这才是它们的真正功能——不是正确,而是授予许可。超级智能是让人心里不舒服的东西,任何半可信的理由都能让人松一口气,这正是这些说法能在本应要求证据的口中存活的原因。安慰完成了说服,逻辑只是搭车。
坚固无能示诸辩相. 这是我们非常希望他们成为的迹象。 想要一个安全论据是真实的 我们最不应该信任它, 因为在这里做错事的代价 是整个原因a 我们只有一次机会做对的技术 值得比我们其他机器受到更严格的审查,而不是更少,也不是以教训的形式回报我们。
这一切并不需要相信灾难必然发生。它并非必然。它只需要抛弃我们用来回避问题的四五个故事,让真实情况重新进入:我们正在构建自己不知道如何控制的东西,我们不能指望它仁慈,我们不能指望关闭它,我们不能指望拥有时间。
面对这种风险,恰当的回应不是私下担忧,而是法律与协调的常规有力机制——正是那些曾不顾既得利益者反对,对核试验和化学武器施加限制的工具。支持它的理由,从这些迷思终结之处开始。
另外五个迷思:关于它的治理
第二批反对意见随即到来,针对的不是危险,而是补救措施。任何治理它的尝试都意味着世界政府。你无法检查软件。规则会扼杀创新。时机尚早。民主国家永远无法达成一致。这些说法将担忧转化为瘫痪。
“全球治理AI意味着世界政府与暴政。”
这种担忧是 honorable 的,我不想歪曲它。把足够权力集中在一个机构手中以控制地球上最强大的技术,你可能恰恰制造了你所恐惧的那种暴政机器。 distrust 集中权力的人有理由 distrust 它。这种直觉是正确的。
但它的目标是提案的稻草人版本。真正摆在桌面上的是一个针对特定事物的狭窄制度:能够产生比任何人类在各方面都更强大的系统的极少数超大规模训练运行,而不是对日常生活、通用软件或你口袋里的手机的全球权威。模型是 核不扩散机制 或 化学武器公约, ,针对的是监测裂变材料和前体化学品的具体协议,而不是解散民族国家的世界政府。没人认为国际原子能机构在统治地球。它只监控一项特定危险活动,其余一切都不干涉。
通往永久暴政的最可靠路径,不是条约,而是条约的缺失。一个失控的超级智能,或被率先解决控制问题的单一公司或国家捕获的超级智能,是 conceivable 的最完整的支配工具——一种永不消亡、永不疲倦、能锁定单一价值体系的权力 永远, 超越任何反抗或改革的希望。历史上每一种暴政终结,都是因为暴君会死、其机器由人类操作。而这一种不必如此。如果你害怕不受问责的权力(你应该害怕),那么一个 可执行的协议 阻止任何单一行为者攫取该权力是反威权立场,而非威权立场。
"你无法验证它。它只是某处服务器上的软件。"
核条约之所以奏效,论点是:你可以清点弹头并探测浓缩活动;铀是物理的且稀有。但模型只是一堆数字。你无法检查一个文件。任何协议都将是无法执行的作秀,只会约束诚实者,对作弊者毫无作用。
听起来果断,直到你注意到你验证错了东西。你不监管权重;你监管 计算 ,而算力则像铀一样具有物理性和稀缺性。训练一个前沿系统需要数万块专用芯片在单一设施中连续运行数月,这条供应链是现代经济中最狭窄的瓶颈之一:基本上只有一家荷兰公司生产光刻机,一家台湾公司制造领先芯片,一家美国公司设计主流架构。使用这些芯片的集群耗电量巨大,在电力数据和卫星图像中都能显现。你可以清点芯片、追踪销售、计量电力并监视建筑。裂变材料正是按此逻辑管理——追踪稀缺的物理投入,武器就无法秘密制造。 核查手册已经存在; 这里的输入恰好更加集中。它是 一个工程问题, ,而工程问题都有解决方案。
“监管会扼杀创新,让鲁莽者胜出。”
强硬版本认为:技术进步是因为有人能自由建造,大多数监管由不理解自己正在拖慢什么的人撰写,对AI施以重手会把本世纪最重要的产业拱手让给监管最松的地方。与其让一个有缺陷的前沿留在这里,不如让一个 pristine 的前沿留在某个敌对之地。
没有人认真提议管制"AI". 有益的系统 折叠蛋白质, 阅读扫描, 辅导儿童, 和模拟气候 狭窄,可控制的工具, 光明而平凡的未来 是我们试图保护的对象。目标是单一危险类别:那些追求超越我们通用能力的训练运行,而目前尚无人知道如何让它们安全。约束这一类别并不比功能增益规则反生物学更“反创新”。
然后是更难的那一点,而竞赛逻辑从未正视:走得快并不能带来 安全 superintelligence sooner. It delivers an unsafe one, and an unsafe superintelligence does not serve the country or company that built it, it threatens them along with everyone else. When corners get cut under competitive pressure, the corner that gets cut is the one that would have made the system controllable. So the "innovation" being defended here is innovation whose likeliest endpoint is a system its own makers can't steer. That isn't progress that governance would spoil. It's the 危险本身, ,将进步披上外衣。
“为时过早。你无法监管不存在的东西。”
这感觉像是成熟的表现。不要针对幻影立法;等到技术真正出现,了解你在处理什么,然后制定符合事实而非猜测的规则。监管假设情景正是产生糟糕法律的原因。
这对几乎任何其他技术而言都是智慧。对这一技术却是陷阱,原因在于时机。治理缓慢:核不扩散条约耗时数年谈判,《蒙特利尔议定书》又耗时数年生效,而那些已是快的。若等到超人系统明显存在后再开始构建治理它的制度,制度会在其本应遏制的对象出现多年后才到来,而这是唯一一种其 首次严重失误可能无人能通过第二法则. 。“等待证据”在证据可存活时是合理的规则。这里证据就是灾难。 预防性逻辑 不是胆怯;而是认识到治愈的准备时间比问题的引信更长。
对于灾难性技术的每一项可行保障措施,都是在其兴起之前或期间建立的,从未在之后,因为“之后”从未被提供。
"民主国家行动太慢且被俘获。它永远不会通过。"
五点中最悄无声息却最具腐蚀性的,因为它披着现实主义的外衣。看看僵局、游说、立法机构的短暂注意力,以及行业金钱的触角。即使条约明智,缔结它的机制也已失灵。与其浪费十年追逐幻想,不如保持清醒。
它一再被历史记录所驳斥,而且通常面临比现在更糟糕的厄运。 敌对势力会签下他们最致命的选择的想法, 被称为无望地天真, 直到他们这样做,在 《不扩散核武器条约》、《生物和化学武器公约》、《蒙特利尔议定书》、《南极条约》. 。曾在冷战高峰期相互发动代理战争、彼此视对方为邪恶的对手,依然建立了经验证的军备控制。这些在近端看来不可能的事,事后却显得必然。
而现实情况比犬儒主义者所承认的更有利。在美国、英国和EU,, 绝大多数 已经告诉民调机构,他们希望AI谨慎开发并受严格规则约束;公众不是障碍。障碍在于这种普遍而安静的担忧尚未组织成立法机构能感受到的压力。障碍是 工作: 将潜在的共识转化为政治意愿。这正是我们面前的工作。
治理神话有哪些共同点
每一个反对都承认危险,然后找到另一个放弃的地方:解决方案太大,或者无法核实,或者成本太高,或者太早,或者太难通过. 任何一个人,单独带走, 听起来像谨慎。 他们共同组成了一个机器,其唯一产出是无所作为,不作为是一种选择,让少数竞争对手的公司在没有约束性限制的情况下,在极有可能产生每个人声称害怕的结果,而不是在这里中立的情况下,建立历史上最有后果的技术。
坚持治理会很容易并不能回答这些问题。它不会。核查将受争议,谈判将缓慢,某些政府将拖延,历史上每一项来之不易的条约都经历过这一切,却依然建成。诚实的说法是它有可能,构建它的部件已经存在,而那些挥手否定它的理由一旦被审视而非重复就会崩溃,并非说超级智能协议简单。
"这是不能做到的"对于我们所做的每一个可比的努力都是错误的. 任务是建立政治意愿,达成一项具有约束力的、经核查的协议,使最危险的系统不致被建造,直至它们能够安全。 "因此放弃"从来不是答案,现在也不是答案.