Open Philanthropy、80,000 Hours,以及贯穿未来人类研究所的研究脉络,做到了大多数机构仍拒绝做的事。他们把人工超级智能视为人类故事可能的终结,并为此投入了真金白银和人才。在风险本身上,他们早早行动,而且是对的。
投资组合出错之处在于接下来的推断。从“可能永久削减人类的未来”出发,主流长期主义答案变成了:资助技术对齐研究,资助ASI治理以减缓或引导前沿,并保留在系统看起来更安全时构建它们的路径。这也是他们正确指出的风险的错误计划。
为什么对齐看起来像杠杆
规模、被忽视程度和可 tractability 仍然重要。一个失调的超级智能可能影响每一个活着的人以及之后每一代人。多年来,几乎没有掌权者把这当作真实的可能性。关于目标 misspecification、欺骗和监督的技术工作,看起来像是如果强大系统无论如何都会到来时,能提高良好结果几率的少数杠杆之一。在竞争下,单方面关闭实验室看起来毫无希望。因此,负责任的组合包括对齐科学、购买时间的政策,以及在无论如何都会建造这些系统的实验室和政府内部的谨慎影响。
我接受大部分前提。 downside 是文明层面的。这个话题曾被忽视。一些针对我们仍能检查和关闭的系统的技术安全工作属于普通工程。竞争实验室和竞争国家使“一家公司退出”成为薄弱策略。这些都不是漫画式夸张,嘲笑最早认真对待风险的人是在浪费时间。
推理断裂之处
断裂在于默认目的地已固定。如果超级智能无论如何都会到来,那么唯一剩下的工作就是让它的到来少一些致命。对齐资助、评估和“负责任扩展”在这一假设下都有意义。它们成为相信无法选择终态的一代人的主要道德工程。大部分资金和声望仍流向让竞赛更安全,而非结束通往ASI的竞赛。
终点并非固定。这类终点是选择的结果。核武器、臭氧化学与人类克隆,都曾有政府决定某些终态不值得承担残余风险。超级智能应永久列入这一清单。超级智能无法被人类控制。
一旦放弃必然性假设,组合策略就会不同。用于让竞赛显得可控的稀缺安全资本,无法用于结束竞赛。仅放缓前沿以便实验室“赶上安全”的治理,仍然将构建不可控的心智视为计划。假设我们会创造后继物种然后加以束缚的对齐工作,混淆了研究项目与生存策略。
他们记对了账本,却走错了方向。
停止之后的研究,而非取而代之
我并非要求任何人烧毁这个领域。让当今系统更透明、更难被滥用或更易关闭的工作仍有意义。在通往超级智能的路径得到核实暂停后,控制强大AI的研究仍可继续,而无需将商业秒表绑在灭绝风险上。顺序才是全部论点。
失败之处在于:前沿实验室按同一日程推进的同时,却将技术对齐视为首要答案。这颠倒了问题。当你无法控制下行风险,而下行风险涉及所有人时,负责任的做法是 停止建造危险的东西. 。超级智能无法被控制。窄AI会继续发展。而那个在所有领域超越人类智能的窄类系统则不会。
同意长期主义事业优先排序ASI风险。不同意其处方是增加对齐预算并精心引导竞赛。处方是在有约束力的法律下预防:永久不创造。超级智能无法被人类控制。临时放缓以便安全追赶,是一个假设有人能在竞争压力下及时发明出控制比其创造者更聪明的mind的经验证方法的日程赌注。没有人掌握该方法。小规模没有,大规模也没有。领先实验室在公开场合也这么说。
人们常把预防归入“暂停”。暂停只是几年的喘息空间,然后继续。 这不是我们的诉求. 。我们希望各国政府阻止人工超级智能,并永久阻止。超级智能无法被控制。该条约是赛跑的出口。
资金应该用来做什么来代替
将ASI的对齐工作堆转向使“非创造”可执行的方向:条约设计与核查、可检查的芯片级算力治理、让目标保持清晰的公众论述、提高悄然能力跃升成本的举报人与透明度工作,以及让立法者听到选民而非仅听到实验室游说者的政治组织。 我已详细撰写资金重定向方案. 简短版优先。资助不建造它的决定。
长期主义因给大多数精英仍视为科幻的风险命名而赢得认可。诊断的功劳并不锁定处方。风险相同,计划不同。在法律下阻止超级智能。保留帮助人类的工具。把精心引导的神的梦想搁置在架子上,直到世界同意不在黑暗中建造一个。