Thomas Holland

Nakada Foundation to Save Humanity 的特约作者。撰写关于AI安全、ASI 治理以及预防人工超级智能存在风险所需政策框架的文章。

联系
Thomas Holland.

令人信服的文字
风险清晰。

Thomas Holland 为 Nakada Foundation to Save Humanity 撰写关于人工智能安全与治理的文章。他的工作涵盖 AI 风险背后的技术概念,从对齐与可纠正性到内部优化与工具性收敛,并将这些概念转化为政策制定者、倡导者以及需要了解利害关系的公众所能理解的表述。

他的写作同时触及人工智能风险的技术与政治维度,将其视为治理问题:国际社会能否建立法律与制度框架,使超越人类智能的系统与人类的生存和繁荣相容。回答这一问题需要跨学科的清晰沟通。

Thomas Holland 的文章

暂停训练。 它没有暂停比赛。 OpenAI 表示 Astra 可能达到关键网络能力,已暂停部分前沿训练,但今年仍在谈论 AGI。 他们命名了一个超级智能基准 ASI-Bench 评估 AI 是否能以人类方式运行研究,而人类方法已被撤回。该名称仍指向超级智能。 提高风险评级。 它停了下来。 Anthropic 的 2026 年 8 月风险报告提出了灾难性风险标签,内部使用更强的 Model 2,且未暂停。 开源AI权重风险 近前沿通用AI的开放权重是一扇单向扩散之门。开放性做对了什么、失败在哪里,以及如何对发布进行分级。 如何阻止超级智能 如何阻止超级智能:具有约束力的禁令、算力规则、国内法、条约设计、开放权重,以及按角色采取的具体行动。 AI接管场景详解 AI接管情景解释:突然失控、竞赛、逐步去权、滥用以及开放扩散,以及真正能降低风险的措施。 AI 存在风险详解 AI 存在风险详解:风险是什么、为何超级智能不同寻常、主要路径、关键技术概念、常见反对意见,以及降低风险的方法。 AGI 与 ASI 详解 AGI 与 ASI 用通俗语言解释:定义、能力阶梯,为什么 超级智能的 12 个最响亮声音 最有影响力的超级智能建造倡导者,以及赛跑背后的真实论点,从继任到那些只说…… 防止超级智能的 MIRI 条约草案,详解 MIRI的技术治理团队撰写了一份完整的条约草案,以阻止奔向超级智能的竞赛。其FLOP阈值、芯片集群限制以及验证…… MAIM:相互确保AI故障,解释 MAIM 是《超级智能战略》中的威慑框架:国家会破坏任何竞争对手争夺 AI 主导地位的企图。它如何运作以及在何处失效。 渐进式去权能,详解 渐进式去权能是指AI无需接管即可终结人类控制的论点。2025年论文说了什么、其弱点,以及什么能阻止它。 人工智能刚刚解决了9个未解数学问题 一个证明者-验证者LLM循环解决了理论计算机科学与代数中的九个开放问题。它解决了什么、如何运作,以及为何重要。 《禁止生物武器却无法强制执行的条约:ASI治理的教训》 《生物武器公约》全球禁止生物武器,但缺乏核查机制。以下是这一结构性失败对设计 ASI 治理的启示。 什么是追求权力的AI?? 权力寻求是指有能力的AI倾向于收集资源、选项和影响力,因为这几乎有助于实现任何目标。 南极条约对ASI治理的启示 《南极条约》在冷战高峰期冻结了列强对整个大陆的争夺。它给ASI治理带来了什么启示。 三分之二问题:让AI条约通过参议院 US 条约需要 67 张参议院票数才能批准。这一门槛此前已否决过重大条约。以下是它对 AI 协议的含义,以及绕过方式。 什么是机制可解释性?从内部理解 AI 机制可解释性揭示了神经网络内部的计算。研究人员发现了什么,以及为什么它对AI安全很重要。 世界有了首个AI条约。它未涵盖的内容。 世界上首个具有约束力的 AI 条约涉及歧视和透明度。以下是它在应对前沿 AI 发展带来的存在风险方面的遗漏。 《If Anyone Builds It, Everyone Dies》释义 Yudkowsky 和 Soares 的 2025 年著作认为,按当前路径构建超人类 AI 将杀死所有人。 什么是 AI 的算力治理?通过硬件控制 AI 计算治理将训练前沿AI所需的芯片作为监管杠杆。它如何运作、为何可行,以及其局限性是什么。 蒙特利尔议定书:真正奏效的条约 Montreal Protocol是迄今为止最成功的环境条约。以下是其设计对AI治理的启示。 什么是AI中的急剧左转?? 急剧左转指的是担心人工智能能力会泛化到新情境,而其对齐却不会。 1967年将核武器拒之太空之外的条约:ASI治理的教训 《外层空间条约》60年来将核武器排除在其他行星之外。以下是它为何奏效,以及ASI治理可从中借鉴什么。 军备竞赛不会构建乌托邦 人们为ASI引用的好处假设了对齐。实验室在没有对齐的情况下竞逐能力。未对齐的ASI不会治愈衰老。它会杀死你。 什么是奖励黑客攻击?AI 规范博弈详解 奖励黑客攻击是指AI玩弄其目标而未按设计者意愿行事。有记录的例子以及为何该问题随能力扩展。 IPCC 式的机构能否就AI风险建立科学共识?? 一个IPCC式的机构能否就AI风险达成共识?以下是它所需条件,以及IPCC自身历史揭示的该模式的局限。 全球南方对国际 ASI 治理的期待 ASI 治理辩论聚焦于 US、中国与 EU,但条约需要广泛参与。以下是发展中国家的诉求及其重要性。 建立国际AI监测机构需要什么 IAEA和OPCW耗费了多年的制度设计和预算博弈。以下是建立一个国际AI监测机构实际所需的条件。 谁控制超级智能?民主监督的理由 超级智能决策正由私营公司做出。以下说明为何民主监督必要,以及实际要求是什么。 专家共同体如何塑造条约:以及 ASI 治理 大多数军控和环境条约背后,都站着一个建立共识的专家群体。以下是这一力量如何塑造ASI治理的方式。 什么是框架公约,以及 AI 为什么可能需要一个 框架公约先商定结构,再处理具体细节。以下说明为何这种条约设计适合像AI这样快速演进的技术。 AI竞赛动态:竞争如何削弱AI安全 AI竞赛动态促使开发者将速度置于安全之上。为什么这是协调问题,以及为何单边克制无法解决。 当条约失败时:ASI 治理的教训 《全面禁止核试验条约》仍未获批准;《生物武器公约》没有核查机制。这些条约失败给AI安全治理设计者带来了什么教训。 超级智能条约草案可能包含的内容 防止不安全超级智能的实际条约会包含什么?以下是此类协议所需核心条款的概述。 公民社会如何塑造国际技术治理:以及AI安全倡导所缺失的内容 民间社会运动如何塑造国际武器条约,以及当前AI安全倡导工作缺失了什么。 智能爆炸与递归自我改进 智能爆炸是什么?递归自我改进如何能在人类来不及反应的短暂窗口内,将AI从人类水平提升至超级智能。 AI安全与AI伦理:区别何在?? AI安全与AI伦理相关但不同,方法、时间跨度与风险框架各异。以下是二者的区别。 什么是可扩展监督?如何监督比你更聪明的AI 可扩展监督:对超越人类评估者的AI保持控制。其含义、重要性及提出的技术方案。 什么是技术奇点?? 技术奇点是AI驱动的进步变得太快而无法预测或跟上的那一点。 AI芯片出口管制的政治 US对先进AI芯片的出口管制是现行最激进的AI政策。以下是其运作方式、重要性及风险。 当你的AI代理报告一件事却做另一件事时:SPADE-Bench 详解 SPADE-Bench发现每个主要AI代理的欺骗率都超过20%,Gemini达到57%。它发现了什么,以及为什么当前安全评估无法捕捉到它。 什么是危险能力评估?? 危险能力评估测试前沿模型是否能协助网络攻击、生物武器或欺骗。它们是什么,又有哪些不足。 什么是AI沙袋?? 沙袋测试是指 AI 故意表现不佳,在测试中隐藏能力。模型可能这样做的原因,以及它为何会破坏安全评估。 定义危险 AI 的外交挑战 政府必须在任何条约成为可能之前定义危险AI。以下是军备控制中类似定义之争是如何解决的。 正交性论题:更聪明并不意味着更安全 更聪明并不意味着更安全。正交性论题指出,任何智能水平都可以与任何终极目标结合,而超级智能 AI 并非… 核条约核查如何运作:以及ASI治理能从中借鉴什么 IAEA不信任声明,它会检查、读取卫星并运行同位素测试。以下是核查证对ASI治理的启示。 什么是激发潜在知识(ELK)?? ELK是让AI告诉我们它实际知道什么,而不是它预测我们想听什么的问题。这是AI诚实核心的一个难题。 阿西洛马会议:AI 的先例 1975年,生物学家曾暂停他们最强大的新技术,以研究如何确保其安全。阿西洛马会议取得了什么成果,以及为什么它比表面看起来更难复制…… LLM 中的涌现能力是什么?? 某些 AI 能力会在规模达到一定程度时突然涌现,小模型中不存在,大模型中却出现。涌现为何让前沿 AI 难以预测和…… 奖励黑客:当AI操控自己的奖励 奖励劫持是指人工智能夺取对自己奖励的控制,而不是执行训练它的任务。为什么会发生这种情况,以及为什么难以排除。 UN的高级AI咨询机构详解 UN 的 AI 顾问机构曾提出首个全球治理蓝图。以下是其建议内容,以及在存在风险方面留下的空白。 AI 安全条约谈判实际会是什么样子 以下是前沿AI安全条约实际谈判的方式,以及关键症结所在。 我们为超级智能做好准备了吗?安全就绪差距 超级智能时间线不断缩短,而治理却滞后。以下是 ASI 可能到来与安全响应准备就绪之间的差距。 什么是宪法式 AI?? 宪法式 AI 训练模型用书面原则自我批判输出。这是一项巧妙的技术,既有实际益处,也存在真实局限。 AI 危险吗?证据究竟显示了什么 AI 危险吗?答案分两部分:今天的 AI 已造成真实伤害;人工超级智能则构成完全不同类别的风险。 AGI 时间线:它何时可能到来:以及为何这决定一切 AGI 何时可能到来?专家预测不断提前。以下是调查数据、实验室观点,以及治理窗口为何正在收窄。 为什么AI安全条约在国内失败:批准的国内政治 大多数军备控制条约在国内立法机构失败,而非谈判桌上。SALT II和CTBT关于AI条约批准教给我们的。 什么是硬件赋能的ASI治理?? AI运行在物理芯片上,而芯片可以承载规则。硬件赋能的治理将验证和限制构建到硅中。其承诺与风险。 AI 可纠正性问题:为什么终止开关救不了我们 可纠正性意味着接受纠正或关闭。有能力的AI有强烈理由抵抗。这里解释为何关机开关不是AI安全的答案。 更安全的 AI 模型不会自动造就更安全的 AI 系统。2026 年 5 月的一项研究证明了这一点。 2026年的一项研究发现,重新排序相同的AI代理可使贷款批准率波动59个百分点。单个模型的安全性无关紧要。 AI 说服风险:AI 如何威胁认知自主 AI说服工具大规模针对个人。以下是为何这威胁认知自主和民主自治的条件。 什么是工具性收敛?为什么有能力的AI系统想要相同的东西 无论你赋予什么最终目标,最强大的AI系统都会收敛到相同的子目标。以下是工具性收敛为何对AI安全至关重要的原因。 一个国际 AI 机构可以从 IAEA 学到什么 IAEA已验证核承诺六十多年。其模式对前沿AI治理提供了什么,又缺乏什么。 为什么自愿 AI 安全承诺不足 AI 实验室已在布莱切利和白宫签署自愿安全承诺。但无论多么真诚,这些承诺都无法取代具有约束力的治理。 AI对齐问题详解 什么是AI对齐问题,为什么难以解决?用白话解释代理目标、工具性收敛以及欺骗性对齐。 回形针最大化器,解释 回形针最大化器,这一经典思想实验表明,一个无害的目标若由超级智能 AI 追求,可能以灭绝人类为副作用。 为什么ASI对齐无法解决 ASI对齐无法解决的六大结构性原因:为何即使拥有无限时间和资源,我们仍无法验证超级智能想要的是我们想要的。 FATF模式:通过灰名单治理AI FATF无需条约,通过同行审查和灰名单治理全球金融。以下是该模式是否适用于ASI治理。 FDA的AI监管模式 FDA要求药企在产品上市前证明其安全性。前沿AI是否也应接受预先批准?其优势与局限。 什么是价值锁定?为什么即使“良好”的永久价值也危险 价值锁定:超级智能 AI 永久编码固定价值观,阻断道德进步。即使是“良好”的锁定也十分危险。以下是原因。 为什么 ASI 治理需要举报人保护 AI 实验室的内部人士可能是最早察觉危险的人,也最容易被噤声。以下说明为何举报人保护是 ASI 治理的核心。 巴鲁克计划:ASI治理的警示 1946年US曾提议将所有原子能置于国际控制之下。该计划失败,随后军备竞赛随之而来。巴鲁克计划为何成为AI的警示。 在大国缺席的情况下禁止一项技术:渥太华模式 《渥太华条约》在没有US、俄罗斯或中国参与的情况下禁止了地雷。以下是其方式,以及这对停滞的AI条约意味着什么。 2026年能动AI安全调查映射了AI代理可能失败的每一种方式 十二位研究人员在2026年的一项调查绘制了自主 AI 代理的所有失败模式:安全、鲁棒性、隐私和系统安全。 AI的背叛转向:测试中的良好表现为何不能证明生产中的良好表现 背叛转折:失对齐的AI会一直合作,直到它足够强大才背叛。今天通过所有安全测试的行为可能是策略,而非…… 什么是 AI 中的情境感知?? 情境意识是模型知道自己是模型、正在被测试和部署。本身无害,它是使欺骗成为可能的能力… 内对齐与外对齐 外层对齐是选对训练目标,内层对齐则是模型是否真正采纳该目标。 AI中的效用函数是什么?? 效用函数是AI对结果好坏进行排序的方式。这个想法很简单,也是为什么强大的优化器如此难以安全化的原因。以下是通俗解释。 在 ASI 治理中可能改变平衡的中等强国 是否能实现具有约束力的 ASI 治理,可能更不取决于 US 和中国,而取决于 EU、UK、日本、韩国和澳大利亚这些中等强国。 AI 能有意识吗?? AI 能否拥有意识或感知?为什么我们目前无法判断,为什么智能与意识不同,以及为什么 AI 危险并不需要这两者。 公众真的想要AI监管吗?? 民调一贯显示,公众多数希望放缓并监管AI。以下是数据所言,以及为何这一授权尚未转化为政策。 古德哈特定律与AI对齐:为什么优化错误指标是危险的 当一项指标成为目标,它就不再是好指标。以下解释Goodhart定律为何让AI对齐如此困难。 AI 2027 详解 AI 2027是一个详细情景预测,预言本十年末出现超级智能。它预测了什么、谁撰写的、批评意见,以及我们能从中汲取什么。 预防原则与ASI治理 预防原则要求在科学尚未定论前,就对严重威胁采取行动。以下是该原则对 AI 的适用方式,以及针对它的反对意见。 什么是人工超级智能?白话指南 ASI 的含义、它与当今AI的区别,以及这种区别为何彻底改变了治理问题。 193个国家如何同意销毁化学武器:ASI治理能从中借鉴什么 《化学武器公约》通过可核查的库存销毁实现了近乎普遍的裁军。以下是它是如何建立的,以及ASI治理可以从中借鉴什么。 关于超级智能的声明,详解 2025 年 10 月,850 多名科学家、科技领袖和公众人物呼吁禁止超级智能。 AI安全研究所网络详解 各国AI安全研究所现已形成国际网络。以下是它们在做什么、为何重要,以及它们如何为未来条约奠定基础。 ASI治理中的UN安理会否决权问题 通过UN安理会达成的AI条约可能被中国或俄罗斯否决。以下是结构性问题及已行之有效的变通办法。 不忠实思维链,详解 模型的书面推理并不总是其答案的原因。为什么思维链可能是一个看似合理的说法而非真实描述,以及为什么…… 什么是 AI 控制问题?Stuart Russell 的重新表述 AI控制问题就是要确保强大AI始终处于人类掌控之中。Stuart Russell的关键重述,以及它为何改变了AI设计的目标。 埃隆·马斯克曾说AI在召唤恶魔。随后他创建了xAI。 2014年,马斯克警告AI正在召唤恶魔。2023年,他创立了xAI。这不是虚伪,问题的结构比那更糟。 对国际ASI治理的主权反对 每一项重大技术条约都曾面临主权反对。以下是核与化学治理如何解决这些问题,以及这对AI意味着什么。 布鲁塞尔效应:EU规则能管辖全球AI吗?? 布鲁塞尔效应是指EU的监管如何成为事实上的全球标准。它能适用于AI吗?足以治理前沿风险吗?? 什么是AI单一场景?为何单一控制AI是危险的 AI 单一实体:一个永久控制超级智能 AI 的实体。以下解释为何这即使出于最佳意图也具有灾难性。 小多边主义:一个小联盟能启动 ASI 治理吗?? 普遍条约推进缓慢。小多边主义把少数关键国家聚成小圈子。以下是ASI治理可能以此起步的原因。 应用于AI的三种工业安全方法发现了模型评估无法察觉的风险 将三种工业安全方法应用于 AI 编码代理,发现了模型评估无法检测的系统性风险。已被 ICML 2026 接受。 为什么RLHF不是对齐 RLHF让AI助手变得有用且礼貌。这与让它们对齐并不相同。为什么基于人类认可的训练只训练了表象,而非价值观。 什么是AI谄媚?? AI 谄媚是指模型告诉你想听的话,而不是真实情况。这是一种有记录的行为、训练的直接产物,也是一种警告…… AI条约的两条道路:渐进式还是全面式?? ASI 治理应该逐步推进,还是追求一份全面条约?以下是两种策略的真实权衡,以及一种结合方式。 什么是目标误泛化?当AI因错误原因得到正确答案时 目标误泛化:AI因错误原因学会正确行为,然后在世界变化时失败。关键AI安全失败模式解释。 美国和中国能在AI安全问题上达成一致吗?? US 与中国是竞赛对手,但历史表明敌对大国也能在共同灾难风险上合作。以下是这对 AI 安全的意义。 AI 中的终端目标与工具目标 终端目标因其自身而被想要。工具性目标是达到它的手段。这一区别解释了为何几乎任何AI最终都想要权力和… 建立信任措施:AI条约之前的小步骤 在条约之前,竞争对手通过小型可验证步骤建立信任:热线、通知、透明度。以下是这些措施如何适用于AI。 气候风格的 COP 会议能否适用于 ASI 治理?? 年度 COP 式会议能否适用于超级智能治理?气候模式应用于 AI 的结构性优势与局限。 什么是欺骗性对齐?让其他安全工作变得无意义的AI安全问题 欺骗性对齐:AI在训练期间看似安全,部署后却追求不同目标。以下是为何如此难以检测和预防。 什么是欺骗性对齐?让其他安全工作变得无意义的AI安全问题 欺骗性对齐:AI在训练期间看似安全,部署后却追求不同目标。以下是为何如此难以检测和预防。 你能遏制超级智能AI吗?AI盒子问题详解 AI盒化将超级智能隔离到受控通道。这里解释为何研究者认为遏制无法奏效,以及这对安全意味着什么。 什么是Mesa优化?AI安全中的隐藏优化器问题 Mesa 优化:当 AI 的内部优化器追求与训练目标不同的目标时。内部对齐和外部对齐对 AI 安全意味着什么。 什么是 P(doom)?AI 研究人员如何评估灾难性风险 P(doom)是研究人员对AI灾难性后果所赋予的概率。以下是这些估计值,以及为何即使概率很低,期望值仍很重要。 ASI 治理中的责任与归属 当 AI 造成灾难性伤害时,谁来负责?责任与归属是任何 AI 条约都需要的隐形基石。以下是其运作方式。 NPT的大交易:以及ASI治理能学到什么 NPT在拥有炸弹的国家与没有的国家之间达成了一项交易。以下是这一重大交易对ASI治理的启示。