奥姆里·温斯坦是一位理论计算机科学家,他会花数年时间钻研一个问题,通常一眼就能看出自己领域里的证明是真实的还是妄想。本周他表示,自己改变了对一件原本不曾料想会改变看法的事的看法。

"即使OpenAI最近的Erdős突破也未能说服我LLM能进行一般数学研究,"他发帖道。"这改变了我想法。"

改变它的是他以前的哥伦比亚大学合作者彭炳辉与陶润洲、Steven Wang和余汉涛共同构建的一条简短、几乎平淡无奇的管道。它针对九个开放问题,解决了它们。这些不是伪装成研究的练习,而是来自该领域主要会议问题列表的已发表开放问题,其中一些已有十多年历史。温斯坦说,其中一个问题曾让他夜不能寐两年。

管道如何运作

剥去框架后,方法几乎平淡无奇,这正是它引人注目的部分之一。一个阶段扮演证明者:拿到一个开放问题后,写出完整论证。另一个阶段扮演验证者,像审稿人一样阅读该论证,寻找不成立的步骤、被跳过的案例、悄然假设而未证明的引理,然后把异议反馈回去。证明者修改。循环再次运行。当验证者不再发现漏洞时,人类再介入。

证明本身由GPT-5.5 Pro生成。说明由Claude Code(运行Claude Opus 4.8)整理而成,随后由作者阅读、修正并签发。对于代数结果,团队进一步用Lean 4形式化证明,使用他们自己的自动化流程,因此证明助手(而非语言模型,也非疲于奔命的审稿人)证明每一行都成立。最后一步比听起来更重要。形式化证明是编译问题,而非品味问题。它要么编译通过,要么不通过。

九个问题

具体细节才是关键,以下是完整列表。

问题来源
打乱的 SGD 与 SS-RS-GD 不等式COLT 2021 开放问题
学习测量输出量子电路 (部分)COLT 2015 开放问题
线性回归的无权重数据选择COLT 2025 开放问题
稳健条件概率估计COLT 2010 开放问题
在线杠杆分数采样的对抗鲁棒性FOCS 2023
有限导体环与准相干环交换环理论
Cahen-Fontana-Frisch-Glaz猜想交换环理论
代数上的整数值多项式交换环理论
一个平铺互补问题Erdős 问题477

这份表格旁需要附上几点诚实的说明。量子学习的成果只是部分解法而非完整方案。这些是专业问题,仅有几十位相关研究者能读懂,并非黎曼猜想。而且每篇报告发布前都经过人工润色。这些都没有隐瞒,全都写在作者自己的说明里。但这丝毫改变不了核心事实:一台机器提出了数学思路,解决了细心的人尝试过却未能解决的问题。

为什么怀疑者改变了主意

即使@OpenAI最近的Erdős突破也没让我相信LLM能做通用数学研究。这件事改变了我看法。通过巧妙的“证明者-验证者”LLM循环,这个系统解决了理论计算机科学中9个实质性开放问题,其中一个曾让我辗转反侧两年。

Omri Weinstein

出售该技术的人的背书很廉价。这次不是。Weinstein不供职于实验室,他已经审视过近期最受关注的成果并发现其不足,而且他对结果有个人利害关系。九个问题中有一个来自他自己领域。FOCS 2023关于在线杠杆分数采样的对抗鲁棒性的问题,正好处于他工作的领域,这类问题专家一眼就能认出,并从内部知道其难度。

他与OpenAI埃尔德什事件的对比值得理解。2025年末,OpenAI工作人员称其模型破解了保罗·埃尔德什著名问题列表中的一批问题。其中大部分实为模型从文献中检索已有解法,只是某流行追踪网站曾列为开放。检索能力令人印象深刻,但并非新数学,且“突破”表述招致在职数学家的公开尖锐纠正。细心人可将此归为优秀搜索。但温斯坦无法如此归类的,是在其子领域内对一个他本人曾解答失败的问题给出的全新证明。

什么是新的,什么不是

像这样的结果很容易被过度解读,也很容易被低估解读。这两种情况都值得警惕。

过度解读是数学已被自动化。其实不然。人类选择了问题、引导了过程、检查了输出,并撰写了最终论文。模型并非某天早上醒来就决定研究打乱的SGD。整个流程只是工具,由早已知道哪些问题时机成熟的人来操控。

对任何观察AI主张十年来膨胀又收缩的人来说,低估更具诱惑力。它说:漂亮的演示,狭窄的领域,继续前进。这忽略了实际发生的事。承载这些证明的想法、构造、案例分析和不等式,来自模型。Lean和人类专家的验证确认这些想法是正确的。这是一个语言模型反复在无人解决的问题上贡献研究结果的承重部分,而非聊天机器人蒙混过口试。

为什么这出现在一个关于AI风险的网站上

从“AI能通过高难度考试”到“AI能产出专家无法完成的数学成果”,这段距离正是本基金会每篇文章都试图让人们感受到的。数学和理论计算机科学是它构建的基底,而非这项技术即将涉足的又一个领域。优化、学习理论和复杂性是下一代模型的原材料。

一个能实质性解决这些领域开放问题的系统,原则上也能为其继任者的设计出力。这个说法是 递归自我改进. 。加速研究的研究是稳定攀登与冲刺的区别,作者们已经表示他们的计划是将同一管道瞄准每个科学领域。

是否在 everywhere 都有效几乎无关紧要。方向已经确定,而且速度比当初发布时就已显得激进的预测还要快。 时间线 不断缩短,而这样的结果就是原因。 The AI 2027 情景 正是出于这个原因,将自动化AI研究置于其故事中心:一旦机器在做科学研究,时钟就会加速。

这不是反对解决开放问题的论点,而是关于速度的论点。那些正在构建这些系统的人不断公开表示,下一项能力已近在咫尺,随后它就真的出现了,而且确实很近。一个研究生周末就能跑完的流程,如今完成的工作曾是整个领域敬畏的对象。问题 基金会不断追问 是唯一随能力扩展的因素:谁决定进展速度和条件。目前答案是无人决定,而且越快越好。