过去几天,一篇名为《王的猜想》的文章刷屏了。
它原本是《广西日报》为数学家王虹写的一篇人物特稿。文章火到纸质报纸一份难求,报社不得不宣布加印,就连价格都从 1 块钱炒到了二手平台上最高 60 块一份。

图片来自:广西日报微信公众号
7 月 23 日,35 岁的王虹获得菲尔兹奖。公众最熟悉的成果,是她与数学家 Joshua Zahl 在 2025 年完成的三维挂谷猜想证明。
这道题可以从一根没有粗细的针说起:如果要让它转遍三维空间里的所有方向,至少需要多大的地方?
问题听起来像一道可以画在小学作业本上的几何题,王虹和 Zahl 给出的答案却写了整整 127 页。

感谢 Fable 付出的辛勤工作
另一边,OpenAI 的 GPT-5.6 Sol Ultra 用 3 页证明解决了延续约半个世纪的圈双覆盖猜想;Anthropic 的 Fable 5 则帮助数学家找到一个很短的反例,推翻了有 87 年历史的雅可比猜想。
社交媒体上充斥着各种 AI 超神的消息,一位数学家半夜被 Claude 惊醒、一次提示,推翻 80 年猜想。OpenAI 和 Anthropic 在你追我赶地证明,还有哪些数学猜想能被他们的旗舰模型给解决,完全沉浸在大模型无所不能的想象中。
不过,即便 AI 已经会证明复杂的数学猜想,却还想不出爱因斯坦脑中的那台电梯。

一台没有窗户的电梯悬在太空。
火箭点火,电梯开始向上加速。你松开手里的苹果,它落到脚边。站在电梯里的人无法判断,苹果掉下来是因为附近存在一颗星球,还是因为脚下的地板正在加速追上它。
1907 年,爱因斯坦从类似的思想实验中得到等效原理:在局部范围内,重力与加速度无法区分。他后来把这称为一生中最幸福的想法。

一百多年后,Google DeepMind 研究员 Tom Zahavy 把这台电梯搬到了 AI 面前。
他提出的问题是:如果只给 AI 广义相对论诞生前的知识,它能不能自己想到这台电梯,再从中提出等效原理?
Zahavy 的答案是否定的。今年 7 月,Google DeepMind 在 ICML 2026 展示了立场论文《LLMs can’t jump》。论文直截了当地提出:大模型不会完成科学发现中最关键的创造性跳跃。

论文链接:https://philsci-archive.pitt.edu/28024/1/Scientific_Invention_Position_Paper%20%2817%29.pdf
Google DeepMind 研究员 Tom Zahavy 认为,今天的大模型已经很会从数据中找规律,也正在学会沿着公理证明复杂结论,却缺少科学发明需要的第三种推理:面对一个还没有答案的问题,主动提出新的解释、新的概念,甚至换掉原来的公理。
论文给这个动作起了一个很形象的名字:Jump。
认知的三重境界
要理解为什么跳跃是大模型的局限,首先要理解人类思考和发明的底层机制。
论文借用了美国逻辑学家查尔斯·桑德斯·皮尔士(Peirce)对人类推理的三分法:

归纳(Induction): 输入 + 输出 -> 规则。从大量观测数据中寻找模式,拟合出规律。
演绎(Deduction): 规则 + 输入 -> 输出。基于既有公理和前提,进行严密的逻辑推导,确保过程无误。
溯因(Abduction): 规则 + 输出 -> 新输入(或新公理)。当遇到未知现象或旧理论失效时,凭空跳出原有框架,提出全新的假说与假设。
用更形象的比喻来描述这三种推理,可以假设我们每天从树上摘一个苹果,松手后,它每次都会掉到地上。
看过很多次以后,我们总结出苹果通常会往下掉,这叫归纳:从许多例子里找出规律。大模型从海量文字中学习哪些词、事实和现象经常一起出现,用的主要就是这类能力。
已经知道重力规律以后,我们可以提前判断,下一颗苹果松手也会落地。这叫演绎:接受一套规则,再推出它在具体情况下会带来什么结果。解数学题和写形式化证明,大多属于这个方向。
AI 依靠形式化验证工具(如 Lean)和强化学习,AI 已经能在 IMO 级别的高难度数学题中解决大多数的难题,甚至能够自动进行严密的数学证明。

某一天,你松开苹果,它却飘在空中。你开始猜测,自己所在的电梯可能正在自由下落,所以人和苹果一起失去了重量感。这叫溯因:看到一个奇怪现象,提出一个能够解释它的新假设。
于是,现阶段的 AI 能做到已有材料里找规律的归纳,以及在已有规则里推答案的演绎,但是归纳 + 演绎并不等于科学发明。 科学历史上从 0 到 1 的改变,本质上都是一次JUMP。
爱因斯坦那幅著名 E-J-A 示意图:科学家从感官经验(Experience, E)出发,必须经过一次无法被纯逻辑解释的飞跃(Jump, J),才能跳跃到全新的公理体系(Axioms, A),随后才能开展演绎(Deduction)。

由 AI 重建的爱因斯坦 E-J-A 图
这些恰恰是大语言模型无法跨越的鸿沟。
爱因斯坦不需要大数据
AI 圈长期流行着一种信仰——创造力本质上就是数据压缩。该理论认为,科学发现无非是寻找一个更简洁的程序,来压缩解释复杂的观测数据。
DeepMind 在这篇论文里用广义相对论的诞生历史打脸了这一假设。
在 1907 年至 1915 年爱因斯坦构建广义相对论期间,物理学界根本不存在需要被压缩的海量异常数据。
当时,牛顿力学在绝大多数情况下都很好用,实验也没有弹出一个醒目的报错框,要求所有人重写物理学。爱因斯坦先注意到两个看似无关的现象可能是同一回事,再把这个新假设变成可以计算、可以验证的理论。

这就是论文想说的跳:答案还没有出现以前,先换掉理解问题的前提。
论文还分析了爱因斯坦在 1913 年至 1915 年间的推导过程。当时,爱因斯坦与数学家格罗斯曼合作撰写草案,他们一度极其接近最终答案。格罗斯曼甚至已经找到了黎曼曲率张量,推导出了与现代场方程极为接近的形式。
然而,因为犯了一个致命错误,误以为该张量无法在弱场、静态情况下还原为经典的牛顿引力定律(违背了牛顿极限)。他们以为这条路通往死胡同,从而放弃了正确的几何路径,导致广义相对论的诞生被推迟了整整两年。

DeepMind 的研究员 Zahavy 承认,如果今天把爱因斯坦的物理假设作为初始条件输入给现代的 AI 定理证明系统,AI 确实有可能比爱因斯坦更快地发现这个推理漏洞,并修正证明路径。
但这依然算不上发明。 演绎(A -> S)仅仅是下游的验证过程,AI 可以根据等效原理推导出水星进动,但前提是人类必须先将等效原理作为公理喂给 AI。
大模型只会复读,永远无法真正创造?
当归纳不具备动力,演绎无法创造前提时,爱因斯坦是靠溯因完成了那个飞跃的。
1907 年,爱因斯坦构想了他一生中最幸福的思想:一个从屋顶自由下落的人,感受不到自己的重量。

这就是著名的电梯思想实验:在一个无窗的封闭电梯里,如果电梯在深空中以恒定加速度向上推进,梯内物体落下的感觉与在地球引力场中完全一模一样。
论文强调,爱因斯坦完成这一溯因飞跃,靠的不是文本,也不是符号演算,而是具身模拟。他将自己置身于那个虚拟的物理场景中,直接操控和感知空间、加速度与重力的身体感觉。
爱因斯坦曾写道:“在我的思维机制中,无论是书面语言还是口头语言,似乎都不起任何作用。”
在描述弯曲时空的语言和数学符号尚不存在时,他是将抽象符号锚定在物理感官体验中,从而完成了从感官体验到全新公理的飞跃(E -> A)。 而这刚好就是 LLM 的缺陷,中文屋与符号脱节。

LLM 本质上是一个运行在高维空间里的中文屋。它处理的是 Token 与 Token 之间的统计概率,缺乏与真实物理世界的感知互联。

论文还提到,即使是像主流的生成式视频大模型,也依然没有解决这个问题。视频模型生成一个苹果掉落,仅仅是因为训练数据集中像素变化的统计延续,而不是因为模型内部建立了真实的重力物理规则。
LLM 缺乏反事实干预的能力:它无法像人类一样,在脑海里的内部世界模型中主动剪断电梯缆绳,去干预、观察并推演反事实的物理后果。
DeepMind 这篇论文在结尾提到要让 AI 学会跳跃的关键,是将被动的视频预测升级为主动的可控模拟。
就算 AI 会跳跃了,数学界接得住吗
前几天,陶哲轩在 2026 年国际数学家大会发表了一场公众演讲,题目是《人工智能时代的数学》。

图片来自:
他没有继续争论大模型究竟能解多少题。相反,他先请听众接受一个假设:AI 很快就能以可承受的成本和一定的人类监督,完成相当一部分研究级数学任务。
然后他问,数学界追求的究竟是什么?
如果答案只是尽可能多地解决未解题,那么 OpenAI、Claude 和谷歌正在把这项指标越做越高。但陶哲轩提醒,数学研究还包括建立理论、理解世界、培养下一代,以及让不同数学家能在共同知识上继续工作。

一道题有了答案,只完成了第一步。
证明还要经过检查,被写成人能读懂的文章,接受同行评审,进入其他数学家的工作,最后沉淀进教材和整个领域公认的知识体系。陶哲轩把后面这些工作叫作证明消化。
AI 和 Lean 正在加快前面的生成与验证,后面几步却依然很慢,而且高度依赖人。同行是否愿意接受一项结果、一个领域是否认为它值得继续研究,不是再跑一次模型就能决定的。
陶哲轩担心,数学可能从证明稀缺进入证明过剩。大量 AI 证明排队等待检查;已经验证的证明等着有人讲清楚;论文多到同行评审系统接不住;即使发表了,也没人有时间把它们整理成可以继续使用的理论。

答案越来越多,理解反而可能成为新的瓶颈。
他建议数学界应该少奖励第一个解出来,多奖励验证、讲解和整理。如果作者不能清楚、准确地讲明白自己的结果,并交代相应来源,那么这项结果就不该发表。
DeepMind 关心的是,AI 能不能自己走进电梯,从一颗悬空的苹果出发,提出一套新的解释。陶哲轩追问的是:就算它做到了,谁来检查这次跳跃,谁能把它讲清楚,又有谁能判断它究竟改变了什么?
科学发现不只发生在答案生成的那一刻,它还要让其他人能够理解、质疑、使用,并从那里继续往前走。
AI 或许很快就能自己按下电梯按钮,可它还得回到黑板前,告诉所有人苹果为什么飘了起来。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8v9lXtDwidO

小同爱分享2 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享5 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享