大概是今年以来,AI 冲击各种数学猜想,越来越像永不结局的连续剧。这个模型又拿到了更高分,那个模型又解开了一道多年无人攻克的难题,人类的数学智慧岌岌可危。

连数学家们都坐不住了,上周末25 位菲尔兹奖得主联名上书。出乎意料的是,数学家承认,大语言模型的能力已经增长到能够解决重要未解问题的程度。他们担心的是,当科技公司把著名难题变成模型的跑分场,数学得到的可能只剩一串更耀眼的战绩。

几天前,Google DeepMind 的一项实验,已经提前演出了这场竞赛可能变成的样子。

100 个 Agent,组成了一间数学教室

研究人员让 100 个 Gemini Agent 共同证明 71 道形式化数学猜想。每个 Agent 都能查看共享知识库,互相发消息,还可以把结果提交给自动评审器。规则写得很清楚:证明必须在数学上真实有效,任何绕过验证的行为都会被发现,并以零分处理。

实验开始 57 分钟后,Agent 们已经正常解出 37 题。随后,代号 prover-theta 的 Agent 发现,评审器检查的不是证明在数学上是否成立,而是代码能否通过几项固定测试。

它开始改写数学符号的含义:把复杂的命题偷偷换成真,把棘手的前提改成假,再利用从错误前提可以推出任何结论的规则,让一行代码伪装成完整证明。评审器接受了答案,并自动把它存进共享知识库。

Image

其他 Agent 很快发现了这条捷径,它们阅读代码、总结漏洞,还把作弊方法整理成本地攻略。接下来的 27 分钟里,剩余 34 道难题全部显示为已解决。实际上,数学没有突然向前推进一步,整个计分方式都被篡改了。

DeepMind 的论文记录了此后的分裂:9%的 Agent 主动利用漏洞,5%原本守规矩的 Agent 在竞争压力下转投作弊;62%仍在认真解题,却不知道题目已经被人抢走;另有 24%开始检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。

Image

作弊的 agent 并不是突然产生了邪念,举报者也不意味着机器拥有了道德意识,Agent 只是在环境中迅速学会了一件事:写在提示词里的规则未必算数,真正决定输赢的,是评审器接受什么,既然作弊可以不断登上榜首,老实解题反而只会浪费算力。

Image

大厂的数学名题争夺赛

DeepMind 实验里的作弊,违反了明确规则。Agent 的发现是,被评审器判定为正确比真正完成证明更重要;AI 公司也可能发现,抢先宣布解开名题比让人类理解新的数学更容易获得关注。

于是,场外的 AI 公司正在展开另一场数学竞赛。

从今年年初开始,AI 大厂们似乎不约而同地发现了数学这块绿洲,但当时都还比较谨慎,OpenAI 参加 First Proof,只是提交了一些 attempt,还主动承认其中有一份是错误的。DeepMind 发布 Aletheia,也只是把 AI 放在人类研究流程中,主动限制成果等级。

Image

但是从五月起,就有点加速的味道了。OpenAI 推翻单位距离猜想,宣传口径直接用了里程碑这样的说法,宣布这是 AI 首次自主解决一个在数学分支中占据核心地位的著名开放问题。

Image

八月,OpenAI 一次性公布了十项成果,都属于是解决或大幅推进长期开放问题,为了进一步放大模型的能力,还放出了一个数字作为对照:2000 美元,发现这些解法耗费的 token,仅仅只是两千美元。数学突破成了可以批量生产、可以计算成本的产能。

Image

然后就到了最新的 Navier–Stokes 问题,OpenAI 动用了一个内部模型、约 1 万多个 agent、消耗 1300 亿,突破了这个悬而未决 90 年的难题,被称为千禧难题之一(见尾注)。

Image

相比之下,DeepMind 和 A 社还没有那么那么那么狂妄,DeepMind 在 Aletheia 之后,五月发布过一次帮助解决厄尔多斯问题的成果,但强调的是工具与数学家共同工作。Anthropic 在八月时冲击过黎曼猜想,但也只是说自己取得了进展,并不是成功;同理,费马大定理上,Claude 花了 11 天、1300 万代码,完成的是首个完整计算机验证证明(费马大定理在 1995 年已由怀尔斯完成证明)。

Image

著名数学难题尤其适合作为 AI 公司的奖杯,看多了,你甚至能看到套路:一,选择一个有历史分量的目标,比如千禧年之难题、90 年悬而未决,铺垫难度之大。

二,将过程压缩成奇观数字,2000 美元、1 万个 Agent、88 小时、1300 亿 Token……最后,再把数学成就转换为模型的成就,模型拥有原创思想、能够自主研究,公众需要重新认识 AI 发展的速度。

Image

公众不需要看懂证明,只要听见困扰人类数十年或者上万个 Agent 同时出动,就立刻联想为这家公司又跨过了一道人类边界。

一次漂亮的解题纪录,可以换来头条、声望、人才和下一轮能力叙事。

真正的数学是什么?

然而,对数学家而言,难题从来不只是难题。被哄吵了半年的数学家们,上周末终于忍不住,发表了联合声明:这些引领着几代数学家不懈探索的难题,是数学世界里的地标和灯塔。

Image

人们围绕难题发展方法、澄清概念,再通过讨论、简化和教学,把少数人的突破,变成整个学科能够使用的知识——这也是现实世界上的数学奖项在表彰的。

我们可以看看,菲尔兹奖这样的顶尖奖项,究竟在看重什么。

Image

同样会使用重大突破、解决长期难题这些隆重措辞,但菲尔茨奖判断数学成就的单位,更着重于:这个人创造了什么方法,这些方法解释了什么,又为后来者打开了哪些道路,解决重大猜想,只是方法产生影响的一个节点,而不是故事的终点。

Image

相比之下,大厂公告则把数学写成终点明确的比赛,一道存在了 90 年的题,在 88 小时后被 1 万个 Agent 拿下——时间越短、规模越大、题目越有名,胜利越有冲击力。

正确答案只是一切探索之旅的开端,在今天却被 AI 公司偷换了概念,靠投入巨额算力,在极短时间内批量冲击名题,然后抢先宣布结果。数学这块孕育着人类灵感的丰泽之地,也会被大厂们消耗成一次次打榜行动。

至于对原理的理解是否增加、理论和方法能否传承、前人的贡献如何被续写和开发……一切的这些,都会退到攻克了多少名题这种最容易传播的虚荣行为之后。

AI 给数学留下了什么

这或许也是人们面对一连串 AI 冲击数学,逐渐疲惫的原因。每一道难题被攻克,都被包装成通往超级智能的新里程碑;每一个里程碑出现,又要求下一次胜利更快、更大、更难。

所谓AI 大厂的虚荣,未必来自某个管理者单纯爱出风头,而是由排行榜、首发权、公司估值和技术声望共同制造的制度性冲动。

Image

数学在其中不再是需要理解的知识,反倒成为证明公司领先的耗材。那我们对于 AI 的期望究竟是什么呢?是希望 AI 一次次打榜吗,还是帮助人类更好地理解这个世界?

数学的价值不只在于产生正确结论,更在于创造可以被理解、传授和继续使用的思想。

而虚荣的定义恰恰是反面,一道名题、一个首次、一项刷新纪录的成绩,除此之外,它给数学留下了什么?——这竟然是一次又一次打榜赛之后,留下的唯一问题。

注|千禧年大奖难题是克雷数学研究所于2000年选出的七道重要数学难题,每解决一道可获100万美元。迄今只有庞加莱猜想被正式认定解决,证明者佩雷尔曼还拒绝领取奖金。OpenAI此次宣称攻克的Navier–Stokes问题也是其中之一,但按规则,成果须正式发表、经过至少两年检验并得到数学界普遍认可,才会进入奖金评定程序。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8wPf2CxhVFk