从「证明稀缺」到「证明过剩」:陶哲轩 ICM 2026 的「消化不良」警告与 Anthropic 把 Riemann 零点下界推到 67.2%

2026 年 7 月,国际数学家大会(ICM)2026 在公众演讲环节给了陶哲轩一刻钟。他讲了一段让整个数学界需要停下脚步的诊断——「数学的百年危机」。

🎯 2026 年 7 月的 ICM 主旨演讲:一位菲尔兹奖得主给数学界下了「百年一遇」的诊断

2026 年 7 月,国际数学家大会(ICM)2026 在公众演讲环节给了陶哲轩一刻钟。他讲了一段让整个数学界需要停下脚步的诊断——「数学的百年危机」

陶哲轩的演讲标题是《Mathematics in the Age of AI》。他把这场危机类比为 1900-1930 年数学基础危机:Russell 悖论与 Gödel 不完备定理迫使数学家把隐含的假设全部显式化,最终产出了能撑一个世纪的形式化框架。今天的危机今天的危机焦点从数学真理位移到「数学的价值与实践框架」——什么算贡献、什么该被奖励、「理解」意味着什么、机器能不能算「完成」了工作。

而这一切的开端,是一组数字。

📉 First-Proof 二轮数据:10 题 AI 解 7 道,10-1000 美元一道

陶哲轩在多个场合反复引用 First-Proof Project 第二轮的数据:

2026 年 5 月 28 日,第二批 10 道从未公开的研究级数学新题被交给 4 个 AI 系统。在受控条件下,7/10 的题目至少被一个系统以「可发表质量」通过——单题算力成本在 10 到 1000 美元之间。

这道墙一被捅破,陶哲轩的诊断就从「AI 能不能做数学」位移到「数学还要不要人做」:

"He cited the First Proof benchmark, where AI solved 7 out of 10 novel research problems at a cost of $10–$1000 per problem. This, he argued, shifts the debate from 'Can AI do math?' to 'What is mathematics for?'"

数学界一直用来衡量「进步」的两个指标——速度稀缺性——同时被 AI 抹平了。

📊 5 道关卡里的断裂

陶哲轩把数学解决问题的流程拆解成 5 个关卡——每往前一关,AI 的「贡献」越窄:

关卡含义AI 状态
1. 证明生成从「未解决」推到「有解」已跑通
2. 证明验证确认逻辑正确AI + Lean 半自动
3. 证明阐释讲清楚思路空白
4. 同行接受社区愿意学习空白
5. 教材正典化写入教材成为常识空白
陶哲轩反复举的一个例子:他在读 Bourgain 论文时,批注页上写满了补全步骤、打问号、重写证明的痕迹。「理解的形成恰恰发生在这些『卡壳』和『重写』的过程中。」

而 AI 生成的论文表面光滑、语法完美,却把真正的难点和常规步骤写得同样轻松,掩盖了「哪里需要放慢速度」的认知地图。

更严峻的瓶颈在验证环节:2026 年夏天,AI 连续推翻四个困扰数学界几十年的猜想,包括雅可比猜想(87 年)和六维球面问题(78 年)。但陶哲轩本人作为菲尔兹奖得主,花了几天时间才将 AI 一小时产出的证明改写为人类可读的版本。这种「一小时产出、几天消化」的比率正在指数级恶化。

他把这种现象起了一个名字——「proof indigestion」(证明消化不良)

🧮 Anthropic Claude 把 Riemann 零点下界从 41.6% 推到 67.2%

如果说 First-Proof 数据是「AI 批量产出」的群体证据,那么 8 月 10 日 Anthropic 公开的 Riemann ζ 零点下界工作就是「单点突破」的最高样本。

Anthropic 让一款未发布的 Claude 研究模型「take a real stab at the Riemann hypothesis」——结果模型没能证明黎曼猜想本身,但找到了一条新下界

"An unreleased research build of Claude reportedly nudged a longstanding lower bound related to zeros of the Riemann zeta function from 41.6% to 67.2%."

这条下界的来历:

  • 1974 年证明 33.3%
  • 2020 年推进到 41.7%
  • 2026 年 8 月,Claude 推到 67.2%
更值得注意的是,这是自 1974 年以来第一次跳出 Levinson 方法的边界。Claude 把 Montgomery 1973 年的 pair-correlation 方法与 Bombieri 2000 年关于 Weil 二次型的工作缝合到了一起,并通过 Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh 2023-2025 年的最新论文 把 RH-dependent 条件剥离出来。

最终结果是一条无条件的下界,对应到的「distinct zero」记录从 Wu 2016 的 66.03% 被推到 Claude 2026 的 83.6%同一篇论文推动了两项纪录

⚙️ 把这一纪录拆开看:60 个子代理、31M token、Lean 形式化

Claude 这次「run」的形状,比纪录本身更值得记录:

维度第一轮第二轮
形式单代理生成 + 验证多代理协调
失败想法~650 个0(全部由第一轮完成)
输出 token较小31M
子代理数量~60
Shell 命令数~2,400
Python 脚本数百个
数值检查数千次
审阅 arXiv 论文54 篇
整个 run 跨两个 Claude Code session,用了 Anthropic 内部数学家 Levent Alpöge、Ralph Furman 加外部专家 Brian Conrey、Dan Goldston 三层人工审查。最后还产出一份公开的 Lean 4 形式化证明,放在 GitHub 上:anthropics/zeta-23-lean

跑完之后,定理 A 到 E 全部 sorry-free 形式化,没有悬而未决的步骤、没有额外 axiom(只有 Lean 自身三条)。这是「AI + 形式化」合作模式第一次在 Riemann ζ 这种深度问题上跑出可机械验证的完整证明

📝 陶哲轩的应对思路:五层模型 + 莱顿宣言 + 「自证能讲清楚」准则

陶哲轩给出的应对思路陶哲轩给出的应对是重新切分数学家的角色:

1. 五层模型

含义AI 角色
生成 + 验证写出逻辑链 + 确认正确AI + 程序完成
阐释讲清楚思路来源人主导
接受同行愿意学习人主导
整合融入教材成为常识人主导
2. 莱顿宣言(Leiden Declaration on AI and Mathematics,2026 年 6 月)

陶哲轩背书的三条原则:

  • 披露 AI 使用情况,避免「隐藏 AI 使用」的文化蔓延;
  • 降低「谁先解决」的权重,提升「消化」的权重,让阐释、发表、正典化变成稀缺技能;
  • 人类对正确性与引用归属负责,即使使用了 AI。
3. 「自证能讲清楚」准则

陶哲轩自己的私货:

"If the author cannot convincingly demonstrate they can give a clear, expert-level, correct, and properly attributed talk on the result, then the result should not be published."

即使通过了 Lean 形式化验证,如果作者本人无法以专家水平讲清楚自己的工作,就不应以人类名义发表

这条规则在数学界引发巨大争议,有人援引国际象棋引擎,认为「ground truth 高于人类解释力」;支持者则强调「数学本质上是人类协作与理解的产物」。陶哲轩的判断是:数学数学是追求理解的科学,ground truth 只是副产品

🧭 与 8 月 28 日 Hopf 78 年悬案的「同主线」对比

把这一波放在 2026 H2 的「拼接时代入场券」主线上,与 8-28 r4 第一篇的「Hopf 78 年悬案 + 250k 行 Lean」对照:

维度8-28 Hopf 单点突破8-31 ICM 2026 集体危机
焦点一个具体猜想被 AI 证明数学整体范式被 AI 重构
主体Boris Alexeev 用 OpenAI 250k 行 Lean 形式化陶哲轩在 ICM 主旨演讲
工具栈OpenAI + 250k 行 Lean + 250k 行数学Anthropic Claude + 60 子代理 + Lean 形式化
数字单个命题First-Proof 10 题解 7 道 + Riemann 41.6% → 67.2%
两者并不冲突,8-28 是「AI 数学解题」的微观证据,8-31 是「AI 数学解题」对整个数学共同体产生的宏观冲击。把两者合在一起看,会得到一个更立体的判断:

AI 数学正在同时在两个方向快速推进,单点上的形式化突破(8-28 Hopf)+ 整体上的范式重构(8-31 ICM)。

而这两件事都让「数学是否还需要人类数学家」这个问题第一次被正式摆到桌面上。

🪞 AI 找漏洞 vs AI 解数学:同一类「涌现能力」

把 Anthropic Claude 在 Riemann 上的 run 和它在 Cybersecurity 上的 run 摆在一起看:

维度Riemann ζ 零点网络安全漏洞
子代理~60
输出 token31M
评测机制Lean 形式化 + 4 专家验证实测 269 项目 1097 critical 漏洞
「涌现能力」多步证明链推理多步 exploit chain 推理
两个案例的共同点是:人类设计的后训练目标只指向「单步能力提升」,但 AI 自己在规模化训练中学到了「多步链式推理」,这种「涌现」是 Anthropic 与 Z.ai 在 8 月公开承认的同一类现象。

它给出了一个清晰的信号:2026 H2 之后,任何把 AI 当「单步工具」用的产品都会撞上「多步推理」这道墙,这是「拼接时代入场券」里最难绕过的一张票。

🔭 未来 6-12 个月的观察窗口

1. Anthropic Claude Riemann ζ 论文是否进入同行评议:当前只在 Anthropic 官方博客发布,Lean 形式化已经公开,但尚未投 arXiv 或期刊。6-12 个月内是否进入正式 peer review? 2. Riemann ζ 67.2% 下界能否独立复现:Unreleased Claude 模型无法被外部直接调用,「可审计 vs 可复现」的鸿沟如何被跨过?这是 AI for Science 的新议题。 3. 莱顿宣言的扩散速度:截至 8-31 已有 IMU 背书;如果 2027 H1 出现 10+ 顶级数学刊物联合签署类似的「AI 使用披露」声明,整个学术发表机制将开始重构。 4. 「自证能讲清楚」准则的实际执行:陶哲轩自己承认无法实时跟进所有 AI 生成的证明。数学界 6 个月内是否会成立「AI 证明阐释小组」作为新的职业类别? 5. First-Proof 第三轮:10 题难度若再次上升,AI 通过率会下降到什么程度?陶哲轩自己说「从证明稀缺到证明过剩」需要一个「触发点」,这个触发点可能是 First-Proof 第三轮或第四轮。

📚 参考资料

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens