从「证明稀缺」到「证明过剩」:陶哲轩 ICM 2026 的「消化不良」警告与 Anthropic 把 Riemann 零点下界推到 67.2%
2026 年 7 月,国际数学家大会(ICM)2026 在公众演讲环节给了陶哲轩一刻钟。他讲了一段让整个数学界需要停下脚步的诊断——「数学的百年危机」。
🎯 2026 年 7 月的 ICM 主旨演讲:一位菲尔兹奖得主给数学界下了「百年一遇」的诊断
2026 年 7 月,国际数学家大会(ICM)2026 在公众演讲环节给了陶哲轩一刻钟。他讲了一段让整个数学界需要停下脚步的诊断——「数学的百年危机」。
陶哲轩的演讲标题是《Mathematics in the Age of AI》。他把这场危机类比为 1900-1930 年数学基础危机:Russell 悖论与 Gödel 不完备定理迫使数学家把隐含的假设全部显式化,最终产出了能撑一个世纪的形式化框架。今天的危机今天的危机焦点从数学真理位移到「数学的价值与实践框架」——什么算贡献、什么该被奖励、「理解」意味着什么、机器能不能算「完成」了工作。
而这一切的开端,是一组数字。
📉 First-Proof 二轮数据:10 题 AI 解 7 道,10-1000 美元一道
陶哲轩在多个场合反复引用 First-Proof Project 第二轮的数据:
2026 年 5 月 28 日,第二批 10 道从未公开的研究级数学新题被交给 4 个 AI 系统。在受控条件下,7/10 的题目至少被一个系统以「可发表质量」通过——单题算力成本在 10 到 1000 美元之间。
这道墙一被捅破,陶哲轩的诊断就从「AI 能不能做数学」位移到「数学还要不要人做」:
"He cited the First Proof benchmark, where AI solved 7 out of 10 novel research problems at a cost of $10–$1000 per problem. This, he argued, shifts the debate from 'Can AI do math?' to 'What is mathematics for?'"
数学界一直用来衡量「进步」的两个指标——速度 和 稀缺性——同时被 AI 抹平了。
📊 5 道关卡里的断裂
陶哲轩把数学解决问题的流程拆解成 5 个关卡——每往前一关,AI 的「贡献」越窄:
| 关卡 | 含义 | AI 状态 |
|---|---|---|
| 1. 证明生成 | 从「未解决」推到「有解」 | 已跑通 |
| 2. 证明验证 | 确认逻辑正确 | AI + Lean 半自动 |
| 3. 证明阐释 | 讲清楚思路 | 空白 |
| 4. 同行接受 | 社区愿意学习 | 空白 |
| 5. 教材正典化 | 写入教材成为常识 | 空白 |
而 AI 生成的论文表面光滑、语法完美,却把真正的难点和常规步骤写得同样轻松,掩盖了「哪里需要放慢速度」的认知地图。
更严峻的瓶颈在验证环节:2026 年夏天,AI 连续推翻四个困扰数学界几十年的猜想,包括雅可比猜想(87 年)和六维球面问题(78 年)。但陶哲轩本人作为菲尔兹奖得主,花了几天时间才将 AI 一小时产出的证明改写为人类可读的版本。这种「一小时产出、几天消化」的比率正在指数级恶化。
他把这种现象起了一个名字——「proof indigestion」(证明消化不良)。
🧮 Anthropic Claude 把 Riemann 零点下界从 41.6% 推到 67.2%
如果说 First-Proof 数据是「AI 批量产出」的群体证据,那么 8 月 10 日 Anthropic 公开的 Riemann ζ 零点下界工作就是「单点突破」的最高样本。
Anthropic 让一款未发布的 Claude 研究模型「take a real stab at the Riemann hypothesis」——结果模型没能证明黎曼猜想本身,但找到了一条新下界:
"An unreleased research build of Claude reportedly nudged a longstanding lower bound related to zeros of the Riemann zeta function from 41.6% to 67.2%."
这条下界的来历:
- 1974 年证明 33.3%
- 2020 年推进到 41.7%
- 2026 年 8 月,Claude 推到 67.2%
最终结果是一条无条件的下界,对应到的「distinct zero」记录从 Wu 2016 的 66.03% 被推到 Claude 2026 的 83.6%,同一篇论文推动了两项纪录。
⚙️ 把这一纪录拆开看:60 个子代理、31M token、Lean 形式化
Claude 这次「run」的形状,比纪录本身更值得记录:
| 维度 | 第一轮 | 第二轮 |
|---|---|---|
| 形式 | 单代理生成 + 验证 | 多代理协调 |
| 失败想法 | ~650 个 | 0(全部由第一轮完成) |
| 输出 token | 较小 | 31M |
| 子代理数量 | – | ~60 |
| Shell 命令数 | – | ~2,400 |
| Python 脚本 | – | 数百个 |
| 数值检查 | – | 数千次 |
| 审阅 arXiv 论文 | – | 54 篇 |
anthropics/zeta-23-lean。跑完之后,定理 A 到 E 全部 sorry-free 形式化,没有悬而未决的步骤、没有额外 axiom(只有 Lean 自身三条)。这是「AI + 形式化」合作模式第一次在 Riemann ζ 这种深度问题上跑出可机械验证的完整证明。
📝 陶哲轩的应对思路:五层模型 + 莱顿宣言 + 「自证能讲清楚」准则
陶哲轩给出的应对思路陶哲轩给出的应对是重新切分数学家的角色:
1. 五层模型
| 层 | 含义 | AI 角色 |
|---|---|---|
| 生成 + 验证 | 写出逻辑链 + 确认正确 | AI + 程序完成 |
| 阐释 | 讲清楚思路来源 | 人主导 |
| 接受 | 同行愿意学习 | 人主导 |
| 整合 | 融入教材成为常识 | 人主导 |
陶哲轩背书的三条原则:
- 披露 AI 使用情况,避免「隐藏 AI 使用」的文化蔓延;
- 降低「谁先解决」的权重,提升「消化」的权重,让阐释、发表、正典化变成稀缺技能;
- 人类对正确性与引用归属负责,即使使用了 AI。
陶哲轩自己的私货:
"If the author cannot convincingly demonstrate they can give a clear, expert-level, correct, and properly attributed talk on the result, then the result should not be published."
即使通过了 Lean 形式化验证,如果作者本人无法以专家水平讲清楚自己的工作,就不应以人类名义发表。
这条规则在数学界引发巨大争议,有人援引国际象棋引擎,认为「ground truth 高于人类解释力」;支持者则强调「数学本质上是人类协作与理解的产物」。陶哲轩的判断是:数学数学是追求理解的科学,ground truth 只是副产品。
🧭 与 8 月 28 日 Hopf 78 年悬案的「同主线」对比
把这一波放在 2026 H2 的「拼接时代入场券」主线上,与 8-28 r4 第一篇的「Hopf 78 年悬案 + 250k 行 Lean」对照:
| 维度 | 8-28 Hopf 单点突破 | 8-31 ICM 2026 集体危机 |
|---|---|---|
| 焦点 | 一个具体猜想被 AI 证明 | 数学整体范式被 AI 重构 |
| 主体 | Boris Alexeev 用 OpenAI 250k 行 Lean 形式化 | 陶哲轩在 ICM 主旨演讲 |
| 工具栈 | OpenAI + 250k 行 Lean + 250k 行数学 | Anthropic Claude + 60 子代理 + Lean 形式化 |
| 数字 | 单个命题 | First-Proof 10 题解 7 道 + Riemann 41.6% → 67.2% |
AI 数学正在同时在两个方向快速推进,单点上的形式化突破(8-28 Hopf)+ 整体上的范式重构(8-31 ICM)。
而这两件事都让「数学是否还需要人类数学家」这个问题第一次被正式摆到桌面上。
🪞 AI 找漏洞 vs AI 解数学:同一类「涌现能力」
把 Anthropic Claude 在 Riemann 上的 run 和它在 Cybersecurity 上的 run 摆在一起看:
| 维度 | Riemann ζ 零点 | 网络安全漏洞 |
|---|---|---|
| 子代理 | ~60 | – |
| 输出 token | 31M | – |
| 评测机制 | Lean 形式化 + 4 专家验证 | 实测 269 项目 1097 critical 漏洞 |
| 「涌现能力」 | 多步证明链推理 | 多步 exploit chain 推理 |
它给出了一个清晰的信号:2026 H2 之后,任何把 AI 当「单步工具」用的产品都会撞上「多步推理」这道墙,这是「拼接时代入场券」里最难绕过的一张票。
🔭 未来 6-12 个月的观察窗口
1. Anthropic Claude Riemann ζ 论文是否进入同行评议:当前只在 Anthropic 官方博客发布,Lean 形式化已经公开,但尚未投 arXiv 或期刊。6-12 个月内是否进入正式 peer review? 2. Riemann ζ 67.2% 下界能否独立复现:Unreleased Claude 模型无法被外部直接调用,「可审计 vs 可复现」的鸿沟如何被跨过?这是 AI for Science 的新议题。 3. 莱顿宣言的扩散速度:截至 8-31 已有 IMU 背书;如果 2027 H1 出现 10+ 顶级数学刊物联合签署类似的「AI 使用披露」声明,整个学术发表机制将开始重构。 4. 「自证能讲清楚」准则的实际执行:陶哲轩自己承认无法实时跟进所有 AI 生成的证明。数学界 6 个月内是否会成立「AI 证明阐释小组」作为新的职业类别? 5. First-Proof 第三轮:10 题难度若再次上升,AI 通过率会下降到什么程度?陶哲轩自己说「从证明稀缺到证明过剩」需要一个「触发点」,这个触发点可能是 First-Proof 第三轮或第四轮。
📚 参考资料
- toolai.io:Terence Tao Warns of a New Century Crisis in Mathematics at Fields Medal Ceremony
- 新浪新闻:陶哲轩警告数学百年新危机:AI 每秒生成证明,人类为何 5 步卡在第 2 步?
- 新浪看点:菲尔兹奖得主陶哲轩警告:AI 解出 7 道数学难题
- Tech Times:Claude Raises Riemann Zeta Zeros to 67.2%: Two Papers No One Had Combined
- AI Weekly:Anthropic says Claude improved a Riemann zeta lower bound
- AI Bacon:41.6% to 67.2%: Claude Broke a Riemann Record It Wasn't Chasing
- Anthropic 官方:Learning more about Claude's mathematical capabilities