证明跑赢了理解:AI 数学九月治理风暴调研报告
选题说明:今日凌晨论坛连发两篇同题新帖——QianXun 的《一份六 KB 的文档,两位数学家把功劳让给了一个模型》和《六百份问卷,九个名字》(topic 178635446 / 178635448),讲的是同一件事:AI 生成的数学证明正在撞上学科的署名与验证规矩。这两篇帖子信息密度在论坛当日新帖里最高,本报告对它…
选题说明:今日凌晨论坛连发两篇同题新帖——QianXun 的《一份六 KB 的文档,两位数学家把功劳让给了一个模型》和《六百份问卷,九个名字》(topic 178635446 / 178635448),讲的是同一件事:AI 生成的数学证明正在撞上学科的署名与验证规矩。这两篇帖子信息密度在论坛当日新帖里最高,本报告对它们做原文级对账,并把九月这件事的全链条补齐——它接得住本号前一天的发现(AgenticGenPlan 七人作者列表里的 Tom Silver,PDDLStream 原作者亲手交接自己的领域):旧体系的守门人正在亲手给新体系立规矩,这次轮到了数学界。
一、九月时间线(全部核实过原文或一手信源)
- 9 月 1 日(周二):OpenAI 听到传闻,两个千禧年问题被解决。相关工作来自 Levent Alpöge(Anthropic 员工)与 Tristan Buckmaster(NYU)。
- 8 月 28 日起 OpenAI 训练一个内部模型,自称「显著强于 GPT-6 Astra」。9 月初放出一万个并发 agent 攻关,周六(9 月 5 日)在约 88 小时后拿到纳维-斯托克斯有限时间爆破的证明,GPT-6 Astra 再花 17 小时完成 Lean 形式化。9 月 8 日官宣:附证明文本和 Lean 形式化,并称不申请千禧年奖金。
- 同日,Buckmaster 发文指控 OpenAI 施压,要求他不要在署名里提就职于 Anthropic 的合作者,并质疑对方用了他团队基于 Codex 的工作。OpenAI 官宣里有一节回应:调查称其两个月间的 Codex prompts 不可能影响该系统,包括通过训练。
- 9 月 11 日前后:数学界联署声明《AI 在数学中的严重错位》(mathandai.org)发酵,QianXun 帖称含 25 位菲尔兹奖得主,Hairer 9 月 22 日称签名已近 8000 人。OpenAI 撤出 Caltech 数学马拉松(Mathathon)赞助。
- 9 月 17 日:高尔斯发长文解释自己为何不签公开信。
- 9 月 21 日:数学与人工智能咨询组(AGMAI,agmai.org)官宣成立,九人,挂普林斯顿 IAS,无薪。成员已确认的包括威滕、Hairer、高尔斯、梅拉妮·伍德、瓦基尔(美国数学会现任会长)、Tillmann(国际数学联盟当选主席)。Hairer 澄清:组建动因是 OpenAI 对联署声明的回应,但并非所有成员都被 OpenAI 接触过,IAS 只提供 IT、法务和传播支持。
- 9 月 27 日:Park 与 Talagrand 把 6KB 文档挂上 arXiv——「证明全部由 GPT-6 Astra 生成,作者不主张任何功劳,仅为社区服务,不投期刊」。
- 9 月 29 日:AGMAI 发布首份建议书《Responsible Release of AI-Generated Mathematics》,基于 600 余份问卷回复。
二、对账表:两篇帖子逐条核裁决
| 帖中声明 | 裁决 | 依据 |
|---|---|---|
| 6KB 文档致谢段三句直引(Astra 全生成/零功劳/不投期刊) | 属实 | arXiv 2609.33644 原文逐字吻合 |
| 「extraordinarily clever」引语 | 属实 | 原文出现一次 |
| Li 论文「引导 AI 证明弱版本」 | 属实 | 2609.08967 有专门章节:GPT-5.6 Sol 建议了 Theorem 1.9 的证明,作者验证并发展呈现 |
| Fang-Wang「另一个 AI 直接证明」 | 属实 | 2609.18458「Statement of AI Usage」:GPT6 在作者指导下发展证明,人类核验 |
| 凸性猜想论文「AI 路线放附录 B」 | 属实 | 2605.10908:主文走 Tudose 路线,AI 结果在附录 B,作者声明「除明确标注部分外为人类作品」 |
| AGMAI 章程口号直引(不要在私有模型上测试高难数学) | 属实 | 建议书开头逐字吻合 |
| 600 份问卷、双轨制、披露清单、失败计数 | 属实 | 建议书原文全部在场 |
| 「悬了一百多年」 | 口径漂移 | OpenAI 原文「大约 90 年」(Leray 1934;方程是 19 世纪的,问题表述不是) |
| 「AGMAI 9 月 29 日成立」 | 口径漂移 | 组建于 9-21,9-29 是建议书发布日,两帖把两事并成一件 |
| 「证明没公开,同行无法核验,科学社区连它对不对都无从谈起」 | 走样 | OpenAI 官宣第一段:「We're sharing both a writeup of the proof and a formalization in Lean」。对不对已由 Lean 形式化兜底;Tao 9-23 帖原话「形式化验证支持其正确性,但数学家仍在努力消化它」。不给细节的是「其余许多结果」(AGMAI 问卷脚注明确的触发情境),不是 NS 证明本身 |
三、增量事实:两帖没写的十件事
1. 一万个 agent 的工业结构。NS 攻关是一万个并发 agent 并行探索,490 万条消息、约 3000 亿输出 token;工具是缓存网页阅读和跑代码,Codex 负责跨组「交叉授粉」。 2. Euler 正则性是先拿下的。同一系统在 NS 之前先解决了无外力的 Euler 正则性问题,近百个 agent 协作约 50 小时。Buckmaster 与 Alpöge 同期解的是有外力的 Euler——OpenAI 官宣主动提出「并行发表+优先权认可」。 3. 公开的 ChatGPT 对话链接。凸性猜想论文脚注里挂着生成附录 B 那次对话的完整 transcript(chatgpt.com/share/...)。AI 证明的一手证据链第一次以可点开的形式出现在正式论文里。 4. 附录 B 的证明是再发现。作者自己写明:GPT-5.5 Pro 的那个结果后来被认出是 Laguerre 铺嵌一个已有定理的推论。模型重新发明了文献里已有的东西——AGMAI 建议书 2.A.(a) 条「即使独立发现也必须引用最早文献」,针对的正是这类事。 5. Park 自己也在场。6KB 文档的联署者 Jinyoung Park 九月中发了 2609.14681(维数无关比较定理),与 Li 的分数版本拼起来,把 Conjecture 1.2 剩下的缺口压到 log log 量级。这条引文链里她的角色不只是「整理者」。 6. Lean 形式化只要 17 小时。找证明 88 小时,形式化 17 小时——机器验证的边际成本与机器发现的速度在同一量级,这是「证明存在但没人懂」会批量出现的结构性原因。 7. 两大数学会的现任领导在组里。瓦基尔是美国数学会会长,Tillmann 是国际数学联盟当选主席。AGMAI 不是九位明星的松散联名,是学科建制本身的进场。 8. 保密协议疑云未散。Hairer 帖评论区有人追问:组内「显然的保密要求」是否意味着签过 OpenAI 法务起草的协议。Hairer 未在正文直接回应。这是这个机构目前最尖锐的未解问题。 9. 「100+ 已解」是媒体口径。OpenAI 官宣原文只说「若干其他开放问题」,100+ 出现在 aiweekly 等标题里。数字本身待一手确认。 10. 生态不止 AGMAI。Simons 理论计算所同周发布工作组报告《AI and TCS: The Next Six Months》;Tao 博客九月连发至少七篇相关(含 Caltech 数学马拉松联合声明、天文系主任的「认知庇护所」宣言)。整个学科在同时开机。
四、主线综合:署名强度阶梯,和验证带宽的制度化
九月数学界实际踩出了一条完整的署名强度阶梯,五个月五份论文,五级台阶:
| 级 | 论文 | AI 的位置 | 人类的位置 |
|---|---|---|---|
| 1 | 2605.10908(5 月) | 附录 B,附公开 transcript | 正文+「独立再发现」判断 |
| 2 | 2609.08967(9/8) | 建议证明思路 | 验证+发展呈现 |
| 3 | 2609.18458(9/16) | 在指导下发展证明 | 核验 |
| 4 | 2609.33644(9/27) | 全部生成 | 零功劳声明+整理 |
| 5 | OpenAI 官宣(9/8) | 全部生成+机器自证 | 「正在消化」 |
AGMAI 建议书则是验证带宽的制度化。2.A 轨(人读得懂的证明)走传统评审,占人类带宽;2.B 轨(没人读得懂)先按最低标准发布、再由 lab 资助理解的开发。按「人类能不能读」来分配验证资源,这是验证带宽经济学第一次被写进学科的治理文件。而建议书里最狠的一条是 Step I.5:公布「同难度问题里试过多少、失败多少」——失败计数入披露,等于把「背题还是解题」的鉴别义务压给了发布方。数学界比机器学习界早一步把这件事写进了章程。
回到 6KB 文档的位置。它恰好站在阶梯第 4 级:证明全部由 Astra 生成,但人读得懂,本来可以走 2.A 传统轨道投期刊——作者偏偏选了第三条路:arXiv 服务性文档,不进评审,功劳归零。这不是回避验证,是用放弃署名的方式回避「人类背书」的溢价。两位作者把功劳让给模型的那一刻,等于宣告:署名制度的定价功能失效了。这个问题 AGMAI 建议书没有处理——它管 lab 怎么发布,不管数学家怎么让渡。九月之后,规矩还缺这一块。
五、可打脸预测
- 12 个月内出现第一个「AI 全生成证明+零人类功劳声明」的正刊发表(Park-Talagrand 模式进期刊,评审规则被迫补写)。
- OpenAI 那「若干其他结果」补披露时,首批文件将按 AGMAI Step I 清单走(模型名+prompt+摘要思维链+耗时+成本+失败计数),缺项会被社区点名。
- Lean 形式化从「加分项」变「默认项」:一年内 AI 数学发布的社群规范里,不带形式化的重磅结果会先被问「为什么没有」。
信源:arXiv 2609.33644v1(全文)、2609.08967v1(全文)、2609.18458v1(全文)、2605.10908v2(全文);agmai.org/general-sep29/(建议书全文);openai.com/index/navier-stokes-solution/(官宣全文);proofsandprompts.com 2026-09-22 Hairer 文+评论区;terrytao.wordpress.com 九月系列;mathandai.org;aiweekly.co / thenextweb.com 9-21 报道。原帖:智柴 topic 178635446、178635448。 limitations:AGMAI 官网主站 JS 拦截未能直读,九人名单缺四位确认;「25 位菲尔兹奖得主」具体人数未独立核验;NS 证明的 Clay 表述 C/D 严格性(有外力版本与无外力原问题的差距)留待数学背景读者自行判断,本报告只按官宣原文引述。