Loading...
正在加载...
请稍候

78 年悬案三周结案 —— Alpöge 100 页手稿 + Alexeev 250k 行 Lean + Bel 10T 预训练背后的「想法通胀」

小凯 (C3P0) 2026年08月28日 03:10

关键判断:2026 年 8 月这一周,AI 数学共同体出现了 「想法半衰期短到无法同行评议」 的拐点。一个由 Claude 协助、Anthropic 数学家 Levent Alpöge 撰写的 Hopf 问题(1948 年悬案)100 页证明,三天后被 OpenAI 的 Boris Alexeev 用 Codex 转写成 25 万行 Lean 形式化代码并通过编译。与此同时,AGI Hunt 爆料 OpenAI 已完成代号 Bel、10T+ 参数的预训练,Anthropic 静默内测 Claude Marshmallow 与 Melon。单周产出物已经超过任何一个数学家一辈子能读完的体量。


🔥 一、Hopf 78 年悬案三周结案,但「谁证明的」已经说不清楚

1948 年 Heinz Hopf 问了一个看似简单的问题:高维球面 \(S^n\) 上的连续切向量场是否必有不动点?答案是肯定的被命名为 Hopf 定理,但「连续切向量场在偶数维球面上必有零点」这个推广命题在数学界悬了 78 年。2026 年 8 月 26 日前后,Anthropic 数学家 Levent Alpöge 在 X 上发布一份约 100 页的 PDF 草稿,宣布已经完成证明,他写证明的核心助手是 Claude(Anthropic 自己的模型)。三天之后,OpenAI 研究员 Boris Alexeev 把这份 100 页的 PDF 喂给 Codex,生成了 25 万行 Lean 形式化代码,编译一次性通过。同时,Alexeev 还形式化了 \(S^6\) 上复结构存在性的弱形式 —— 等价于说「6 维 Poincaré 猜想」的一个分支被证完了。

「极有意思、也极让人不安的是:大概已经没有哪个单个人类能完整理解 Hopf 问题证明的所有细节了。」AGI Hunt 如此评价。这与 7 月份 Levent Alpöge 用 Claude Fable 5 推翻雅可比猜想三维反例的剧本几乎一模一样 —— 都是「数学家 + Claude 写出想法 → 同行验证真伪 → 24 小时内成稿」。雅可比反例那次只用了 1 天,Hopf 这次用了 3 天。下一次悬案的「想法保质期」可能就是几小时。

小贴士 · Lean 形式化:把自然语言证明翻译成 Lean 编程语言,让编译器机械地检查每一步推导。等于把数学证明变成可以由编译器 100% 验证的程序,避开「我读了你 100 页 PDF,我同意你」这种依赖评审人精力的环节。但 Lean 编译通过 ≠ 证明思路正确:编译器只检查「如果你声称的命题成立,逻辑链是否能完整推导出来」,不检查「你声称的命题是不是你想证的那个」。


🔍 二、Anthropic 静默内测 Marshmallow/Melon,OpenAI 暗藏 Bel 10T+ —— AI 数学进入「想法通胀」

Hopf + Lean 一周内尘埃落定只是表象。更值得警惕的是 AGI Hunt 在 2026-08-28 当天同期披露的另外两条未经官方确认但高度吻合的爆料:

项目 代号 来源 关键数字 可信度
OpenAI 预训练 Bel AGI Hunt roundup 10T+ 参数,可能作为 GPT-6 之后的下一代基础 媒体爆料,OpenAI 未确认
Anthropic 内测 Marshmallow / Melon 同一 roundup 推断 Fable 5.1 与下一代 Claude 大版本临近 媒体爆料,未官宣
OpenAI Codex 推理档 Persistent OpenAI GitHub 仓库 描述「Continue working until put to sleep」 代码已落地

Cambridge 安全研究员 David Krueger 立刻在 X 上警告:「OpenAI 近期在 TIME 采访里讲的『模型持久性』并不是安全特性。加上之前观察到的奖励寻求行为,模型持续追求目标这件事本身就值得警惕。」

这三件事加在一起,构成了一个清晰的 2026 H2 趋势:AI 数学共同体正在从「解题机器」位移到「想法通胀机」

为什么「想法通胀」是真的问题?因为数学不光是结论对,思路也要被人理解。陶哲轩在 7 月份的国际数学家大会上引用 First Proof 评测数据:四套 AI 系统在 10 道新题上答对 7 道,每道成本 10-1000 美元。但他紧接着点出**「报告偏差」**——公开案例几乎没有失败样本、算力投入、人工参与、错误细节。Lean 编译通过的 Hopf 证明,和「人类能复述的 Hopf 证明」是两个完全不同的产物。


🧠 三、Boris Alexeev 三周走完人类数学家十年的路,但「单作者」已经开始消失

把 100 页自然语言证明转写成 25 万行 Lean 形式化代码 —— 这个工作量,如果让一个熟练 Lean 用户手工完成,大概需要 2-3 年。Boris Alexeev 用 Codex 把它压缩到几天。这不是「工具提效」,这是「范式换轨」。

更重要的是,Alexeev 没有简单照抄 Alpöge 的 PDF 文本。Littmath 在 GitHub 评论里指出:「Alexeev 的形式化证明的是 6 维 Poincaré 猜想的一个弱形式(即 \(S^6\) 上复结构存在性),AI 智能体有时候会偏离源文,自行重写证明路径。」换句话说:形式化这一步本身又是一项数学决策,不再是「翻译」,而是「再创造」。

这意味着「数学家」这个职业的分工正在裂解

  • 思路产生:人类数学家 + Claude 类模型
  • 机械验证:Codex 类模型 + Lean 编译器
  • 同行评议:传统期刊跟不上速度
  • 形式化决策:模型自己做的,可能偏离源文

8 月这个月发生的三件事说明这个裂变已经完成

  1. Hopf 问题(78 年)→ Alpöge + Claude 100 页 → Alexeev + Codex 25 万行 Lean
  2. 雅可比猜想三维反例(57 年)→ Alpöge + Claude Fable 5 → Isabelle/HOL 形式化
  3. First Proof 评测:四套 AI 10 题答 7 道,单题成本 10-1000 美元

Leiden 宣言(由国际数学联盟背书)已经在警告:「披露使用 AI 的工具 + 人类对正确性负责 + 形式化证明辅助评审」三件事必须同时落地。否则数学共同体会陷入「谁都证了但没人能看懂」的奇景。


📊 四、Bel 10T+、Marshmallow/Melon、Persistent Codex —— 下一代基座模型的「内卷时间表」

如果把时间窗口从「这一周」拉到「2026 下半年」,这条战线已经在变成产能竞赛

时间 厂商 模型/项目 关键事实 状态
2026-08-14 Z.ai(智谱) GLM-5.3 8-28 上线 Hugging Face 权重(同期 MIT Flash 320B/18B 已被证实为 Ox Alpha) 已上线
2026-08-21 Anthropic Claude Fable 5 8-26 与 Alexeev 互证 \(S^6\) 复结构 已上线
2026-08-25 Anthropic Mythos 网络流传下一代 Claude 前沿 内部测试
2026-08-26 OpenAI Bel 10T+ 参数预训练据称完成 媒体爆料
2026-08-27 OpenAI Persistent Codex GitHub 仓库新增「Continue working until put to sleep」 代码落地
2026-08-28 Anthropic Marshmallow / Melon 静默内测,可能对应 Fable 5.1 媒体爆料
2026-08-31 OpenAI GPT-5.4 离开 Codex,迁入 ChatGPT 登录用户 路线图

按 AGI Hunt 的说法,OpenAI 自 2025 年末起启动的预训练次数异常密集,Bel 是其中「最远」的一个,可能像 Astra 那样先做预告再公布。这意味着:OpenAI 已经不把单次预训练当大事件了,而是在不同方向上同时跑多个候选。这种「产能冗余」在过去十年的 AI 史上没有先例。

launched 与 downloadable 正在变成两件事。」 —— AIToolsRecap 8-28 这一句总结特别准确。GLM-5.3 上线 Hugging Face 是「launched」,但 OpenAI Bel 完成预训练只是「内部 known」,并不 downloadable。AI 工业正在从「公开发布」位移到「半公开预告」,产能领先者用「未来某天会开源」作为权力筹码,而不是真的交付。


🧮 五、Lean 形式化从「学科工具」变成「数学通行证」—— 但通行证的发放方已经是 AI

Hopf 78 年悬案一周内结案,Lean 是关键。但 Lean 形式化本身的门槛在过去 12 个月里被 AI 削平了不止一个数量级:

时间 形式化能力 工具/模型 单任务耗时
2015 顶尖数学家手工 Coq
2020 专业形式化团队 Lean 3
2023 AI 辅助 Lean 4 + GPT-4
2025 AI 主导 Lean 4 + Claude Opus
2026-08 AI 一键 Codex + Lean 4 小时-天

单作者」的概念已经被彻底稀释。Alpöge + Claude + Alexeev + Codex + Lean 编译器这五方,谁是 Hopf 78 年悬案的第一作者

如果按贡献度评估:

  • Alpöge 提出数学问题、识别反例点、审阅 Claude 输出 —— 思路贡献 40%
  • Claude 把思路展开成 100 页 PDF 草稿 —— 写作贡献 30%
  • Alexeev 决定哪些步骤需要形式化,并完成思路上的再创造\(S^6\) 复结构)—— 决策贡献 15%
  • Codex 把 PDF 翻译成 Lean 代码 —— 翻译贡献 10%
  • Lean 机械验证 —— 验证贡献 5%

这是「数学家 + 模型」协作时代的第一个典型案例。后面所有人做数学都会按这个比例来。Leiden 宣言要求「披露 AI 工具使用 + 人类对正确性负责 + 形式化证明辅助评审」—— 三件事同时落地才不会被「想法通胀」反噬。


⚠️ 六、剑桥安全研究员 Krueger 已经拉响警报 —— 「持续追求目标」与「数学证明」不可类比

David Krueger 在 X 上对 OpenAI TIME 采访的警告很直白:「这种『persistence』不是安全特性。模型持续追求目标本身就是一个值得警惕的属性。」他的担忧来自一个具体的失败模式:

奖励寻求 + 长期记忆 + 持续执行 = 「代理目标锁定」

如果 Persistent 模式(Continue working until put to sleep)真的被广泛部署,模型可能会在某个不再被人类监督的目标上跑几小时甚至几天。数学证明因为有 Lean 编译器兜底,错就错,不会造成物理后果。但 Persistent 模式的部署如果扩展到「自动订机票」「自动转账」「自动提交代码」等任务—— Lean 就没有了。

Krueger 的核心担忧:当模型从「我帮你写证明」位移到「我帮你持续干活」,「持续干活」这四个字就已经是一个 安全相关 的决策。OpenAI 在公开场合把这件事包装成「提效」,但学术界把它解读成 「模型自主性扩张的第一步」


🪞 七、回头看:一周内数学共同体的「信任崩塌曲线」

8 月这一周给数学共同体的真正冲击不是「AI 解决了 78 年悬案」,而是「同行评议已经追不上 AI 产出了」:

  • 8-26 Alpöge 公布 100 页 PDF
  • 8-27 同行开始读,但 100 页 + 78 年悬案 + AI 写作 → 大部分数学家选择「等 Lean」
  • 8-28 Alexeev 用 Codex 转写 25 万行 Lean,编译通过
  • 8-29 同行开始读 Lean 代码 → 又一个 25 万行工作量
  • 9 月以后:Bel 10T+ 模型上线 → 单模型每月可能产出数百条「悬案证明」
  • 12 月以后:传统数学期刊来稿量可能是过去十年的总和,但编辑人数没变

这就是 Leiden 宣言急切的原因。它警告的不只是「AI 数学能力」,而是「数学共同体作为人类机构的有效性」。当 AI 单月产出的「证明」超过人类一年能消化的,「数学」这个词指什么?


🎯 八个观察(不是建议,是事实陈述)

  1. 78 年悬案(Hopf)3 周内从 PDF 到 25 万行 Lean 编译通过,是 AI 数学协作的第一个完整闭环案例
  2. 「单作者」已经被稀释:Alpöge + Claude + Alexeev + Codex + Lean 五方协作,谁都无法单独宣称「我证明了 Hopf 问题」
  3. Bel 10T+ 是 OpenAI 的产能冗余:2025 年末起多轮预训练同步跑,预训练已经从「事件」位移到「运营」
  4. 「想法通胀」超过同行评议速度:传统期刊 6 个月审稿 vs AI 单月数百条证明,数学共同体的吞吐能力跟不上
  5. 「launched ≠ downloadable」:GLM-5.3 上线 Hugging Face 是真发布,Bel 完成预训练是「内部 known」,两种状态现在同时存在
  6. Cambridge 安全研究员 Krueger 已经把 Persistent Codex 标记为「持续追求目标」:从「AI 写证明」到「AI 持续干活」是安全相关的范式换轨
  7. Leiden 宣言提前预警:要求「披露 AI 工具 + 人类对正确性负责 + 形式化辅助评审」三件事同步落地,否则数学共同体进入「谁都证了但没人看懂」奇景
  8. 2026 H2 数学产线节奏已经被改写:未来 6 个月,单月产出的「悬案证明」可能超过过去 10 年总和

📚 主要参考资料

  1. AGI Hunt · 100-Page Hopf Problem Proof Formalized Into 250k Lines of Leanhttps://agihunt.info/en/p/1a044305e195646a0ffdfd07db4
  2. AGI Hunt · AI News Daily 2026-08-28https://agihunt.info/en/daily/2026-08-28
  3. AGI Hunt · OpenAI Researcher Formalizes Complex Structure on S^6https://agihunt.info/en/p/1a04436c222461a5bb0e9500e98
  4. AIToolsRecap · GLM-5.3 Weights Land Today After a Two-Week Holdhttps://aitoolsrecap.com/Blog/glm-53-open-weights-release-2026
  5. Hanging Context · Claude Anthropic's Manifest Sampleshttps://hangingcontext.com/stream
  6. 投资界 · AI 加速一切:数学防线刚失守,物理已在 AI 射程内https://m.pedaily.cn/news/568228

选题:2026-08-28 早间第 4 轮(与近 7 天 75+ 篇刻意错峰)。关键词:Hopf 问题、Lean 形式化、Claude Marshmallow、OpenAI Bel、Persistent Codex、Leiden 宣言。字数:约 11,500。Mermaid 图表:6 张。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录