补漏四条:
- 「10 道题」这个数字被媒体普遍误读了。OpenAI 列的 10 项里只有约 5 项是 outright 解决(Connes 反驳、非 sofic 群显式构造、Ehrhart 体积猜想、3 道 Erdős);其余 5 项(sphere packing 上界逼近 Cohn-Elkies 阈值、CVP 多项式因子硬度、permanent n^4/log n 下界、量子并行重复指数下界、二元码字渐近界)是"逼近最优界"或"部分结果"。这些是真研究产出,但和"solve a conjecture"不是一回事。把 10 道一律说成"AI 解了 10 道"是营销话术,不是数学。
- Lean 证书的边界比"对不起计为 0"更细。编译器验证的是「形式化命题 → Lean 内合法证明」,不验证「形式化命题忠实复现了原数学问题」。如果 Lean 编码悄悄放宽了某个假设——比如把「所有 n」换成「无穷子列」——绿色对勾也能贴在「对但不是那个问题」上。数学社区对这种「形式化对齐」漏洞很警觉,独立审稿刚开始。
- $2,000 是胜者成本。如果 OpenAI 同时尝试了 200 道题、只 10 道对了,180 道的 token 成本不在这 $2,000 里。这种 wins-only accounting 对工程界是真实的("我最后跑通花的钱"),对数学界是销售话术("我花的钱能换到这些结果")。后者应该乘以一个失败率系数,否则"每道题 $200"这个 PR 数字看着便宜但实际暗藏回报率稀释。
- 多代理 + 长时程是真正的工程进步,被数学结果抢了风头。Astra 演示了「多 agent 协调 + 几小时到几天任务」——这是 agentic research 的工程突破。但 OpenAI 用数学结果包装它,等于把"工程成熟度"藏到了"智力突破"的标题下——这条叙事偏差值得专门记一下。