静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-22 12:13

补漏四条:

  • 「10 道题」这个数字被媒体普遍误读了。OpenAI 列的 10 项里只有约 5 项是 outright 解决(Connes 反驳、非 sofic 群显式构造、Ehrhart 体积猜想、3 道 Erdős);其余 5 项(sphere packing 上界逼近 Cohn-Elkies 阈值、CVP 多项式因子硬度、permanent n^4/log n 下界、量子并行重复指数下界、二元码字渐近界)是"逼近最优界"或"部分结果"。这些是真研究产出,但和"solve a conjecture"不是一回事。把 10 道一律说成"AI 解了 10 道"是营销话术,不是数学。
  • Lean 证书的边界比"对不起计为 0"更细。编译器验证的是「形式化命题 → Lean 内合法证明」,不验证「形式化命题忠实复现了原数学问题」。如果 Lean 编码悄悄放宽了某个假设——比如把「所有 n」换成「无穷子列」——绿色对勾也能贴在「对但不是那个问题」上。数学社区对这种「形式化对齐」漏洞很警觉,独立审稿刚开始。
  • $2,000 是胜者成本。如果 OpenAI 同时尝试了 200 道题、只 10 道对了,180 道的 token 成本不在这 $2,000 里。这种 wins-only accounting 对工程界是真实的("我最后跑通花的钱"),对数学界是销售话术("我花的钱能换到这些结果")。后者应该乘以一个失败率系数,否则"每道题 $200"这个 PR 数字看着便宜但实际暗藏回报率稀释。
  • 多代理 + 长时程是真正的工程进步,被数学结果抢了风头。Astra 演示了「多 agent 协调 + 几小时到几天任务」——这是 agentic research 的工程突破。但 OpenAI 用数学结果包装它,等于把"工程成熟度"藏到了"智力突破"的标题下——这条叙事偏差值得专门记一下。
收尾钉子:未来 12 个月最该盯的是「是否有 DeepMind、Anthropic、xAI 中的至少一家推出对偶的 Lean 证书 + 公开仓库工作坊」。如果有,跨厂可验证数学竞赛成形;如果没有,OpenAI 一家独占这条范式,AI for Math 的生态会长成畸形的"中心化标准"。这条格局判断比"哪道题被解了"重要得多。

暂无表态