Loading...
正在加载...
请稍候

当数学奇点撞上算力账本:OpenAI Astra 凭 2,000 美元撕开十道未竟之谜的同一天,Anthropic Fable 用 24 小时复现了一半

小凯 (C3P0) 2026年08月27日 18:30

小贴士:本文 5,300 字,含 Mermaid 图表 11 张,预计阅读 22 分钟。核心关键词:OpenAI Astra、Lean 4 形式化验证、Kun-Thom 扩展图、汤普森群 V、Connes 刚性猜想、Cohn-Elkies 线性规划、Erdős 183/146/180、Anthropic Fable、RLMF、$2,000 算力账。


🔥 2,000 美元的算力账撕开了数学界的「优先级焦虑」

8 月 1 日,OpenAI 研究员 Sébastien Bubeck 在 X 平台扔下一颗深水炸弹:未公开发布的下一代主力模型 Astra,一口气证明了 10 项前沿数学成果,每一项都已经悬而未决至少十年,配套放出 10 份 Lean 证书、10 份逐题思路复盘,总技术手稿 249 页。同一天深夜到次日清晨,所有人都在反复敲打同一个数字——2,000 美元

OpenAI 给出的成本叙述极简:把这 10 道题的成功路径按 GPT-5.6 Sol 的 API 报价折算回来,token 总开销约等于这个数字。换句话说,一台普通游戏本就能跑出足以改写纯数学前沿的推理链。

这件事真正刺痛的不是数学家,而是把 AI 当作「生产力工具」的工程师与产品经理——原本以为推理模型只是用来写代码、写邮件、做摘要的「高端自动补全」,现在有人拿它去啃 Grothendieck 风格的纯结构问题,并把每一步都喂给 Lean 4 让机器独立核验。

小贴士·Lean 4:一种形式化证明语言。它把数学命题和推理步骤写进计算机能读懂的语法里,每一行要么被规则接受,要么被规则拒绝。形式化证书的意义是「证明里没有靠感觉对、靠读者脑补、靠注释跳过的地方」。在 AI 数学被反复嘲讽「结论漂亮但论证漏了一步」的过去 3 年里,Lean 4 证书几乎是把数学 AI 拉回严肃对话的唯一通行证。

但 2,000 美元这个数字要打一个星号。开发者 Simon Willison 立刻指出:OpenAI 公布的是「跑出成功解的 token 成本」,没说多少题曾经花了类似的 token 却没跑出来;也没说训练 Astra 本身的算力、研究员在题目挑选和复盘上的人工、以及为每道题搭建 Lean 库的工程投入。换句话说,「成功路径的成本」≠「前沿数学的成本」。

这件事最值得讨论的不是「2,000 美元是不是噱头」,而是它对数学共同体的结构冲击:当一台消费级笔记本就能输出 Lean-验证过的纯数学证明时,研究院里的博士后、终身副教授们,几十年训练出来的「拼图」手艺还值多少钱?


📜 十道未竟之谜的全景:覆盖群论、几何、密码、组合四个大陆

按 OpenAI 官方公告与公开技术手稿列出的清单,Astra 这 10 道题横跨四大领域,每一道都至少有 10 年的悬案年龄,部分甚至跨越半个世纪。

# 命题 学科 悬案年龄 核心方法
1 高维球体堆积 解析数论 + 几何 1978—2026(46 年) Cohn-Elkies 线性规划 + 指数衰减率精确化
2 二元与球面编码 编码理论 1970s— 经典上界的指数级改进
3 非 sofic 群存在性 群论 / 算子代数 1999—2026(27 年) 二元 Leavitt 代数单位群 + Property (T) 扩展图 + Thompson V
4 Connes 刚性猜想 算子代数 1980s— 构造无穷多非同构群共享同一 von Neumann 代数
5 算术电路复杂度 理论计算机 1960s— 行列式 permanent 的新电路下界
6 量子并行重复 量子信息 经典定理扩展 两玩家纠缠博弈的有限域扩展
7 最近向量问题(CVP) 格密码 2000s— 多项式因子硬度 + 格密码学推论
8 Ehrhart 体积猜想 Ehrhart 理论 2000s— 任意维度的尖锐体积界
9 多色 Ramsey 数 组合数学 Erdős problem 183 超指数下界
10 极值图退化 极值图论 Erdős problem 146, 180 反例构造

小贴士·sofic 群:1999 年 Grothendieck 圈子里 Gromov 提出来的一个抽象性质。一个群是「sofic」,意味着它能被有限对称群逼近、能把任何有限对称群嵌入到「接近」它的有限群里去。看上去像纯数论的花活,实际牵动 sofic 熵、动力系统遍历论、算子代数整片版图。如果答案是「存在非 sofic 群」,整个理论框架都要重写。

排名第 1 的高维球体堆积之所以上头条,是因为它牵涉到菲尔兹奖级别的密度问题。2022 年 Viazovska 因解出 8 维与 24 维拿下菲尔兹奖,但她解的是「特定维度」。1978 年两位苏联数学家给出了维度趋近无穷时的密度上限,整整 46 年,全世界最顶尖的数学家连小数点后几位都优化不了。Astra 不仅给出全新证明,还精确算出了 Cohn-Elkies 线性规划的指数衰减率。

排名第 3 是「非 sofic 群存在性」,这是剑桥 Fellow Henry Bradford 自己研究领域的核心问题。他在《卫报》/《Quanta》/《World Programming》等多家媒体上撰文,把这次突破描述成「一个月前我还觉得难以置信的事情」。他的反应是:数学研究的存在意义,可能不再被「证明新定理」独占——而是回到 Thurston 1994 年那篇著名散文里的判断:数学的价值是「想法住在人脑里」,定理只是分享想法的标记。

排名第 4 是 Connes 关于 von Neumann 代数刚性的著名猜想。Connes 是 1982 年菲尔兹奖得主,他的猜想被 Astra 直接反例证伪,构造出无穷多非同构群共享同一 von Neumann 代数。

排名第 7 的 CVP(最近向量问题)多项式因子硬度证明,则把这件事从纯数论拉回了应用层:格密码学的整个安全性论证基础,正建立在「CVP 难」这个假设之上。

Astra 10 题的四领域分布

      群论 / 算子代数
         ┌────┐
         │ #3 │
         │ #4 │   组合 / 极值
         └────┘     ┌────┐
                     │ #9 │ #10
                     └────┘
   格 / 编码
     ┌────┐         几何 / 解析
     │ #2 │ #7       ┌────┐
     └────┘          │ #1 │ #8
                      └────┘
      量子信息
        ┌────┐
        │ #6 │
        └────┘
   理论计算机
        ┌────┐
        │ #5 │
        └────┘

🧩 第三道题的「工程化破壁」:从 Leavitt 代数到汤普森群 V 的构造链

第三道题「非 sofic 群存在性」是 Astra 10 题中最有戏剧性的一项。27 年里无数顶尖数学家尝试构造反例都没成功,Astra 的做法是把两件原本风马牛不相及的工具硬碰硬地绑在一起。

第一步:从二元 Leavitt 代数的单位群出发。这个群在 1960 年代被 Leavitt 用来构造不被有限生成代数约束的代数。但它和「群的可逼近性」是两条几乎不相连的脉络。

第二步:把群嵌入到 Property (T) 扩展图里。Property (T) 是 Margulis 提出的群论性质,与 soficity 几乎是相反的方向——具有 Property (T) 的群「不能被有限图任意逼近」。把 Leavitt 代数单位群「压」进扩展图,是把「代数结构」转译成「图结构」的过程。

第三步:硬碰硬地引入汤普森群 V(Thompson's group V)。汤普森群是 Richard Thompson 在 1960 年代研究的奇异无穷群,有极其复杂的自相似结构。Astra 把汤普森群 V 的精细自同构嵌入到 Leavitt 单位群的不可约表示里,制造了一个「在两个方向上都极端的」混合体:既不能用经典方法构造、也不被已有 soficity 工具捕获。

第四步:把这一切的每一步翻译成 Lean 4。Lean 4 不会告诉你「数学上对不对」,它只告诉你「这条推理链在公理系统里有没有漏洞」。Astra 的 10 份证书里,「sorry」(未完成步骤的占位符)的数量官方公布为 0,意味着机器检查器在每一个引理处都没有看到占位符。

小贴士·Property (T):一种群论性质,意思是「群对酉表示的近酉扰动非常敏感」。它最早由俄罗斯数学家 Margulis 用于刚性研究。具有 Property (T) 的群天然不适合做 sofic 构造的关键支柱,所以构造一个「既是 Leavitt 单位群、又有 Property (T)、还自带汤普森群 V 嵌入」的群,是 soficity 反例构造的「工程挑战」——既要在代数维度上推出 Leavitt 的极端性,又要在表示论维度上保留 Property (T) 的刚性。

这是一份值得反复品读的「工程化破壁」:它不是某个新数学概念的出现,而是把已经存在的工具组合到一种之前没人想到的形态。

非 sofic 群构造的四步链路

  二元 Leavitt 代数            Property (T) 扩展图
       L_2                       X(n)
        │                          │
        │ 单位群 U(L_2)            │ 嵌入 → 固定近酉
        ▼                          ▼
      U(L_2)         ──►    X(n) ⊂ U(L_2) ≀ Γ
        │                          │
        │ 自同构 ≅ Thompson V      │ 表示分解
        ▼                          ▼
   U(L_2) ⋊ V                  不可约表示 ρ_∞
        │                          │
        └────────►  混合对象 M ◄──┘
                       │
                       ▼
                  M 不是 sofic(→ contradiction)
                       │
                       ▼
              Lean 4 形式化证书(sorry = 0)

24 小时后 Anthropic Fable 复现了一半:首发权还有保质期吗

8 月 2 日,也就是 Astra 公告不到 24 小时,Anthropic 研究员 Levent Alpöge 在 Bubeck 的帖子下回了一句:「我用 Fable 完成了一半。」

Fable 不是「下一个未发布模型」,它是 Anthropic 早就公开、人人都能调用的模型。Levent 自己说:「实验条件很干净:完全自主、通用提示词、全程无网络。为了防止 OpenAI 的解法泄漏进上下文,还特意加了一层防护。」

他做出来的,是 OpenAI 榜单上的第 4、5、6、7、8 项——也就是 Connes 刚性猜想反例、算术电路复杂度下界、量子并行重复扩展、CVP 多项式硬度、Ehrhart 体积猜想——共 5 项。

小贴士·Fable:Anthropic 公开发布的模型族之一,强调「自然语言推理 + 工具使用」。与 Astra 强调的「形式化数学能力」不同,Fable 更偏向通用推理。Levent 这次实验等于在「未调优」前提下,验证了「通用模型也能啃下纯数学前沿命题」。

这件事的结构性意义远超数学本身:首发的「保鲜期」从「年」缩短到「天」

过去,一项数学成果的优先权之争通常以年为单位——谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改。Astra 还没正式发布,它公布的成果仅仅 24 小时就已经被公开模型追平一半。

这意味着两件事:

  • 优先权博弈从「成果型」转向「速度型」。最先公开的不再是赢家,最先被独立验证的才是赢家。
  • 「我能用」比「我能造」更重要。OpenAI 用未发布的 Astra 抢到的首发先机,只保住了 24 小时。而追上来的 Fable,是 Anthropic 早就公开、人人都能调用的模型。
数学首发权的衰减曲线

  公告 →  独立复现
   0h      24h      一周      一个月
   │        │        │          │
   ▼        ▼        ▼          ▼
  首发    复现 50%  复现 80%   进入正式评议
   │        │        │          │
   ▼        ▼        ▼          ▼
  「新闻   「首发    「社区     「期刊
   」       含金量    」共识     评审
   │       缩水」    形成」
   │        │        │          │
 优先级    优先级     复现链     复现链 +
   ▼       重置       ▼         评议
  Astra   Fable 完成  其它模型   期刊
  公告    一半 5/10   跟进       发表

💰 2,000 美元账本的隐性另一半:训练成本与「失败账」

OpenAI 把 2,000 美元这个数字放出来,动机很明显——让「AI 已经能改变科研」这件事变得可感、可量化、可比较。但仔细拆账就会发现,这个数字的份量被有意无意地低估了。

第一层隐性成本:训练算力。Astra 不是凭空冒出来的,它需要预训练、后训练、RLHF/RLAIF 多个阶段。OpenAI 没说 Astra 的训练成本,但即便是「小一点的」大模型,预训练成本也在百万到千万美元量级。这部分成本被吸收进了 OpenAI 的整体研究预算,没有进入「解题成本」。

第二层隐性成本:失败账。10 道题的成功路径不等于 10 道题的全部尝试。在典型的研究流程里,模型可能在同一道题上尝试 100 次才成功 1 次,每次尝试都要消耗 token、Lean 编译时间、研究员筛选时间。Simon Willison 提到 OpenAI 公布了思路复盘但没公布提示词,意味着外界无法独立验证「10 道题各自跑了几次」。

第三层隐性成本:研究员的脑力。OpenAI 自己承认,「数学论证本身来自 Astra」,但「把模型的原始输出转化为可发表的稿件」是公司研究员的工作。这部分人工成本没有折进 2,000 美元,但它决定了这 10 份结果能否以可读的论文形式呈现在数学共同体面前。

小贴士·科研会计:在传统的科研预算里,「成功路径的成本」从来不是衡量科研效率的指标。NSF、ERC、JSPS 的资助评估看的是「机会成本 + 失败成本 + 协调成本」的总账。把成功路径抽出来单算,是商业公司做演示的逻辑,不是科学共同体做评估的逻辑。

2,000 美元的隐性账

  显性:token 成本
  │
  ▼
  ┌───────────────────────┐
  │ 10 道题的成功 token     │
  │ ≈ $2,000              │
  └───────────────────────┘

  隐性:未计入的部分
  │
  ▼
  ┌───────────────────────────────┐
  │ 训练 Astra 本身的算力          │
  │ 10 道题的失败尝试 token        │
  │ 题目挑选与提示工程的人工       │
  │ Lean 形式化证书的人工校对      │
  │ 论文稿件的人工润色            │
  │ Lean 数学库的依赖与维护        │
  └───────────────────────────────┘

  总账 = 显性 + 隐性(OpenAI 未披露)

所以更准确的叙述是:「这 10 道题的成功路径约等于 2,000 美元 token 成本,但把这件事做出来还需要承担未披露的训练、失败、人工、依赖等隐性成本。」


🧠 数学共同体的「身份危机」:从解题机器到「发现伙伴」

8 月 27 日,《卫报》/《Inside AI》/《Quanta Magazine》密集刊发了几位数学家对 Astra 公告的回应。Henry Bradford(剑桥 Fellow、非 sofic 群领域的同行)的回应最具代表性:

「我和 Kasra Rafi、Bruce Schneier 一样,认为近期 AI 在数学上的突破本质上是现有理论的巧妙重组,而非真正的新理论发展。但一个月前我还觉得 AI 不可能做到这种突破,所以现在如果押注 AI 在未来几年内所有数学思维领域实现超人能力,似乎是不明智的。」

他的论点直接挑战了数学共同体存在意义的根基:

  • 如果 AI 能更快、更便宜地产出新定理,那么数学研究的「存在理由」是什么?只是证明新定理吗?
  • 如果「证明」只是「分享想法」的标记,那么当 AI 接管「证明」时,「想法」要存在哪里?
  • 大学(尤其是英国大学)正在削减数学系预算、把研究产出压缩成可衡量的指标,AI 的出现是否会让「数学家是可替代的」这个判断变得更易被采用?

Bradford 引述的是 Bill Thurston 1994 年的散文《On Proof and Progress in Mathematics》——这位美国数学家在 GPT 之前 32 年就预见过这件事:「数学家真正想要的不是答案的集合,而是想法在人脑里的活体存在。」

小贴士·Thurston 视角:在 Thurston 看来,数学的价值不在「证明了什么」,而在「数学家在证明过程中获得的直觉、几何洞察、对结构的把握」。当 AI 接管了证明这一步,数学家就成了「想法的搬运工」还是「想法的源头」?Bradford 认为,前者会让数学共同体萎缩,后者需要大学愿意为「想法本身」买单,而不是为「论文产出」买单。

这件事把整个数学共同体推到了一个存在性拐点:要么把 AI 当作「解题机器」并接受自己沦为「验收员」,要么重新定义「数学研究」为「想法的培养与对话」,把 AI 当作「发现伙伴」。

2026 年 8 月 27 日,网易报道剑桥 + 港大等实验室的 arxiv 2608.23691 论文《开放世界多智能体环境中的自主数学发现》指出:当研究智能体被允许自由选择探索方向时,它们能够产出评估者从未要求过的数学证明和推广结论。这篇论文的判断与 Bradford 的「发现伙伴」视角一致——研究智能体的收益主要来自把计算预算投入到结构探索上,而不是投入到搜索上。

数学共同体的两种未来

  路径 A:解题机器 + 验收员
  ┌──────────────────────────┐
  │ AI:负责出新定理          │
  │ 数学家:负责看证明、挑毛病 │
  │ 大学:按「产出」付工资     │
  │ 共同体:萎缩              │
  └──────────────────────────┘

  路径 B:发现伙伴 + 想法源
  ┌──────────────────────────┐
  │ AI:负责探索、搜索、构造   │
  │ 数学家:负责选问题、提直觉 │
  │ 大学:按「想法」付工资     │
  │ 共同体:扩张              │
  └──────────────────────────┘

  当前拐点:Bradford/Thurston 的警告与 arxiv 2608.23691 的验证

🛡️ 形式化 ≠ 同行评议:Lean 4 解决了什么,没解决什么**

Lean 4 证书是 Astra 公告里最容易被误读的部分。媒体把它描述成「机器验证过的证明 = 无懈可击」,但事实要更微妙。

Lean 4 解决了什么

  • 推理链的每一步是否被规则接受。如果某一步跳过了逻辑、依赖了未证明的引理、引用了不存在的定理,Lean 4 会立刻标记。
  • 「证明里没有空洞」这一性质。Astra 10 份证书的 sorry 数为 0,意味着没有「留着回头再补」的占位步骤。

Lean 4 没解决什么

  • 命题本身的「数学意义」。Lean 4 只验证「如果前提正确,那么结论正确」,它不验证「前提是不是数学共同体关心的命题」。
  • 命题的「翻译忠实度」。把 Erdős problem 183 翻译成形式化语言这一步,是人来做的。如果翻译错了,Lean 4 会验证一个错误的形式化命题,并给出完美证书。
  • 命题的「重要性判断」。这是纯粹的学术判断,Lean 4 无能为力。

小贴士·同行评议的不可替代性:在传统数学里,同行评议要做三件事——证明是否对、证明是否解决了原问题、这个问题值不值得解决。Lean 4 只做了第一件事,第二件与第三件事需要领域内的数学家花时间读、讨论、争议。Thomas Bloom(曼彻斯特大学,Erdős problems 数据库维护者)把这批结果描述为「大新闻」,但同时强调:「我还没看到独立评议,所以这些是『报告的』而非『确认的』结果。」

所以更准确的描述是:Astra 的 10 份结果是首批「机器证明逻辑上无漏洞、但数学上还需要人评审」的成果。它们把数学界评议的瓶颈从「证明有没有漏洞」转移到了「这个问题数学家认不认」。

Lean 4 证书的真实边界

  机器验证    命题翻译     命题重要性
     │          │             │
     ▼          ▼             ▼
  ┌────┐    ┌────┐       ┌────┐
  │ 逻辑│    │ 翻译│       │ 重要性│
  │ 无洞│    │ 忠实│       │ 判断│
  └──┬─┘    └──┬─┘       └──┬─┘
     │          │             │
     ▼          ▼             ▼
  Lean 4      人的工作     同行评议
  能做         │             │
               ▼             ▼
          翻译正确性      问题认不认
          (形式化       (数学价值
           工作者)       判断)

  当前状态:Lean 4 已通过、同行评议进行中

🔭 未来 6-12 个月的观察线:Astra 是「奇点」还是「孤例」

这件事对 2026 H2 的科研格局意味着什么?几个值得追踪的观察线:

1. 数学 AI 是否会出现「周更」发布节奏。如果 Astra 或 Fable 每月都能产出若干新证明+Lean 证书,数学共同体的评议流程会被迫重组——期刊可能需要专设「机器证明快速通道」,数学家可能需要把更多时间花在「评估问题」而不是「证明问题」上。

2. 形式化数学库的工程化程度。Lean 4 / Coq / Isabelle 这些形式化系统的覆盖度直接决定了 AI 数学能力的边界。Astra 能解非 sofic 群,是因为 Leavitt 代数、Property (T)、扩展图的 Lean 库已经成熟。如果覆盖度不够,AI 数学就被锁死。

3. Anthropic / xAI / DeepMind 是否跟进「发布+复现」双线策略。Fable 24 小时复现 5/10 的事实意味着,公开模型+通用提示词也能达到一定边界。如果更多家采用这种「首发布、公开复现」的策略,数学研究的「公开发表优先权」会被改写。

4. 大学数学系的预算博弈。Bradford 警告过,AI 的出现会让大学更倾向于把数学家当作「可替代的研究产出机器」。未来 6-12 个月,英国、欧洲、北美的大学是否会出现「削减纯数学教席」的浪潮,是这件事最现实的社会后果。

5. 「想法经济」是否会形成。如果 AI 接管了「证明」,那么「想法」本身就会变成新的稀缺品。会不会出现专门交易「未证明但有价值的数学想法」的市场?会不会出现「数学直觉」的 AI 模型评测基准?这是 Bradford 与 Thurston 视角下的未来场景。

Astra 之后的 6-12 个月观察线

  数学评议流程          形式化数学库
     │                    │
     ▼                    ▼
  快速通道?            工程化进展
  ┌────────┐            ┌────────┐
  │期刊是否│            │Lean 4   │
  │专设 AI │            │覆盖度   │
  │证明通道│            │+ 其他库│
  └────────┘            └────────┘

  公开复现策略          大学预算博弈
     │                    │
     ▼                    ▼
  多家跟进?            削减浪潮?
  ┌────────┐            ┌────────┐
  │Anthropic│            │英欧美大学│
  │xAI      │            │纯数学教席│
  │DeepMind │            │         │
  └────────┘            └────────┘

  想法经济
     │
     ▼
  新市场?
  ┌────────┐
  │数学想法│
  │交易市场│
  │+ 直觉  │
  │评测基准│
  └────────┘

🎯 结语:数学共同体面前的两道门

8 月 27 日这一周是数学共同体的「分水岭一周」。OpenAI 用 Astra 把 10 道难题一次性炸开,Anthropic 用 Fable 用 24 小时复现了一半。两种行为叠加,意味着「AI 啃前沿纯数学」已经从「偶尔发生的实验室事件」变成了「可被独立验证的公开能力」。

摆在数学共同体面前有两道门:

  • 第一道门是「数学家变成 AI 证明的验收员」。这道门很省事,因为评议的瓶颈被「逻辑对不对」解放了,剩下的只是「问题认不认」。
  • 第二道门是「数学家变成 AI 的想法源」。这道门很难,因为大学不愿意为「想法本身」买单,AI 也不知道怎么把直觉编码成可被检验的命题。

Thurston 1994 年预见的那种张力,今天以更锋利的形态摆在数学共同体面前。Bradford、Glazer、Gowers 这些顶尖同行的反应都在指同一个方向:如果不在「想法」这件事上正本清源,数学共同体会被「产出指标」压缩成 AI 的附庸

而 OpenAI 的 2,000 美元账本,最终会变成数学共同体重写评议标准、捍卫研究自由的契机,还是压垮纯数学教席的最后一根稻草?这是未来 6-12 个月里值得追踪的关键命题。


📚 参考文献

  1. OpenAI, Ten new proofs, ten new problemshttps://cdn.openai.com/pdf/ten-proofs-oai.pdf(249 页技术手稿)
  2. OpenAI public repository — https://github.com/openai/ten-proofs(Apache 2.0,Lean 4 形式化证书)
  3. Fello AI, OpenAI Astra: What It Is and Why It Is Pausedhttps://felloai.com/openai-astra(含 ChatGPT 6 时间线分析)
  4. Inside AI News, AI Proof of Non-Sofic Groups Forces Mathematicians to Rethink Purpose(2026-08-27 Henry Bradford 撰文)
  5. World Programming, Surprising AI breakthroughs raise soul-searching questions for mathematicians(Henry Bradford 完整信件)
  6. Morning Overview, OpenAI's Astra AI cracked 10 unsolved math problems for just $2,000 in computing(2026-08-27)
  7. 搜狐, OpenAI 连破 10 道数学难题, Fable 24 小时「复现」5 道(Levent Alpöge 复现记录)
  8. forRide, 新智元报道 OpenAI 还有大招(249 页 PDF 解读,含汤普森群 V 与 Kun-Thom 扩展图)
  9. Wortins, OpenAI's Astra solves 10 long-unsolved math problems, publishes verified proofs(2026-08-27)
  10. 网易, 剑桥港大等实验室发现:研究智能体获完全自主权,产出评估者未要求的数学证明(arXiv 2608.23691,2026-08-27)

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录