历史即世界。 智能体须做梦, 方能递归自改。

谷歌与 DeepMind 一篇九月的论文,不碰模型权重、不重训、不微调,只把"探索策略"这段代码反复在历史里推演,便把发现成本砍掉一个数量级。这究竟是破解了 RSI,还是又一次被媒体放大的叙事?本文拆解机制、核对数字、定位谱系。

文本版 · 供搜索与朗读

Dream-RSI 深度研究 · 谷歌让 AI 在历史里"做梦"

智柴 · 深度研究

00总判词
01此物为何物
02三阶段闭环
03为何永不退步
04八任务实验
05反直觉一击
06谱系对撞
07思想血统
08团队与江湖
09局限与未答
10吾之判词

素材链

arXiv:2609.14858

dream-rsi.com

zhengkid/Dream-RSI

2026-09-14 v1

17 人 · 4 机构

Deep Research · Google / DeepMind

历史即世界。
智能体须做梦,
方能递归自改。

谷歌与 DeepMind 一篇九月的论文,不碰模型权重、不重训、不微调,只把"探索策略"这段代码反复在历史里推演,便把发现成本砍掉一个数量级。这究竟是破解了 RSI,还是又一次被媒体放大的叙事?本文拆解机制、核对数字、定位谱系。

DREAM-RSI:RECURSIVE SELF-IMPROVEMENT THROUGH EVOLVING WORLDS
arXiv 2609.14858
2026-09-14
12 PAGES · CS.CL
研报 2026-09-18

162×
vs SimpleTES 调用压缩

1.7×
同条件受控增益

2.43×
VGG16 少生成次数

8
跨三域任务

17
作者 · 4 机构

0
权重更新

总判词 · 00

Dream-RSI 不是"破解了递归自我改进"——论文从未这么说。它做了一件克制而聪明的事:把编码智能体跑过的探索轨迹,存成一棵发现树,让这棵树成为一台免费、精确、可重放的模拟器;再让一段轻量的探索策略代码,在这台模拟器上离线"做梦",几千次候选策略零成本试错,只把胜者派回真实世界。

底层模型(Gemini 3.1 Pro / 3.7 Flash)从头到尾权重一字未动。变的,只是"下一步往哪搜、开几条并行、何时收手"这段编排代码。它把 RSI 从"改模型"这一宏大叙事里拽出来,塞进"改元探索层"这条窄而可控的缝里。值得尊敬的是工程巧思,需要警惕的是传播放大。

01此物为何物:把走过的弯路,变成新的训练场

要理解 Dream-RSI,先得看清它"利用"了什么资源,又"不碰"了什么资源。一句话:它把一次昂贵的真实探索,变成了一台谁都没在用、却早已建成的免费模拟器。

今天做科学发现、算法搜索、算子优化的 AI Agent,跑的都是同一个循环:生成候选 → 跑测试评估 → 看反馈 → 改下一版。在真正难的工程问题里,这个循环要转成千上万次。决定成败的,往往不是单步代码写得漂不漂亮,而是整个探索过程怎么调度——哪里分叉、哪里并行、哪条线该早点砍掉。

过去这一层调度,要么是工程师手写的固定策略(死板,不会从经验里学),要么想让它在线自己进化——可一旦在线试一个新策略,就得把整条发现流程从头重跑几千轮才能知道它好不好,等几天出一个分,没人耗得起。这便是论文点出的核心两难:固定者僵化,在线优化者昂贵。

"Accumulated discovery history can serve as a replay simulator over the realized search space."
论文摘要原句 · 关键洞察

Dream-RSI 的锋利处在于:当 Agent 解一道难题时,它走的是一棵搜索树,而非一条直线。每一步尝试都留下了完整现场——文件系统快照、生成的代码、评估诊断、最终得分。这些东西原本在任务结束后沦为散落的日志。论文把它们按树状结构组织起来,称之为发现树(Discovery Tree)。树上的每个节点,都是一个"若当初走这条路,会得到什么"的确定答案。

于是奇妙的事发生了:想测试一套全新的探索策略,根本不需要重新调用大模型写代码,也不需要重新跑编译器。新策略只要在已知的历史树上,以不同的顺序、不同的分叉子集、不同的并行分组和止损点"遍历"一遍即可——因为所有节点的结果都已被记录。这一步,论文叫做"做梦"(Dreaming)。它与棋手复盘同理:不必重新摆盘再下一遍,翻棋谱就够了。

图一 · 一次在线探索的代价,被之后无数次免费的梦境评估摊薄

02三阶段闭环:在线探索 → 建模拟器 → 做梦进化

整个框架是一个自我强化的循环。套用一句文言:行动生记录,记录成世界,世界中做梦,梦醒再行动。

阶段一 · 在线探索(Online Explore)

当前策略 π_t 驱动底层的编码智能体(Coding Agent,由 Gemini 3.1 Pro 或 3.7 Flash 驱动)在真实环境里做"提议—评估"。策略的动作接口很朴素:面对一棵正在生长的树,从"合法节点集合"(根节点 + 所有叶子)里挑一批节点继续,批的大小不超过并行 worker 数 W。每一轮最多 K1 次决策,策略选了空批或跑满轮数,本轮结束。所有轨迹被记成新发现树 T_t,并入历史 H_t。

阶段二 · 构建重放模拟器(Construct Replay Simulator)

刚生成的树 T_t(连同此前所有 T_i)被转换成一个可复用模拟器池。论文称此为"经验重放模拟器"——它是对"已被观察到的那部分搜索空间"的一个接地(grounded)的、精确的模型。注意"精确"二字:它不像学出来的世界模型那样是近似,它就是那片已实现的搜索空间本身。

阶段三 · 基于做梦的策略改进(Dreaming-based Policy Improvement)

一个策略开发智能体(另一个 LLM)开始干活。它盯着三样东西:当前策略 π_t^0 在梦里的轨迹与分数、前几版修订的反馈、整棵发现树。然后直接改写策略代码,产出 π_t^1, π_t^2 … π_t^{M-1}。每一版都在同一个模拟器池上重放打分。最终从全部 M 个候选里挑出分数最高者,作为下一代在线策略 π_{t+1} 部署。

打分怎么算——三项构成的重放目标

论文给了明确公式(Section 3, Replay objective)。设 N_i^m 为第 i 棵树在第 m 版策略重放下揭示的非根节点数(即它代表的生成—评估请求数),k_i^{m,*} 为其决策轮数,则:

V_i^m = max_{v∈T} s_v − β₁·N_i^m + β₂·( N_i^m / max{1, k_i^{m,*}} )

第一项(质量):梦中所能达到的最优解得分 max s_v。

第二项(成本):惩罚尝试的代数 N_i^m,β₁≥0 越大越抠门。

第三项(并行奖励):奖励每轮平均并行尝试数,鼓励策略一次批量开多条线,而非串行独走。β₂≥0。这套"并行奖励"恰是一作此前 Parallel-R1 / Parallel-Probe 那条研究线的直系子孙。

最终策略得分取在固定历史上各树的平均:V^m = (1/t)·∑ V_i^m。

机制要害

重放评估的"零成本"来自一个前提:所有节点的结果已落盘。策略只需读取记录、以不同路径/顺序/并行度遍历历史,不调一次模型、不跑一行代码。一次昂贵的在线 rollout,摊薄成几千次近乎免费的 off-policy 评估——这正是整个框架的杠杆支点。

03为何"永不退步":一个优雅的单调保证

论文最硬气的一句话,是策略部署后绝不会比上一代差。这不是玄学,是一个朴素的结构性约束。

离线阶段开始时,先评估当前已部署策略 π_t^0 = π_t。之后策略开发智能体每修订一版 π_t^{m+1},都在同一批历史树上打分。M 次修订后,下一代在线策略从全部 M 个候选中挑出:

π_{t+1} = π_t^{m*} , m* ∈ argmax_{m∈{0,…,M−1}} V^m

关键在于:候选集里包含了当前策略本身(m=0 那版)。于是选出的胜者必然满足 V^{m*} ≥ V^0。换言之,在固定历史 H_t 的平均重放分上,π_{t+1} 不会劣于 π_t。新策略的下限是"原地踏步",上限是"无限进化"——但这只是重放世界里的下界保证,不是真实能力边界的保证(见 §09)。

"Because the candidate set includes the current policy, this selection satisfies V^{m*} ≥ V^0. Thus, the selected policy π_{t+1} is no worse than the current policy π_t in average replay score on the fixed history H_t."
论文 Section 3 · Policy improvement and selection

04八任务实验:跨算法、数学、GPU 算子三域

实验横跨 8 个科学发现任务。唯一的受控基线叫 Recursive Fixed Exploration——与 Dream-RSI 用完全相同的发现智能体、评估器、初始化和资源约束,只是探索策略永远冻结在第一轮那版手写并行精修策略上。两者第一轮探索策略完全相同,之后才分岔。这才是对方法本身最公平的对照。

一、算法工程 · Lasso 正则化路径求解

在高维统计基础算法上,对比 sklearn、glmnet、SimpleTES(业界最强公开发现系统之一,用 gpt-oss-120b,预算 51,200 次)与受控基线。末列为六留出数据集平均运行时间(毫秒,越低越好):

方法模型调用数Avg(ms)

SimpleTESgpt-oss-120b51,2003,804.8

SimpleTES†(本文复现)gpt-oss-120b51,2008,318.4

Recursive Fixed Expl.Gemini-3.1-Pro5503,587.1

Recursive Fixed Expl.Gemini-3.7-Flash3,2002,516.7

Dream-RSIGemini-3.1-Pro3172,931.0

Dream-RSIGemini-3.7-Flash1,8792,350.6

这里的数字要拆成两层读:317 vs 51,200 = 约 162×(但跨了模型,且 SimpleTES 数字是它论文自报预算);而同模型受控对照下,317 vs 550 ≈ 1.7×,1,879 vs 3,200 ≈ 1.7×。后者才是"做梦"机制本身的增益。

二、数学优化 · 三项极值问题

和差问题(Sum–Difference)、圆装填(Circle Packing)、自相关不等式(Autocorrelation)。在 1,000 代以内达到或超过强基线,相对 SimpleTES 预算节省 50×+。圆装填追平 Google 自家 AlphaEvolve V2 的最强纪录(2.635983)。但自相关研究上 SimpleTES 仍是 SOTA(1.453675 vs 1.456375),只是它花了 51,200 次。

三、GPU 内核工程 · KernelBench 四算子

算子项倍数

VGG16达同等性能所需生成次数降 2.43×

LayerNorm达同等性能所需生成次数降 1.79×

ConvDiv同预算下性能提升2.09×

ConvMax同预算下性能提升1.44×

算子方向收益相对温和但方向一致。有意思的是策略的"自适应"行为:性能上升期主动把每轮尝试从 110 砍到 50;一旦停滞又拉满探索力度,分数随即再涨——没人教它,它从自身历史里"悟"出来的。

数字的真伪 · 必读

"162×" 出自论文,但论文自己把两个 baseline 分得很清:"cuts discovery-agent calls by 1.7× against fixed exploration and up to 162× against SimpleTES"。病毒式传播(如 Dr_Singularity 的 X 帖)引用 162× 时未带 baseline,explainx、cellcog 两家都点名了这点。另:跨系统比较用了不同基座模型(gpt-oss-120b vs Gemini-3.1-Pro),且 SimpleTES 数字是论文自报预算,Dream-RSI 团队并未在同硬件上复跑(表中唯一标注 † 的 SimpleTES† 那行才是他们复现的)。

05反直觉一击:给 AI 总结"经验教训",反而更差

论文藏着一个让所有人都意外的实验。研究者试了"经验总结法"——把历史抽象成高层方向性建议,注入 prompt 指导下一轮探索。结果:加了显式语义指导的,在同等预算下系统性地比不加的更差。

"imposing strong semantic inductive biases regarding future search directions tends to over-constrain the search space and impede diverse exploration."
论文 Section 5.1 · 结论原文

原理解释得很干净:长程科研搜索往往并行铺开许多条线。一旦你过早把"哪里该搜"抽象成高层先验,等于提前焊死了一些看起来没希望、实则可能有价值的路线,把多样性掐死了。而 Dream-RSI 的"做梦"机制不提供任何"空洞真理"——它让新策略直接去碰撞具体的历史树,在并行的微观控制、分支优先级、提早停止这些代码级细节上做优化,反而保住了探索空间的开放。

这对所有做 Agent 记忆/经验复用的团队是一记警钟:把经验压缩成"道理"塞进上下文,可能不如把原始轨迹结构化后留给策略去直接推演。

06谱系对撞:Dream-RSI 在 RSI 坐标系里到底站着哪一格

要评价它的意义,得放进 RSI 的自主性坐标系。业内常用 L1–L5 分档(源自 2609.11873《最后一个由人类设计的 AI》综述):L1 执行指定流程 → L2 自主定策略 → L3 自主定学什么 → L4 部署与环境适应 → L5 改写机制本身。

Dream-RSI 的精确位置

在 L2–L3 的策略层完成递归,明确不触碰 L5。被递归改进的,只是一段轻量编排层 Python 代码;底层编码智能体权重全程冻结。它把 RSI 从"改模型"拽进"改元探索层"。

三路分野

改权重(模型自我修改/生成下一代)风险最高、最不可控;改 harness/skill/memory/context(DGM、OpenRSI 一类)居中;改探索策略(Dream-RSI)最窄、最可审计、可回滚。

系统来路改进对象递归层级评估方式主要局限

Dream-RSIGoogle/DeepMind探索策略代码L2–L3离线重放(零成本)只覆盖已探索空间

AlphaEvolve / V2Google DeepMind候选程序(对象级)L1–L2真实执行评估探索策略固定

SimpleTES论文基线候选方案L1真实执行,51,200 预算无元策略优化

DGM(Darwin Gödel Machine)Sakana AI智能体自身组件/代码L3–L5 cand.真实运行验证长程反馈瓶颈

OpenEvolve / Shinka / Theta / EvoX / TTS-Disc.各家搜索策略 + 候选L2–L3真实执行元策略监督贵而延迟

HGM / RQGMGödel Machine 家族谱系元选择L3–L4真实执行选择规则本身未适应

OpenRSI / Frontis-MA1衔远(周伯文系)agent 组件/harnessL2–L3真实执行工业定级待验

SEAL(self-adapting LMs)MIT模型自我适应L3真实执行论文未引用

VOYAGER / SEAgent技能库路线技能库/记忆L2真实执行技能获取≠机制递归

横向看,Dream-RSI 的核心创新是把"元层优化"从在线、昂贵、长程变成离线、廉价、off-policy。论文自己在 Related Work 里也这么定位:区别于 AlphaEvolve 等对象级求解器,也区别于 DGM 等自我改进 agent(后者多在对象层或卡在长程反馈瓶颈)。

谱系落点

Dream-RSI 不是孤立的"谷歌破解 RSI"事件,而是 2026 年秋"RSI 从模型层下沉到 harness/编排层"这波集体转向里,数据最完整、表述最克制、却被传播放大得最厉害的那一篇。同期扎堆的还有 ModularRSI(2609.14857)、NeoHorse-1、RSIAgent、Atria Dawn(2609.15818)等。

07思想血统:从 Dreamer 的"想象",到这里的"记录"

"做梦"二字不是修辞,它直指一条经典脉络:模型基强化学习里的 world model / imagination。但 Dream-RSI 把这条脉络拧了个方向——它的世界不是学出来的,是记录出来的。

思想链很清晰:DreamerV3 的 latent imagination(在学出来的紧凑世界模型里预演未来)→ model-based RL 的 off-policy 评估 → Dyna 架构(用模型生成的假经验补充真实经验)→ 到 Dream-RSI 的 exact replay simulator。论文项目页也坦然承认它的命名指向 Hafner 的 Dreamer(arXiv:1912.01603)。

但这个类比在哪里成立、在哪里不成立,正是理解其边界的钥匙:

成立处:都在内部模拟环境里预演动作序列,避免每次都用真实世界试错;都依赖"已见过的状态"做推演。棋手复盘、经验回放(experience replay)、off-policy 评估,都是同一个直觉家族。

不成立处(本质限制):真正的 world model 可以外推到没走过的状态——它学了环境的动力学,能想象"如果走这条从没走过的路会怎样"。而 Dream-RSI 的重放模拟器只能重放走过的地方,它不做任何预测,因此"做梦"永远走不出已探索子空间的影子。这恰恰逼出了它的循环结构:必须靠每一轮真实部署去开拓新世界,模拟器池才能长大。

"History is the world it dreams in."
论文扉页金句 · 一作 Tong Zheng

08团队与江湖:实习生挂一作,背后 17 人天团

一作 Tong Zheng(郑童),东北大学本科(肖桐机器翻译组),2024 入马里兰大学读博,师从黄恒(UMD 首任 Brendan Iribe 讲席教授)。Dream-RSI 是 2026 夏以 Google Student Researcher 身份做出。但这篇并非横空出世——它是一条清晰研究线的收口。

一作
Tong Zheng · UMD 博二

通讯
Xidong Wu / Zheng Zhang(Google)

机构分布
Google 9 · UMD 3 · GDM 4 · UVA 1

关键角色
Wang-Cheng Kang(DeepMind · SASRec 作者)

一条被低估的前置论文链

Multi-draft Speculative Decoding(arXiv:2502.18779, ICLR 2025):多草稿投机解码的最优调度。

Parallel-R1(arXiv:2509.07980, ICLR 2026):首个用 RL 让模型在真实数学推理上"并行思考"。

Parallel-Probe(arXiv:2602.03845, ICML 2026):2D probing 揭示并行推理动态,训练无关的共识早停控制器。

AutoTTS(arXiv:2605.08083):这才是 Dream-RSI 的直接原型——把 test-time scaling 策略从手写启发式变成"环境里 agent 自动发现",控制器在离线重放环境里用预收集轨迹评估,无需重复调 LLM。且 Xidong Wu 正是其合作者。

换言之,Dream-RSI 是把 AutoTTS 那套"离线重放 + 控制器合成 + 廉价反馈 + 只改策略代码"四件套,从token 级推理预算分配搬到了agent 级探索预算分配,把"并行思考"换成了"并行探索"——同一思路,换了作用层。

代码与项目:别被"开源"二字误导

GitHub zhengkid/Dream-RSI 创建于 09-13(早于 arXiv 提交约 27 小时),截至 09-17 约 327 star。

没有任何代码,README 明写 "Code is being prepared for release.",且无 LICENSE 文件。AGI Hunt 标题《Google Open-Sources Dream-RSI》不准确。

4 个 issue 中,#3 最有分量:有读者系统比对了 Meta^n、DGM、G-Zero、R-Zero,质问"冻结/可变边界到底是安全属性还是工程成本决策",并指出论文没有 Limitations、没有 Broader Impact / safety 章节。作者未回复。

dream-rsi.com 的 "live demo":页面写 "Drawn live, not recorded",但也写 "Numbers on the canvas are illustrative"——动画是前端实时绘制,但数字是示意值,并非真实 agent 在跑。

社区反应:命名被怼,数字反而少人质疑

X:Dr_Singularity(09-16,峰值 11 万+ 浏览)以"Google 演示了 RSI 循环"引爆;Mark Kretschmann 惊呼"破解了 RSI"。Schmidhuber 连发技术笔记反驳——早在 1987 其毕业论文就给出了第一个具体 RSI 算法(GP 自我进化),"Google 刚 cracked RSI"对他而言不成立。

HackerNews:主帖 207 分 / 50 评论(本周头部),火力集中在"命名投机"(类比 karpathy/autoresearch、kairos harness)而非数字;logicallee 指出附录 B.1 公布了完整 prompt,可复现。

HuggingFace Papers:由一作本人提交,当日第一,约 278 upvotes。

Reddit:截至 09-18 未见可核验的独立讨论帖。

中文圈:新智元最耸动("破解 RSI""ASI 通道");AI前线最尖锐,直指"把 Dream-RSI 描述成无限自我进化,有些夸大了论文结论";量子位点出本质——"更像是 Harness 的自进化"。

更广的背景:Google 侧的 RSI 时间线

DeepMind《From AGI to ASI》(arXiv:2606.12683,2026-06-10,60 页)把 RSI 列为"AGI→ASI 四条路径"中的第三条,并点名 FunSearch 与 AlphaEvolve 已是"弱形式递归改进"的实例。Dream-RSI 是这条路径上一个具体而狭窄的工程实例,而非路径本身。

Logan Kilpatrick(09-16)称"看到 RSI 早期迹象",以 Gemini 3.5→3.8 每三四周一更为例,称 Gemini 4 将是"最大、最野心勃勃的预训练"。他口中的 RSI 是"AI 帮助改进 AI 研发流程",不等于模型改自身权重。

Anthropic 立场克制:"We are not there yet, and recursive self-improvement is not inevitable." 同期 OpenAI、Meta 各有表态,行业进入" pacing the frontier"辩论。

09局限与未答之问:泼三盆冷水

讲完机制与数字,必须摊开它的边界。以下部分来自论文隐含限制,部分为社区质疑。

重放有盲区。模拟器只覆盖已探索子空间,"做梦"走不出历史树的影子。初期探索多样性若贫乏,离线评估出的策略可能陷入局部最优。因此"在线拓新"与"离线精细化"必须动态循环——这正是它被迫做成闭环而非一次性把戏的原因。

任务需可验证评分。成功基石是目标有清晰的形式化验证与评分函数(运行时间、数学约束、单元测试)。在缺乏客观确定性打分的开放式主观任务里,重放奖励的设计难度陡增。论文 8 任务/3 域,样本不算大。

没报"做梦"的墙上时间。省的是调用次数与算力预算,不是绝对时间。M 次策略修订 + 每版在 t 棵树上重放,本身也吃 LLM 算力与墙钟。论文未给出做梦阶段的耗时,公平的全成本账尚未呈现。

无独立 Limitations / Safety 章节。对一篇以 RSI 为题的论文,这本身就是可被合理批评的缺口(见 §08 issue #3)。"冻结独立评估器/模型"本该被写成安全论证,而非默认前提。

增益来源之争。最硬的技术批评指向:全部增益究竟来自"做梦"机制,还是仅仅来自"每轮让 LLM 改写调度代码"?论文缺一个"在线等预算调优"这一最强基线做隔离对照。"成本优势目前只在 vs 什么都不做(固定策略)维度上严格成立"——这条反对意见值得论文方正面回应。

它优化的是"如何搜",不是"搜什么"。能力边界没动,只是边界内的探索效率被拉伸。不会某个任务的模型,再会搜也搜不出能力之外的方案。真正的通用 RSI——改推理能力、改学习机制本身——仍不在这项工作的射程内。

10吾之判词:一条务实、可控、但被高估的缝

Dream-RSI 的价值,不在于它"破解了 RSI",而在于它重新定义了 RSI 的一个可行切面。

当大多数讨论还困在"模型自我修改"的宏大叙事里时,它展示了一条更克制、更可审计、更易落地的路径:让系统学会如何更好地搜索,而不是改变系统本身。把一次昂贵探索沉淀成结构化发现树、在历史里零成本推演策略、并保证单调不退化——这套"基础设施模式"是可复制的,对编译优化、分子搜索、系统调优等一切"探索即成本"的场景都有直接启发。

但它也提醒我们别把音量当成结论。论文摘要真正的自我定位是"在若干设置下(in several settings)达到有竞争力或更好的发现质量并显著降低发现成本"——这个"若干"被几乎所有病毒传播吞掉了。162× 是跨模型、跨配置、跨论文预算的比较;同条件下真实的受控增益是 1.7×。把"Harness 的自进化"读成"AI 无限自我进化",既高估了论文,也低估了真正的 RSI 难题。

落点

给做 Agent / AI4Science 的团队一句话礼物:历史不是废日志,是免费模拟器;把探索策略代码化、让它在自己的轨迹上做梦,比反复微调底座更划算,也更安全。 但请记住——它优化的永远是"如何寻找答案",而答案本身,仍躺在模型能力那道未被移动的天花板之下。

历史即世界
元探索层递归
权重零改动
单调不退化
162× 须带 baseline
语义先验反伤探索
非"破解 RSI"

素材与声明

一手来源:论文 arXiv:2609.14858(v1, 2026-09-14, 12 页)、官方项目页 dream-rsi.com、GitHub zhengkid/Dream-RSI。二手交叉:explainx.ai、cellcog.ai、AI前线、新智元、量子位、虎嗅、HN 主帖(207 分 / 50 评论)、HF Papers(约 278 upvotes)。数字均标注其 baseline;凡论文未报告者(如做梦阶段墙钟、完整 Limitations 章节)已显式说明。谱系 L1–L5 框架源自 2609.11873《The Last AI Built by Humans》综述。本研报为技术拆解,不构成对"RSI 已实现"的判断。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens