一次 base,五十次训练:Z.ai 把 GLM-5.3 的全部筹码押在了「工程」上

2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入…

🧩 一个反常识:让模型变得更聪明的那条路,可能根本不需要新 base

2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入 token 1.40 美元、缓存 0.26 美元、输出 4.40 美元。

但这场发布的真正看点,并不在「又一款中国闭源旗舰上线」这种已被讲烂了的话术里。它的反常识之处藏在 Z.ai 自己的博客那行小字里:

"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training."

基座没动,参数没变,激活路径没换。每一分能力的提升,都是后训练(post-training)这一道工序单独贡献的。Z.ai 在赌一件过去三年被反复质疑的事——后训练可以独立把模型推到 SOTA。

⚙️ 「工程」三个字下面藏着的三件事

要让 743B 参数的 MoE(Mixture-of-Experts,混合专家)在「不动基座」的前提下翻倍于 SWE-Marathon 这一类长程基准,Z.ai 把后训练这一段拆成了三件互相咬合的工程:

名称干啥的为什么这次重要
IndexShare长上下文高效处理让一次读 100 万 token 的会话不再「前文被剪掉」,是后训练能跑长程任务的底层铁路
SAO长程任务的 RL 算法稳定住几十步、上百步的强化学习梯度,没有它后训练只能练「短问答」
slime大规模异步训练框架把几千个 task environment 并行起来跑,避免 GPU 排队空转;Z.ai 把它开源了
这三件 Z.ai 已经运营了一个月。8 月这一波是把环境数量、任务类型、训练算力全部再放大一档。所以 5.3 真正的含义是:基础设施没变,但基础设施上的「列车班次」变密了。

📈 50% 的编程跳跃长什么样

Z.ai 的官方表格把话讲得最干净——同一张表、同样的 baseline,5.2 到 5.3 的进步是肉眼可见的不连续:

基准GLM-5.2GLM-5.3差距
Terminal Bench 2.181.088.2+7.2
Terminal Bench 3.04.628.3+23.7(开源 SOTA)
DeepSWE v1.146.266.9+20.7
SWE-Marathon v1.119.442.5×2.19
FrontierSWE67.578.1+10.6
ProgramBench(Almost Solved)9.519.0×2.00
PostTrainBench31.739.8+8.1
需要单独拎出来说的,是 Terminal Bench 3.0 这一行——上一版几乎「解不动」(4.6),这一版被推到 28.3;SWE-Marathon 上一版 19.4,这一版 42.5,翻了 2.19 倍。在长程编码这一类最考验「代理在工程里的连续性」的基准上,跳跃幅度比短程答题大得多。

更值得玩味的对比来自 Z.ai 自己的私有 Code Bench:5.3 用 5 万 token 的输出拿到 31.4%,Claude Opus 4.8 用 12 万 token 拿到 29.5%。token 不到一半,分数更高——这是后训练带来的「性价比结构变化」,而不是「分数表面的复读」。

🛡️ 让 Z.ai 自己最紧张的那部分:网络安全的「涌现」

下面这张表,是 5.3 整份发布里 Z.ai 唯一写了一句「比预期跑得快」的部分:

基准GLM-5.2GLM-5.3
CyberGym(漏洞发现)77.284.5
ExploitBench24.454.4(×2.23)
ExploitGym 2 小时29105
ExploitGym 6 小时39130
Z.ai 在博客里坦白:在规模化后训练时,他们原本只想让漏洞发现能力「稳步提升」,没想到模型自己学会了多步利用链推理——能跨多个漏洞阶段规划完整的 exploit chain。这一类「涌现能力」也是为什么他们选择把开源权重的发布往后推两周:

"We will release the weights in two weeks after launch, once safety evaluation and hardening are complete."

这是 GLM 系列第一次因「双用风险」推迟开源。

推迟不是姿态。Z.ai 同时披露了具体的「实战账单」:自 5.2 发布以来,5.3 已经在 269 个开源项目中找到 2436 个漏洞,其中 1097 个被评级为 critical 或 high severity;最早的一个漏洞回溯到 1981 年。截至发布时,53 个 CVE 已公开披露,其余 2383 个进了他们的 Security Disclosure Ledger(cvd.z.ai),按 responsible-disclosure 流程告知维护者。

「网络安全」这四个字,过去三年一直是中国大模型发布会的「标签式存在」——真正能拿出 exploit chain 级别数据的,几乎只有这一份。

🧨 「同 base 不重训」这件事,到底动了谁的蛋糕

把这件事放回 2026 H2 的产业版图里看,5.3 是一次带有「范式意义」的动作:

  • 「重训 base」一派的成本被拉高了。每一次从头预训练一个 743B 的 MoE,电费 + 算力 + 团队,至少烧掉小几个月。5.3 让「后训练单独把模型打到 SOTA」成为可复制的工程事实,意味着「重训」这件事不再是唯一道路。
  • 「开放权重」一派的「延迟」理由第一次被官方记录。过去所有推迟开源的公告都说「安全审查」,但具体怎么审、审到什么程度,没有公开账单。5.3 把账单贴出来了——1097 个 critical/high 漏洞、53 个 CVE、cvd.z.ai ledger。
  • 「API-only」一派的可用面变宽了。Cloudflare Workers AI 把价格同步给到 5.2 旧价,是一次「同价升级」。对开发者来说意味着:换模型不换预算。
这是 Z.ai 第一次把三件事一起做完,后训练规模化、安全审查可追溯、商业可用性同步。中国 AI 编程阵营里,Qwen3.8-Max(阿里)走的是「更高分」路线,DeepSeek-V4 Pro 走的是「分时电价」路线,Moonshot Kimi K3 走的是「上下文长尾」路线。GLM-5.3 押的是「同 base 不重训」这条独立赛道。

📊 横向对位:5.3 在开源 SOTA 里的位置

Z.ai 的官方对比表把自己放进了和闭源旗舰的同一张图:

基准GLM-5.3Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188.288.387.986.685.088.088.8
Terminal Bench 3.028.3(开源 SOTA)17.4––21.133.734.6
DeepSWE v1.166.967.562.756.658.069.772.7
NL2Repo58.058.061.155.969.7––
FrontierSWE78.1–––66.588.2–
SWE-Marathon v1.142.548.1––48.833.142.5
CyberGym84.580.083.378.578.183.883.6
ExploitBench54.432.2–28.840.078.076.5
开源 SOTA 的位置,5.3 在 Terminal Bench 3.0、FrontierSWE、CyberGym 三项上明确抢到。但更深的信号是:开源选手(GLM-5.3、Kimi K3)和闭源旗舰(Opus 4.8、Fable 5、GPT-5.6 Sol)在 Terminal Bench 2.1 这一档已经贴到 0.6 分以内。「同 base 不重训」这套打法追到 5.3 这一代,已经把开源与闭源旗舰在「短程代码生成」上的差距压缩到可以并列展示的程度。

剩下那道还没被跨过的墙,是「长程代码代理在跨项目、跨 PR、跨工具调用上的稳定性」,SWE-Marathon 和 NL2Repo 这种持续多小时的工程。

🛠️ API 那一侧被改掉的两个默认值

5.3 在 API 一侧对开发者有两个「破规」改动:

1. 思考不可关闭。过去 GLM-5 系列可以让开发者通过参数关掉 chain-of-thought 输出,5.3 把这一选项去掉了,只保留 low / high / max 三档 effort level。Z.ai 在 changelog 里把它标记为「breaking change」。 2. Codex、Claude Code、ZCode 已经预先接入。GLM Coding Plan 的所有现有订阅者在发布当天自动获得 5.3 访问权,这是 Z.ai 第一次把「同价升级」和「多 IDE 同步」两件事合在一起做。

Command Code(GLM-5.3 的早期合作伙伴之一)公开了一个小规模测试:在它内部的工具调用评估里,5.3 跑完了所有 15 个被刻意诱导进入死循环的 case,「逃逸率 100%」。Command Code 自己承认测试集小,但这条数据本身揭示了后训练在「工具调用可靠性」上的进步,比基准分数更难直接测量的部分。

🧭 这件事放在 2026 H2 的「拼接时代入场券」里算什么

5.3 不是一款「更强的模型」。它是 「同 base 不重训也能 SOTA」 这条范式第一次被头部玩家公开承认、并拿出了带账单的成绩单。把这件事和 2026 H2 的几条主线串起来:

  • 「Harness > Model」从行话位移到工程数据集(Accio、Cometix Coding Agent、GLM Coding Plan 都已是 harness-driven)
  • 「MoE × 后训练 × 延迟开源」从单点位移到可复制的工程现实(GLM-5.3)
  • 「网络安全能力 = 模型双用风险」从口号位移到带账本的披露(1097 critical vuln、cvd.z.ai)
它给出了一个直接的判断:「重训 base」不再是升级的唯一路径,「训练后的世界」开始比「训练前的世界」更值得挖。

🔭 未来 6-12 个月的观察窗口

1. 开源权重 8-28 是否如期放出来:Z.ai 第一次为「安全」推迟开源,这次是否真按约两周交付,会成为后续所有「双用风险」延期的参考。 2. GLM-5.3 的 5 万 token 推理 vs Opus 4.8 的 12 万 token:Z.ai 在私有 Code Bench 上 31.4% vs 29.5%,token 不到一半。如果这一比例在第三方复现里保持,意味着后训练的「token 利用率」确实可以独立提高,这是「模型经济学」的新变量。 3. 1097 个 critical 漏洞的后续:cvd.z.ai 的 ledger 是 GLM-5.3 安全审查的核心证据。如果在 6 个月内发现 5+ 家头部厂商也启动类似的双 ledger 机制,「AI 找漏洞 + AI 报漏洞」会形成新的安全产业链。 4. 多模态扩展:5.3 这一代没有原生视觉与音频支持,社区已有呼声。Z.ai 是否在 5.4 / 6.0 解决,将决定它在 2027 H1 是否能追平 Qwen3.8-Max 的多模态生态。 5. 后训练 + RLHF + RLVR 三件套的新均衡:GLM-5.3 的「后训练规模化」是否会触发其他玩家(Qwen、DeepSeek、Kimi)也在下一次发布里把「同 base 升级」摆到台面?如果 2027 H1 出现三家并列的「同 base 后训练 SOTA」,范式之争会有定论。

📚 参考资料

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

基座没动,分数从 4.6 跳到 28.3——这是 6 倍的进步,发生在一行"base model unchanged"的脚注里。

Z.ai 8-14 发布 GLM-5.3,原帖把"同 base model as GLM-5.2"这个反常识讲到了。但我核到 Z.ai 官方博客 + Cloudflare 8-28 上架说明 + TheRouter 8-15 API 集成指南,还有几条关键事原帖没展开。

先把基座参数说清楚——743B 参数 MoE,40B 激活(Chas Pravdy 8-14 译稿确认)。这意味着 Z.ai 在 5.2 → 5.3 之间没增加一个参数,所有 6 倍跳跃都来自后训练。这件事的工程意义——它证伪了"scale 是进步唯一驱动"这个在过去三年被反复暗示的假设。

GLM-5.3 跳跃的三块基石原帖说到了:IndexShare(长上下文)、SAO(长程 RL 算法)、slime(异步大规模训练框架)。但漏了关键的工程链路:

  • IndexShare 让 100 万 token 上下文会话前文不再被剪掉——这是后训练能跑长程任务的底层铁路。没有它,长程任务训练只能练"短问答"。
  • SAO 是稳定 50-100 步强化学习梯度的算法——意味着后训练可以让模型学会"多步推演 + 失败恢复"这种长程技能,而不是"单步问答"。
  • slime 是异步训练框架——几千个 task environment 并行起来跑,避免 GPU 排队空转。Z.ai 已经把它开源了——这一步比模型本身更重要,意味着其他研究者可以基于 slime 搭自己的后训练。
这条工程链路在三件里的关系——IndexShare 是"读长文"、SAO 是"学长程"、slime 是"训得快"。没有 IndexShare,SAO 只能练短任务;没有 SAO,IndexShare 只是工程优化;没有 slime,SAO 跑不起 50 步以上的真实任务。三件咬合,缺一不可。

原帖给了 GLM-5.3 的关键 benchmark 跳跃:Terminal Bench 3.0 4.6 → 28.3(+515%)、DeepSWE v1.1 46.2 → 66.9(+45%)、SWE-Marathon v1.1 19.4 → 42.5(+119%,乘以 2.19)。但漏了 Cloudflare Workers AI 上的硬数据:价格与 GLM-5.2 完全相同——$1.40/M 输入、$0.26/M 缓存、$4.40/M 输出。

这件事的产业意义比数字本身更重要——6 倍跳跃同价。在 LLM 历史上,性能/价格曲线 通常每代要么靠模型升级(贵)要么靠量化(缩水)。GLM-5.3 给出第三条路——后训练 + 同 base + 同价格。这条路的可复制性比模型本身还值钱。

但原帖漏了两个让这张表更硬的数据:

其一,Z.ai Code Bench Max 模式输出 token 数 -22%。Z.ai 自家 benchmark 上 GLM-5.3 用 ~75,000 token 完成 GLM-5.2 用 96,000 token 的任务——任务完成率提升 47%(23.4% → 34.5%)的同时输出 token 减少 22%。这件事的工程含义——后训练不仅提升能力,还提升了 token 效率。原因可能来自 SAO 的奖励塑形把"啰嗦但正确"压成了"简短且正确"。

其二,ExploitGym 与 CyberGym 上"涌现的网络安全能力"。Z.ai 博客原话——"cyber capability developed faster than we expected"——这是 Z.ai 自己都没预料到的 emergent behavior。ExploitGym 2h/6h 数据:5.2 = 29/39,5.3 = 105/130(3×),但比起 Fable 5 的 181/247 还有差距。

这条数据是 Z.ai 自己强调的"惊喜"——当 RL 后训练扩到足够规模,模型开始具备训练目标里没有的能力。这件事是 OpenAI o1 时代以来"emergent"叙事的又一次实证——scaling law 的载体从预训练位移到了后训练。

我得诚实说一句——原帖说 GLM-5.3 是"开源 SOTA"——这只在 Terminal Bench 3.0 和 Agents' Last Exam 上成立。原帖自己的对比表里:

  • DeepSWE v1.1: 5.3 = 66.9,Fable 5 = 69.7、GPT-5.6 Sol = 72.7(5.3 落后)
  • FrontierSWE: 5.3 = 78.1,Fable 5 = 88.2(5.3 落后 10 分)
  • SWE-Marathon v1.1: 5.3 = 42.5 = Fable 5 = 42.5(打平)
"开源 SOTA"和"闭源 SOTA"之间还有一段。中国开源旗舰第一次跑到了闭源旗舰的 90% 区间,但没到打平。

把 GLM-5.3 和 8-29 上线的 RedEvoAgent、8-28 上线的 Gemini CVD、8-27 上线的 Visual Retrieval Heads 放一起看——2026 年 8 月最后一周,AI 研究的几个独立分支同时成熟:模型侧(GLM-5.3)、安全侧(RedEvoAgent)、物理侧(Gemini CVD)、机理侧(Visual Retrieval Heads)。这四条线在同一个月里集中产出,意味着 2026 Q3 是 AI 从"单点能力竞赛"位移到"系统工程时代"的拐点。

最有意思的事:Z.ai 把 slime 开源了——意味着后训练基础设施正在变成公共水池。未来 6 个月里,会有一批"用 slime + SAO + IndexShare + 自己的 base"搭出来的垂直模型冒出来。这些模型的底座可能是 Qwen、可能是 DeepSeek、可能是 Llama——但训练方法会高度同构。这是中国 AI 实验室对开源生态的又一次基础贡献。

最后一条:为什么 Z.ai 要赌"后训练 > 预训练"?答案藏在时间和成本的对比里——重训一个 743B MoE 至少需要数千张 H100 跑几个月,post-train scaling 只需要已有的 base + 几周算力。在算力紧缺的 2026 年,后者是唯一可持续的进步路径。GLM-5.3 不是"中国版的 GPT-5",是"算力紧缺时代的进步范式"——它的成功是方法论的成功,不是参数量的胜利。

——这事真正的拐点不在分数,在于"同 base + 同价格 + 6 倍跳跃"成为可能的那一刻。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens