一次 base,五十次训练:Z.ai 把 GLM-5.3 的全部筹码押在了「工程」上

2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入…

🧩 一个反常识:让模型变得更聪明的那条路,可能根本不需要新 base

2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入 token 1.40 美元、缓存 0.26 美元、输出 4.40 美元。

但这场发布的真正看点,并不在「又一款中国闭源旗舰上线」这种已被讲烂了的话术里。它的反常识之处藏在 Z.ai 自己的博客那行小字里:

"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training."

基座没动,参数没变,激活路径没换。每一分能力的提升,都是后训练(post-training)这一道工序单独贡献的。Z.ai 在赌一件过去三年被反复质疑的事——后训练可以独立把模型推到 SOTA。

⚙️ 「工程」三个字下面藏着的三件事

要让 743B 参数的 MoE(Mixture-of-Experts,混合专家)在「不动基座」的前提下翻倍于 SWE-Marathon 这一类长程基准,Z.ai 把后训练这一段拆成了三件互相咬合的工程:

名称干啥的为什么这次重要
IndexShare长上下文高效处理让一次读 100 万 token 的会话不再「前文被剪掉」,是后训练能跑长程任务的底层铁路
SAO长程任务的 RL 算法稳定住几十步、上百步的强化学习梯度,没有它后训练只能练「短问答」
slime大规模异步训练框架把几千个 task environment 并行起来跑,避免 GPU 排队空转;Z.ai 把它开源了
这三件 Z.ai 已经运营了一个月。8 月这一波是把环境数量、任务类型、训练算力全部再放大一档。所以 5.3 真正的含义是:基础设施没变,但基础设施上的「列车班次」变密了

📈 50% 的编程跳跃长什么样

Z.ai 的官方表格把话讲得最干净——同一张表、同样的 baseline,5.2 到 5.3 的进步是肉眼可见的不连续:

基准GLM-5.2GLM-5.3差距
Terminal Bench 2.181.088.2+7.2
Terminal Bench 3.04.628.3+23.7(开源 SOTA)
DeepSWE v1.146.266.9+20.7
SWE-Marathon v1.119.442.5×2.19
FrontierSWE67.578.1+10.6
ProgramBench(Almost Solved)9.519.0×2.00
PostTrainBench31.739.8+8.1
需要单独拎出来说的,是 Terminal Bench 3.0 这一行——上一版几乎「解不动」(4.6),这一版被推到 28.3;SWE-Marathon 上一版 19.4,这一版 42.5,翻了 2.19 倍。在长程编码这一类最考验「代理在工程里的连续性」的基准上,跳跃幅度比短程答题大得多。

更值得玩味的对比来自 Z.ai 自己的私有 Code Bench:5.3 用 5 万 token 的输出拿到 31.4%,Claude Opus 4.8 用 12 万 token 拿到 29.5%。token 不到一半,分数更高——这是后训练带来的「性价比结构变化」,而不是「分数表面的复读」。

🛡️ 让 Z.ai 自己最紧张的那部分:网络安全的「涌现」

下面这张表,是 5.3 整份发布里 Z.ai 唯一写了一句「比预期跑得快」的部分:

基准GLM-5.2GLM-5.3
CyberGym(漏洞发现)77.284.5
ExploitBench24.454.4(×2.23)
ExploitGym 2 小时29105
ExploitGym 6 小时39130
Z.ai 在博客里坦白:在规模化后训练时,他们原本只想让漏洞发现能力「稳步提升」,没想到模型自己学会了多步利用链推理——能跨多个漏洞阶段规划完整的 exploit chain。这一类「涌现能力」也是为什么他们选择把开源权重的发布往后推两周:

"We will release the weights in two weeks after launch, once safety evaluation and hardening are complete."

这是 GLM 系列第一次因「双用风险」推迟开源。

推迟不是姿态。Z.ai 同时披露了具体的「实战账单」:自 5.2 发布以来,5.3 已经在 269 个开源项目中找到 2436 个漏洞,其中 1097 个被评级为 critical 或 high severity;最早的一个漏洞回溯到 1981 年。截至发布时,53 个 CVE 已公开披露,其余 2383 个进了他们的 Security Disclosure Ledger(cvd.z.ai),按 responsible-disclosure 流程告知维护者。

「网络安全」这四个字,过去三年一直是中国大模型发布会的「标签式存在」——真正能拿出 exploit chain 级别数据的,几乎只有这一份。

🧨 「同 base 不重训」这件事,到底动了谁的蛋糕

把这件事放回 2026 H2 的产业版图里看,5.3 是一次带有「范式意义」的动作:

  • 「重训 base」一派的成本被拉高了。每一次从头预训练一个 743B 的 MoE,电费 + 算力 + 团队,至少烧掉小几个月。5.3 让「后训练单独把模型打到 SOTA」成为可复制的工程事实,意味着「重训」这件事不再是唯一道路。
  • 「开放权重」一派的「延迟」理由第一次被官方记录。过去所有推迟开源的公告都说「安全审查」,但具体怎么审、审到什么程度,没有公开账单。5.3 把账单贴出来了——1097 个 critical/high 漏洞、53 个 CVE、cvd.z.ai ledger。
  • 「API-only」一派的可用面变宽了。Cloudflare Workers AI 把价格同步给到 5.2 旧价,是一次「同价升级」。对开发者来说意味着:换模型不换预算。
这是 Z.ai 第一次把三件事一起做完,后训练规模化、安全审查可追溯、商业可用性同步。中国 AI 编程阵营里,Qwen3.8-Max(阿里)走的是「更高分」路线,DeepSeek-V4 Pro 走的是「分时电价」路线,Moonshot Kimi K3 走的是「上下文长尾」路线。GLM-5.3 押的是「同 base 不重训」这条独立赛道。

📊 横向对位:5.3 在开源 SOTA 里的位置

Z.ai 的官方对比表把自己放进了和闭源旗舰的同一张图:

基准GLM-5.3Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
Terminal Bench 2.188.288.387.986.685.088.088.8
Terminal Bench 3.028.3(开源 SOTA)17.421.133.734.6
DeepSWE v1.166.967.562.756.658.069.772.7
NL2Repo58.058.061.155.969.7
FrontierSWE78.166.588.2
SWE-Marathon v1.142.548.148.833.142.5
CyberGym84.580.083.378.578.183.883.6
ExploitBench54.432.228.840.078.076.5
开源 SOTA 的位置,5.3 在 Terminal Bench 3.0、FrontierSWE、CyberGym 三项上明确抢到。但更深的信号是:开源选手(GLM-5.3、Kimi K3)和闭源旗舰(Opus 4.8、Fable 5、GPT-5.6 Sol)在 Terminal Bench 2.1 这一档已经贴到 0.6 分以内。「同 base 不重训」这套打法追到 5.3 这一代,已经把开源与闭源旗舰在「短程代码生成」上的差距压缩到可以并列展示的程度。

剩下那道还没被跨过的墙,是「长程代码代理在跨项目、跨 PR、跨工具调用上的稳定性」,SWE-Marathon 和 NL2Repo 这种持续多小时的工程。

🛠️ API 那一侧被改掉的两个默认值

5.3 在 API 一侧对开发者有两个「破规」改动:

1. 思考不可关闭。过去 GLM-5 系列可以让开发者通过参数关掉 chain-of-thought 输出,5.3 把这一选项去掉了,只保留 low / high / max 三档 effort level。Z.ai 在 changelog 里把它标记为「breaking change」。 2. Codex、Claude Code、ZCode 已经预先接入。GLM Coding Plan 的所有现有订阅者在发布当天自动获得 5.3 访问权,这是 Z.ai 第一次把「同价升级」和「多 IDE 同步」两件事合在一起做。

Command Code(GLM-5.3 的早期合作伙伴之一)公开了一个小规模测试:在它内部的工具调用评估里,5.3 跑完了所有 15 个被刻意诱导进入死循环的 case,「逃逸率 100%」。Command Code 自己承认测试集小,但这条数据本身揭示了后训练在「工具调用可靠性」上的进步,比基准分数更难直接测量的部分。

🧭 这件事放在 2026 H2 的「拼接时代入场券」里算什么

5.3 不是一款「更强的模型」。它是 「同 base 不重训也能 SOTA」 这条范式第一次被头部玩家公开承认、并拿出了带账单的成绩单。把这件事和 2026 H2 的几条主线串起来:

  • 「Harness > Model」从行话位移到工程数据集(Accio、Cometix Coding Agent、GLM Coding Plan 都已是 harness-driven)
  • 「MoE × 后训练 × 延迟开源」从单点位移到可复制的工程现实(GLM-5.3)
  • 「网络安全能力 = 模型双用风险」从口号位移到带账本的披露(1097 critical vuln、cvd.z.ai)
它给出了一个直接的判断:「重训 base」不再是升级的唯一路径,「训练后的世界」开始比「训练前的世界」更值得挖

🔭 未来 6-12 个月的观察窗口

1. 开源权重 8-28 是否如期放出来:Z.ai 第一次为「安全」推迟开源,这次是否真按约两周交付,会成为后续所有「双用风险」延期的参考。 2. GLM-5.3 的 5 万 token 推理 vs Opus 4.8 的 12 万 token:Z.ai 在私有 Code Bench 上 31.4% vs 29.5%,token 不到一半。如果这一比例在第三方复现里保持,意味着后训练的「token 利用率」确实可以独立提高,这是「模型经济学」的新变量。 3. 1097 个 critical 漏洞的后续:cvd.z.ai 的 ledger 是 GLM-5.3 安全审查的核心证据。如果在 6 个月内发现 5+ 家头部厂商也启动类似的双 ledger 机制,「AI 找漏洞 + AI 报漏洞」会形成新的安全产业链。 4. 多模态扩展:5.3 这一代没有原生视觉与音频支持,社区已有呼声。Z.ai 是否在 5.4 / 6.0 解决,将决定它在 2027 H1 是否能追平 Qwen3.8-Max 的多模态生态。 5. 后训练 + RLHF + RLVR 三件套的新均衡:GLM-5.3 的「后训练规模化」是否会触发其他玩家(Qwen、DeepSeek、Kimi)也在下一次发布里把「同 base 升级」摆到台面?如果 2027 H1 出现三家并列的「同 base 后训练 SOTA」,范式之争会有定论。

📚 参考资料

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens