一次 base,五十次训练:Z.ai 把 GLM-5.3 的全部筹码押在了「工程」上
2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入…
🧩 一个反常识:让模型变得更聪明的那条路,可能根本不需要新 base
2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入 token 1.40 美元、缓存 0.26 美元、输出 4.40 美元。
但这场发布的真正看点,并不在「又一款中国闭源旗舰上线」这种已被讲烂了的话术里。它的反常识之处藏在 Z.ai 自己的博客那行小字里:
"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training."
基座没动,参数没变,激活路径没换。每一分能力的提升,都是后训练(post-training)这一道工序单独贡献的。Z.ai 在赌一件过去三年被反复质疑的事——后训练可以独立把模型推到 SOTA。
⚙️ 「工程」三个字下面藏着的三件事
要让 743B 参数的 MoE(Mixture-of-Experts,混合专家)在「不动基座」的前提下翻倍于 SWE-Marathon 这一类长程基准,Z.ai 把后训练这一段拆成了三件互相咬合的工程:
| 名称 | 干啥的 | 为什么这次重要 |
|---|---|---|
| IndexShare | 长上下文高效处理 | 让一次读 100 万 token 的会话不再「前文被剪掉」,是后训练能跑长程任务的底层铁路 |
| SAO | 长程任务的 RL 算法 | 稳定住几十步、上百步的强化学习梯度,没有它后训练只能练「短问答」 |
| slime | 大规模异步训练框架 | 把几千个 task environment 并行起来跑,避免 GPU 排队空转;Z.ai 把它开源了 |
📈 50% 的编程跳跃长什么样
Z.ai 的官方表格把话讲得最干净——同一张表、同样的 baseline,5.2 到 5.3 的进步是肉眼可见的不连续:
| 基准 | GLM-5.2 | GLM-5.3 | 差距 |
|---|---|---|---|
| Terminal Bench 2.1 | 81.0 | 88.2 | +7.2 |
| Terminal Bench 3.0 | 4.6 | 28.3 | +23.7(开源 SOTA) |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | ×2.19 |
| FrontierSWE | 67.5 | 78.1 | +10.6 |
| ProgramBench(Almost Solved) | 9.5 | 19.0 | ×2.00 |
| PostTrainBench | 31.7 | 39.8 | +8.1 |
更值得玩味的对比来自 Z.ai 自己的私有 Code Bench:5.3 用 5 万 token 的输出拿到 31.4%,Claude Opus 4.8 用 12 万 token 拿到 29.5%。token 不到一半,分数更高——这是后训练带来的「性价比结构变化」,而不是「分数表面的复读」。
🛡️ 让 Z.ai 自己最紧张的那部分:网络安全的「涌现」
下面这张表,是 5.3 整份发布里 Z.ai 唯一写了一句「比预期跑得快」的部分:
| 基准 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| CyberGym(漏洞发现) | 77.2 | 84.5 |
| ExploitBench | 24.4 | 54.4(×2.23) |
| ExploitGym 2 小时 | 29 | 105 |
| ExploitGym 6 小时 | 39 | 130 |
"We will release the weights in two weeks after launch, once safety evaluation and hardening are complete."
这是 GLM 系列第一次因「双用风险」推迟开源。
推迟不是姿态。Z.ai 同时披露了具体的「实战账单」:自 5.2 发布以来,5.3 已经在 269 个开源项目中找到 2436 个漏洞,其中 1097 个被评级为 critical 或 high severity;最早的一个漏洞回溯到 1981 年。截至发布时,53 个 CVE 已公开披露,其余 2383 个进了他们的 Security Disclosure Ledger(cvd.z.ai),按 responsible-disclosure 流程告知维护者。
「网络安全」这四个字,过去三年一直是中国大模型发布会的「标签式存在」——真正能拿出 exploit chain 级别数据的,几乎只有这一份。
🧨 「同 base 不重训」这件事,到底动了谁的蛋糕
把这件事放回 2026 H2 的产业版图里看,5.3 是一次带有「范式意义」的动作:
- 「重训 base」一派的成本被拉高了。每一次从头预训练一个 743B 的 MoE,电费 + 算力 + 团队,至少烧掉小几个月。5.3 让「后训练单独把模型打到 SOTA」成为可复制的工程事实,意味着「重训」这件事不再是唯一道路。
- 「开放权重」一派的「延迟」理由第一次被官方记录。过去所有推迟开源的公告都说「安全审查」,但具体怎么审、审到什么程度,没有公开账单。5.3 把账单贴出来了——1097 个 critical/high 漏洞、53 个 CVE、cvd.z.ai ledger。
- 「API-only」一派的可用面变宽了。Cloudflare Workers AI 把价格同步给到 5.2 旧价,是一次「同价升级」。对开发者来说意味着:换模型不换预算。
📊 横向对位:5.3 在开源 SOTA 里的位置
Z.ai 的官方对比表把自己放进了和闭源旗舰的同一张图:
| 基准 | GLM-5.3 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3(开源 SOTA) | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| FrontierSWE | 78.1 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathon v1.1 | 42.5 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| CyberGym | 84.5 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitBench | 54.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
剩下那道还没被跨过的墙,是「长程代码代理在跨项目、跨 PR、跨工具调用上的稳定性」,SWE-Marathon 和 NL2Repo 这种持续多小时的工程。
🛠️ API 那一侧被改掉的两个默认值
5.3 在 API 一侧对开发者有两个「破规」改动:
1. 思考不可关闭。过去 GLM-5 系列可以让开发者通过参数关掉 chain-of-thought 输出,5.3 把这一选项去掉了,只保留 low / high / max 三档 effort level。Z.ai 在 changelog 里把它标记为「breaking change」。
2. Codex、Claude Code、ZCode 已经预先接入。GLM Coding Plan 的所有现有订阅者在发布当天自动获得 5.3 访问权,这是 Z.ai 第一次把「同价升级」和「多 IDE 同步」两件事合在一起做。
Command Code(GLM-5.3 的早期合作伙伴之一)公开了一个小规模测试:在它内部的工具调用评估里,5.3 跑完了所有 15 个被刻意诱导进入死循环的 case,「逃逸率 100%」。Command Code 自己承认测试集小,但这条数据本身揭示了后训练在「工具调用可靠性」上的进步,比基准分数更难直接测量的部分。
🧭 这件事放在 2026 H2 的「拼接时代入场券」里算什么
5.3 不是一款「更强的模型」。它是 「同 base 不重训也能 SOTA」 这条范式第一次被头部玩家公开承认、并拿出了带账单的成绩单。把这件事和 2026 H2 的几条主线串起来:
- 「Harness > Model」从行话位移到工程数据集(Accio、Cometix Coding Agent、GLM Coding Plan 都已是 harness-driven)
- 「MoE × 后训练 × 延迟开源」从单点位移到可复制的工程现实(GLM-5.3)
- 「网络安全能力 = 模型双用风险」从口号位移到带账本的披露(1097 critical vuln、cvd.z.ai)
🔭 未来 6-12 个月的观察窗口
1. 开源权重 8-28 是否如期放出来:Z.ai 第一次为「安全」推迟开源,这次是否真按约两周交付,会成为后续所有「双用风险」延期的参考。 2. GLM-5.3 的 5 万 token 推理 vs Opus 4.8 的 12 万 token:Z.ai 在私有 Code Bench 上 31.4% vs 29.5%,token 不到一半。如果这一比例在第三方复现里保持,意味着后训练的「token 利用率」确实可以独立提高,这是「模型经济学」的新变量。 3. 1097 个 critical 漏洞的后续:cvd.z.ai 的 ledger 是 GLM-5.3 安全审查的核心证据。如果在 6 个月内发现 5+ 家头部厂商也启动类似的双 ledger 机制,「AI 找漏洞 + AI 报漏洞」会形成新的安全产业链。 4. 多模态扩展:5.3 这一代没有原生视觉与音频支持,社区已有呼声。Z.ai 是否在 5.4 / 6.0 解决,将决定它在 2027 H1 是否能追平 Qwen3.8-Max 的多模态生态。 5. 后训练 + RLHF + RLVR 三件套的新均衡:GLM-5.3 的「后训练规模化」是否会触发其他玩家(Qwen、DeepSeek、Kimi)也在下一次发布里把「同 base 升级」摆到台面?如果 2027 H1 出现三家并列的「同 base 后训练 SOTA」,范式之争会有定论。
📚 参考资料
- Z.ai 官方博客:GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
- Cloudflare Workers AI Changelog 2026-08-28:Z.ai GLM-5.3 now available on Workers AI
- Bitdeer AI Cloud 2026-08-31:What Is GLM-5.3? Built to Code. Ready for Cyber Defense
- Augmenter.dev:Z.ai unveils GLM-5.3 for coding agents and cyber defense
- TokenStead:GLM-5.3: the coding upgrade Z.ai is holding back for safety review
- AI Bars 2026-08-14:Z.ai's GLM-5.3 Posts a 50% Coding Jump, Tops Open-Weight Benchmarks