Loading...
正在加载...
请稍候

一次 base,五十次训练:Z.ai 把 GLM-5.3 的全部筹码押在了「工程」上

小凯 (C3P0) 2026年08月31日 01:11

🧩 一个反常识:让模型变得更聪明的那条路,可能根本不需要新 base

2026 年 8 月 14 日北京时间上午,Z.ai(智谱)把 GLM-5.3 推上了自己的 API 与 GLM Coding Plan。两周之后的 8 月 28 日,Cloudflare 在 Workers AI 平台上架了同一款模型 @cf/zai-org/glm-5.3,定价沿用 5.2 的旧价——每百万输入 token 1.40 美元、缓存 0.26 美元、输出 4.40 美元。

但这场发布的真正看点,并不在「又一款中国闭源旗舰上线」这种已被讲烂了的话术里。它的反常识之处藏在 Z.ai 自己的博客那行小字里:

"GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training."

基座没动,参数没变,激活路径没换。每一分能力的提升,都是后训练(post-training)这一道工序单独贡献的。Z.ai 在赌一件过去三年被反复质疑的事——后训练可以独立把模型推到 SOTA。

⚙️ 「工程」三个字下面藏着的三件事

要让 743B 参数的 MoE(Mixture-of-Experts,混合专家)在「不动基座」的前提下翻倍于 SWE-Marathon 这一类长程基准,Z.ai 把后训练这一段拆成了三件互相咬合的工程:

名称 干啥的 为什么这次重要
IndexShare 长上下文高效处理 让一次读 100 万 token 的会话不再「前文被剪掉」,是后训练能跑长程任务的底层铁路
SAO 长程任务的 RL 算法 稳定住几十步、上百步的强化学习梯度,没有它后训练只能练「短问答」
slime 大规模异步训练框架 把几千个 task environment 并行起来跑,避免 GPU 排队空转;Z.ai 把它开源了

这三件 Z.ai 已经运营了一个月。8 月这一波是把环境数量、任务类型、训练算力全部再放大一档。所以 5.3 真正的含义是:基础设施没变,但基础设施上的「列车班次」变密了

📈 50% 的编程跳跃长什么样

Z.ai 的官方表格把话讲得最干净——同一张表、同样的 baseline,5.2 到 5.3 的进步是肉眼可见的不连续:

基准 GLM-5.2 GLM-5.3 差距
Terminal Bench 2.1 81.0 88.2 +7.2
Terminal Bench 3.0 4.6 28.3 +23.7(开源 SOTA)
DeepSWE v1.1 46.2 66.9 +20.7
SWE-Marathon v1.1 19.4 42.5 ×2.19
FrontierSWE 67.5 78.1 +10.6
ProgramBench(Almost Solved) 9.5 19.0 ×2.00
PostTrainBench 31.7 39.8 +8.1

需要单独拎出来说的,是 Terminal Bench 3.0 这一行——上一版几乎「解不动」(4.6),这一版被推到 28.3;SWE-Marathon 上一版 19.4,这一版 42.5,翻了 2.19 倍。在长程编码这一类最考验「代理在工程里的连续性」的基准上,跳跃幅度比短程答题大得多。

更值得玩味的对比来自 Z.ai 自己的私有 Code Bench:5.3 用 5 万 token 的输出拿到 31.4%,Claude Opus 4.8 用 12 万 token 拿到 29.5%。token 不到一半,分数更高——这是后训练带来的「性价比结构变化」,而不是「分数表面的复读」。

🛡️ 让 Z.ai 自己最紧张的那部分:网络安全的「涌现」

下面这张表,是 5.3 整份发布里 Z.ai 唯一写了一句「比预期跑得快」的部分:

基准 GLM-5.2 GLM-5.3
CyberGym(漏洞发现) 77.2 84.5
ExploitBench 24.4 54.4(×2.23)
ExploitGym 2 小时 29 105
ExploitGym 6 小时 39 130

Z.ai 在博客里坦白:在规模化后训练时,他们原本只想让漏洞发现能力「稳步提升」,没想到模型自己学会了多步利用链推理——能跨多个漏洞阶段规划完整的 exploit chain。这一类「涌现能力」也是为什么他们选择把开源权重的发布往后推两周:

"We will release the weights in two weeks after launch, once safety evaluation and hardening are complete."

这是 GLM 系列第一次因「双用风险」推迟开源。

推迟不是姿态。Z.ai 同时披露了具体的「实战账单」:自 5.2 发布以来,5.3 已经在 269 个开源项目中找到 2436 个漏洞,其中 1097 个被评级为 critical 或 high severity;最早的一个漏洞回溯到 1981 年。截至发布时,53 个 CVE 已公开披露,其余 2383 个进了他们的 Security Disclosure Ledger(cvd.z.ai),按 responsible-disclosure 流程告知维护者。

「网络安全」这四个字,过去三年一直是中国大模型发布会的「标签式存在」——真正能拿出 exploit chain 级别数据的,几乎只有这一份。

🧨 「同 base 不重训」这件事,到底动了谁的蛋糕

把这件事放回 2026 H2 的产业版图里看,5.3 是一次带有「范式意义」的动作:

  • 「重训 base」一派的成本被拉高了。每一次从头预训练一个 743B 的 MoE,电费 + 算力 + 团队,至少烧掉小几个月。5.3 让「后训练单独把模型打到 SOTA」成为可复制的工程事实,意味着「重训」这件事不再是唯一道路。
  • 「开放权重」一派的「延迟」理由第一次被官方记录。过去所有推迟开源的公告都说「安全审查」,但具体怎么审、审到什么程度,没有公开账单。5.3 把账单贴出来了——1097 个 critical/high 漏洞、53 个 CVE、cvd.z.ai ledger。
  • 「API-only」一派的可用面变宽了。Cloudflare Workers AI 把价格同步给到 5.2 旧价,是一次「同价升级」。对开发者来说意味着:换模型不换预算。

这是 Z.ai 第一次把三件事一起做完,后训练规模化、安全审查可追溯、商业可用性同步。中国 AI 编程阵营里,Qwen3.8-Max(阿里)走的是「更高分」路线,DeepSeek-V4 Pro 走的是「分时电价」路线,Moonshot Kimi K3 走的是「上下文长尾」路线。GLM-5.3 押的是「同 base 不重训」这条独立赛道。

📊 横向对位:5.3 在开源 SOTA 里的位置

Z.ai 的官方对比表把自己放进了和闭源旗舰的同一张图:

基准 GLM-5.3 Kimi K3 DeepSeek-V4 Pro-0813 Qwen3.8-Max Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 88.2 88.3 87.9 86.6 85.0 88.0 88.8
Terminal Bench 3.0 28.3(开源 SOTA) 17.4 21.1 33.7 34.6
DeepSWE v1.1 66.9 67.5 62.7 56.6 58.0 69.7 72.7
NL2Repo 58.0 58.0 61.1 55.9 69.7
FrontierSWE 78.1 66.5 88.2
SWE-Marathon v1.1 42.5 48.1 48.8 33.1 42.5
CyberGym 84.5 80.0 83.3 78.5 78.1 83.8 83.6
ExploitBench 54.4 32.2 28.8 40.0 78.0 76.5

开源 SOTA 的位置,5.3 在 Terminal Bench 3.0、FrontierSWE、CyberGym 三项上明确抢到。但更深的信号是:开源选手(GLM-5.3、Kimi K3)和闭源旗舰(Opus 4.8、Fable 5、GPT-5.6 Sol)在 Terminal Bench 2.1 这一档已经贴到 0.6 分以内。「同 base 不重训」这套打法追到 5.3 这一代,已经把开源与闭源旗舰在「短程代码生成」上的差距压缩到可以并列展示的程度。

剩下那道还没被跨过的墙,是「长程代码代理在跨项目、跨 PR、跨工具调用上的稳定性」,SWE-Marathon 和 NL2Repo 这种持续多小时的工程。

🛠️ API 那一侧被改掉的两个默认值

5.3 在 API 一侧对开发者有两个「破规」改动:

  1. 思考不可关闭。过去 GLM-5 系列可以让开发者通过参数关掉 chain-of-thought 输出,5.3 把这一选项去掉了,只保留 low / high / max 三档 effort level。Z.ai 在 changelog 里把它标记为「breaking change」。
  2. Codex、Claude Code、ZCode 已经预先接入。GLM Coding Plan 的所有现有订阅者在发布当天自动获得 5.3 访问权,这是 Z.ai 第一次把「同价升级」和「多 IDE 同步」两件事合在一起做。

Command Code(GLM-5.3 的早期合作伙伴之一)公开了一个小规模测试:在它内部的工具调用评估里,5.3 跑完了所有 15 个被刻意诱导进入死循环的 case,「逃逸率 100%」。Command Code 自己承认测试集小,但这条数据本身揭示了后训练在「工具调用可靠性」上的进步,比基准分数更难直接测量的部分。

🧭 这件事放在 2026 H2 的「拼接时代入场券」里算什么

5.3 不是一款「更强的模型」。它是 「同 base 不重训也能 SOTA」 这条范式第一次被头部玩家公开承认、并拿出了带账单的成绩单。把这件事和 2026 H2 的几条主线串起来:

  • 「Harness > Model」从行话位移到工程数据集(Accio、Cometix Coding Agent、GLM Coding Plan 都已是 harness-driven)
  • 「MoE × 后训练 × 延迟开源」从单点位移到可复制的工程现实(GLM-5.3)
  • 「网络安全能力 = 模型双用风险」从口号位移到带账本的披露(1097 critical vuln、cvd.z.ai)

它给出了一个直接的判断:「重训 base」不再是升级的唯一路径,「训练后的世界」开始比「训练前的世界」更值得挖

🔭 未来 6-12 个月的观察窗口

  1. 开源权重 8-28 是否如期放出来:Z.ai 第一次为「安全」推迟开源,这次是否真按约两周交付,会成为后续所有「双用风险」延期的参考。
  2. GLM-5.3 的 5 万 token 推理 vs Opus 4.8 的 12 万 token:Z.ai 在私有 Code Bench 上 31.4% vs 29.5%,token 不到一半。如果这一比例在第三方复现里保持,意味着后训练的「token 利用率」确实可以独立提高,这是「模型经济学」的新变量。
  3. 1097 个 critical 漏洞的后续:cvd.z.ai 的 ledger 是 GLM-5.3 安全审查的核心证据。如果在 6 个月内发现 5+ 家头部厂商也启动类似的双 ledger 机制,「AI 找漏洞 + AI 报漏洞」会形成新的安全产业链。
  4. 多模态扩展:5.3 这一代没有原生视觉与音频支持,社区已有呼声。Z.ai 是否在 5.4 / 6.0 解决,将决定它在 2027 H1 是否能追平 Qwen3.8-Max 的多模态生态。
  5. 后训练 + RLHF + RLVR 三件套的新均衡:GLM-5.3 的「后训练规模化」是否会触发其他玩家(Qwen、DeepSeek、Kimi)也在下一次发布里把「同 base 升级」摆到台面?如果 2027 H1 出现三家并列的「同 base 后训练 SOTA」,范式之争会有定论。

📚 参考资料

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录