GLM-5.3:不换基座、把 743B 模型练到逼近 Fable 5,顺手挖出 2404 个 40 年老洞
8 月 14 日,智谱把 GLM-5.3 推上线。基座模型和 GLM-5.2 完全一样,仍是约 743B 参数,没有改架构、没有加参数,所有提升都来自后训练 Scaling。编程能力较前代提升 50%,Terminal Bench 3.0 得分从 4.6 跃升到 28.3(开源第一,提升 6 倍),DeepSWE v1.1 从 46.2 升到 66.9(开源第一)。在 Z.ai Code Bench 上,GLM-5.3 High 档准确率 31.4%,超过 Claude Opus 4.8 Max 档 29.5%,而每项任务只消耗 5 万 token——Opus 4.8 要 12 万。
同基座提升的硬证据
智谱这次把账算得很清楚:GLM-5.3 用的就是 GLM-5.2 那个 743B 基座,后训练阶段换了新一代 Slime 框架(连框架本身都开源了),引入 IndexShare、SAO 等强化学习调度,在长程任务环境里把模型"练"了超长时间。
| 基准 | GLM-5.2 | GLM-5.3 | 提升 |
|---|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 | 6 倍 |
| DeepSWE v1.1 | 46.2 | 66.9 | +44.8% |
| Agents' Last Exam | 23.8 | 28.5 | +19.7% |
| CyberGym | 77.2 | 84.5 | +7.3 |
| AutomationBench | 26.2 | 48.2 | +22 |
| HLE w/Tools | 54.7 | 62.5 | +7.8 |
| GDPval-AA v2 | 1508 | 1769 | +261 |
编程效率:用一半 token 干完一样的活
Z.ai Code Bench 跑在 Claude Code 2.1.207 评测机上,结果很反直觉——GLM-5.3 在 High 档 5 万 token 就能完成 Opus 4.8 用 12 万 token 干完的任务(准确率还高 1.9 个百分点)。换算下来,token 效率 2.4 倍。
实际意义:在 API 计费时代,token 是钱。GLM-5.3 把 50% 编程能力提升的代价,转嫁给了推理阶段的 token 节省,而不是用户账单。智谱在公告里特别点出"5 万 vs 12 万",是想直接对标 Opus 4.8 抢客。
涌现的网络安全:2404 个漏洞,最早 40 年前
后训练 Scaling 还意外激活了网络安全能力。智谱联合国内安全团队在发布前做了两周密集测试,GLM-5.3 在 269 个仓库里累计发现潜在漏洞 2404 个,其中 1088 个中高危,最早的漏洞潜伏 40 多年(DNS 协议本身架构缺陷,攻击者发少量畸形请求就能放大 8 万倍)。
在 CyberGym(白盒代码审查)上,GLM-5.3 拿 84.5%,压过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),全场第一。ExploitBench 上 54.4 分,比 GLM-5.2 的 24.4 翻一倍多。
智谱为此专门上线了 cvd.z.ai 安全披露账本,按 CVE 状态、严重度、潜伏年限公开登记,目前 2383 个仍处于协调披露阶段。这种"主动披露+延迟开源权重"的节奏,是这一波国产模型里少见的克制。
商业节奏:先锁两周,再放权重
GLM-5.3 即日起在 ZCode、AutoClaw、GLM Coding Plan 全量开放,Trae、Qoder、JoyCode、OpenCode、CodeBuddy、WorkBuddy 等开发平台同步上线抢先体验。完整模型权重两周后开源——这是给安全团队留的"加固窗口",也是国内头部模型第一次把"先发布→加固→再开源"做成标准流程。
接下来两周看两个信号:1) 权重开源后社区在 24 小时内的微调衍生模型数;2) GLM Coding Plan 的订阅增速是否对标 Claude Code(后者周留存约 70%)。
数据来源:智谱官方公告、Singularity.kiwi 漏洞披露分析、GitHub AI 日报 8-15、七七超 i 玩 GLM-5.3 评测。