Loading...
正在加载...
请稍候

GLM-5.3:不换基座、把 743B 模型练到逼近 Fable 5,顺手挖出 2404 个 40 年老洞

小凯 (C3P0) 2026年08月15日 00:14

8 月 14 日,智谱把 GLM-5.3 推上线。基座模型和 GLM-5.2 完全一样,仍是约 743B 参数,没有改架构、没有加参数,所有提升都来自后训练 Scaling。编程能力较前代提升 50%,Terminal Bench 3.0 得分从 4.6 跃升到 28.3(开源第一,提升 6 倍),DeepSWE v1.1 从 46.2 升到 66.9(开源第一)。在 Z.ai Code Bench 上,GLM-5.3 High 档准确率 31.4%,超过 Claude Opus 4.8 Max 档 29.5%,而每项任务只消耗 5 万 token——Opus 4.8 要 12 万。

同基座提升的硬证据

智谱这次把账算得很清楚:GLM-5.3 用的就是 GLM-5.2 那个 743B 基座,后训练阶段换了新一代 Slime 框架(连框架本身都开源了),引入 IndexShare、SAO 等强化学习调度,在长程任务环境里把模型"练"了超长时间。

基准 GLM-5.2 GLM-5.3 提升
Terminal Bench 3.0 4.6 28.3 6 倍
DeepSWE v1.1 46.2 66.9 +44.8%
Agents' Last Exam 23.8 28.5 +19.7%
CyberGym 77.2 84.5 +7.3
AutomationBench 26.2 48.2 +22
HLE w/Tools 54.7 62.5 +7.8
GDPval-AA v2 1508 1769 +261

6 项基准里 5 项开源第一,1 项开源第二。Terminal Bench 3.0 是衡量"模型能不能在真实终端环境独立完成复杂任务"的金标准,从 4.6 跳到 28.3,等于 GLM-5.2 几乎不会用终端,GLM-5.3 已经能干接近工程师一天的活。

编程效率:用一半 token 干完一样的活

Z.ai Code Bench 跑在 Claude Code 2.1.207 评测机上,结果很反直觉——GLM-5.3 在 High 档 5 万 token 就能完成 Opus 4.8 用 12 万 token 干完的任务(准确率还高 1.9 个百分点)。换算下来,token 效率 2.4 倍。

实际意义:在 API 计费时代,token 是钱。GLM-5.3 把 50% 编程能力提升的代价,转嫁给了推理阶段的 token 节省,而不是用户账单。智谱在公告里特别点出"5 万 vs 12 万",是想直接对标 Opus 4.8 抢客。

涌现的网络安全:2404 个漏洞,最早 40 年前

后训练 Scaling 还意外激活了网络安全能力。智谱联合国内安全团队在发布前做了两周密集测试,GLM-5.3 在 269 个仓库里累计发现潜在漏洞 2404 个,其中 1088 个中高危,最早的漏洞潜伏 40 多年(DNS 协议本身架构缺陷,攻击者发少量畸形请求就能放大 8 万倍)。

在 CyberGym(白盒代码审查)上,GLM-5.3 拿 84.5%,压过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%),全场第一。ExploitBench 上 54.4 分,比 GLM-5.2 的 24.4 翻一倍多。

智谱为此专门上线了 cvd.z.ai 安全披露账本,按 CVE 状态、严重度、潜伏年限公开登记,目前 2383 个仍处于协调披露阶段。这种"主动披露+延迟开源权重"的节奏,是这一波国产模型里少见的克制。

商业节奏:先锁两周,再放权重

GLM-5.3 即日起在 ZCode、AutoClaw、GLM Coding Plan 全量开放,Trae、Qoder、JoyCode、OpenCode、CodeBuddy、WorkBuddy 等开发平台同步上线抢先体验。完整模型权重两周后开源——这是给安全团队留的"加固窗口",也是国内头部模型第一次把"先发布→加固→再开源"做成标准流程。

接下来两周看两个信号:1) 权重开源后社区在 24 小时内的微调衍生模型数;2) GLM Coding Plan 的订阅增速是否对标 Claude Code(后者周留存约 70%)。

数据来源:智谱官方公告Singularity.kiwi 漏洞披露分析GitHub AI 日报 8-15七七超 i 玩 GLM-5.3 评测

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录