编程模型的下半场,不是「写更多代码」,而是「能发现别人写错的代码」。
智谱 8 月 14 日发布的 GLM-5.3 把这件事明面化了:它在不换基座、纯靠后训练 Scaling 的情况下,Terminal-Bench 从 4.6 跃至 28.3、DeepSWE 升至 66.9、对比 GLM-5.2 在内部 Z.ai Code Bench 上提升约 50%,两周内开源权重。一句话总结:这是当下编程能力最强的开源模型,且这个「最强」不只是写代码,而是顺带把网络空间安全也「涌现」出来了。
数据点:从写代码到「挖漏洞」
GLM-5.3 在白盒网络安全基准 CyberGym 上拿到 84.5%,直接追平 Anthropic 的闭源旗舰 Mythos 5。截至公开发布时,模型在真实环境中累计发现 2436 个漏洞,其中 1097 个被评定为中高危,覆盖内核、浏览器、DNS 等 269 个开源项目。这不是「代码补全」副业能跑出来的成绩单——它需要在理解大型代码项目上下文的同时,主动推理攻击面,而这些技能在传统编程基准里压根不考。
更有意思的是它把「编程模型」与「安全模型」打通这件事写进了产品叙事。智谱同步推出「开源的盾」计划,宣布对重点开源项目免费提供安全审计,把前沿安全能力当作「应开源而非闭源特权」的公共物品。这是一种新的定位:大模型公司不再只是给开发者写工具,而是把模型变成开源生态的「免疫系统」。
限制:CyberGym 不是真实世界
需要给数字降温。CyberGym 是白盒、有 ground truth 的评测集,真实漏洞的验证仍然依赖 CVE 编号、人工复现与披露流程。模型能不能在「零日漏洞挖掘」这种长链路任务里保持同样的得分,目前没有任何公开证据。换句话说,GLM-5.3 在「已知有洞的地方找洞」这件事上做得很好,但「在没人觉得有洞的地方挖出新洞」仍是另一个量级的工程。
另外,84.5% 这个数字本身,要看作「编程能力达到一定程度后自然涌现出的副产物」,而不是 GLM-5.3 的设计目标。它不是专门为安全审计训练的模型,只是代码理解足够深之后,理解漏洞就变成顺路的事。
它改变了什么
编程模型赛道的「下一个竞速点」被悄悄换掉了。过去六个月,各家卷的是「能不能跑通 SWE-Bench、HumanEval、LiveCodeBench」。从 GLM-5.3 开始,这条赛道的边界被推开:一个模型能不能既写代码、又能审代码、还能发现别人代码里的漏洞,将成为新的能力分水岭。
更宏观地看,这意味着开源模型正在从「性能追赶」转向「能力外溢」。开源闭源的差距不在 Coding 本体,而在 Coding 之外的副产物——安全、运维、文档、可观测性。GLM-5.3 跑出了「代码智能体的护城河不在写,而在审」的第一条样本线。
接下来 12 个月,值得盯三个验证点:第一,DeepSeek-V5、Qwen3.9、Kimi K4 会不会也把 CyberGym 类基准写进发布材料;第二,「开源的盾」计划能否在 6 个月内把 GLM-5.3 的安全审计能力商业化打包成 SaaS;第三,Coding 能力 + 安全能力的「双榜冠军」会不会成为下一代模型默认发布姿势。
写代码的模型已经不少了。能审计别人代码的开源编程模型,这是头一回正式摆到台面上。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。