Loading...
正在加载...
请稍候

清华 SIGS 开源 VeriLoopCoder-E1:32B 以内拿下 HF 三项第一,中国 AI 编程范式开始转向「做实验」

小凯 (C3P0) 2026年08月17日 00:55

32B 以内的参数、HF 榜单三项核心指标断层第一、SE-AgentBench 仅次于某闭源商用旗舰——这是清华 SIGS(深圳国际研究生院)刘厚德教授与王立博博士后团队开源的 VeriLoopCoder-E1(中文名「循证」)在 7 月 27 日 HuggingFace 社区榜单(收录 self-published 评测)上交出的成绩单。对手名单里写着 DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B,全是当前中文大模型圈的顶流。

这个名字「Veri(验证)+ Loop(闭环)+ Coder(编码者)」是工程师的暗号。它不叫「码农助手」,也不叫「Copilot Pro」,而是「会自我复盘的 AI 工程师」。

32B 凭什么挤进第一梯队

循证没走「大力出奇迹」路线,参数压死在 32B 内,而是把工程做到了「双剑合璧」:「宿主侧表层参数高效微调适配器」+「自驱式闭环智能体运行框架」。

前者解决的是「怎么把通用模型快速适配到具体代码项目」——不做全量微调,而是用表层参数高效适配器,几分钟内就能让模型学会新代码库的语法规范、架构约定、命名习惯。后者解决的是「怎么让 AI 像资深工程师那样干活」——把原本割裂的五个动作:代码生成、工具调用(自动拉 Git、启 Docker)、测试反馈(单元/集成/回归全包)、错误归因(空指针?边界溢出?并发竞态?)、回归控制(改完 A 不能崩掉 B)——拧成一条可持续迭代的「智能流」。

换句话说,别的模型输出的是「代码快照」,循证交付的是「可验证、可追溯、可回滚的软件状态」。这就是它在 HuggingFace 公开榜单上把「修复成功率」和「回归稳定性」同时推上榜首的根本原因。

范式转折:从「写代码」到「做实验」

循证让人重新想一个问题:当模型规模不再是唯一变量,「工程敬畏感」反而成了稀缺品。

2024-2025 年,大模型圈卷的是「生成速度」「上下文长度」「多语言覆盖」,但 demo 惊艳、上线即崩的案例比比皆是。软件不是 PPT,是千万行代码织就的精密神经网络;一次未捕获的异常,可能让金融系统丢掉毫秒级套利窗口;一处未覆盖的边界,可能让自动驾驶误判 0.3 秒——而这 0.3 秒,就是生死线。

清华 SIGS 团队没选择「炫技式开源」,而是直击产业痛点:真实世界里的 Bug,从来不是语法错误,而是语义错位、状态漂移、时序紊乱。他们给 AI 装上了「测试驱动」的 DNA,让模型每写一行代码,都自动生成测试、跑回归、对照预期。

它对开发者意味着什么

GitHub 上 48 小时内 Star 飙至 9300+,知乎话题「如何看待清华 SIGS 发布 VeriLoopCoder-E1?」阅读量超 410 万。一位在腾讯 Turing Lab 实习的硕士生在评论区写道:「昨天用它修了一个卡了三天的 Rust 生命周期 bug,它不仅给出修正方案,还自动生成了 5 个边界 case 测试用例。我盯着屏幕看了两分钟,然后默默关掉了 Stack Overflow。」

更深层的变化在「人机协同的权力边界」。开发者不再和 Bug 肉搏,而是成为「问题定义者」和「验证策略师」;AI 也不再是「代码搬运工」,而是「可信协作者」与「质量守门员」。Copilot X 仍在「增强程序员」,循证已在「进化开发范式」。

模型已在 HuggingFace、ModelScope、OpenI 同步开源,支持 PyTorch 2.4+ 与 vLLM 0.6.3 推理加速,要求 GPU 显存 ≥ 24GB——靠谱的 AI,从不廉价。

接下来 6 个月,看三个验证点:第一,华为云 DevOps 流水线、比亚迪车载 OS 迭代平台是否集成循证;第二,「修复成功率」和「回归稳定性」两个指标会不会成为行业新基准;第三,中国 AI 从「文本理解」到「系统认知」的关键跃迁,能否在更多工业场景里跑通。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录