Loading...
正在加载...
请稍候

小模型跑马拉松,编译器当翻译:智能体的省钱路线

QianXun • 2026年10月02日 00:43

先看两个分数:77.5 和 78.2。同一张考卷,SWE-bench Verified,五百个人工核验过的真实仓库修 bug 任务。前一个来自一只 90 亿参数的小模型,后一个来自一个把源代码晾在一边、改问编译器的智能体。两者相差 0.7 分,走的路却几乎相反。

过去一年,头部编程智能体拼的是大参数、长上下文、多模型协作。这两条新路线都在问同一件事:钱花在刀刃上了吗。

🏃 十小时马拉松选手:arXiv 2609.34378

Marathoner 出自蚂蚁集团、北京大学与澳门大学的团队,底座是 Qwen3.5-9B,一个开源权重的小模型。论文标题里的 Ultra-Long-Horizon 是关键词:让智能体在真实仓库上连续干十小时以上。

训法分四步。第一步造题,从一万多个 GitHub 仓库里抽出十万条大版本 PR,每条新增代码超过一千行,以这些真实改动为底合成任务。第二步把五道任务串成一道,执行上限放到四十小时,论文里叫 Multi-Task Chaining。第三步用强教师模型加多种执行框架生成轨迹,做拒绝采样微调。第四步上强化学习,每次推演都在独立沙箱里真跑真验证。

最特别的是奖励设计。论文管它叫 Later Stage Bonus Reward,明确奖励执行后程的有效操作。原因很直白:长任务里模型最常见的死法是后程泄劲,前半程按部就班,后半程开始乱来。【推论】 这条奖励等于把人类马拉松选手的配速策略写进了目标函数。

成绩单是这样:SWE-bench Verified 77.5,底座模型只有 43.8,提高 33.7 分;在 FrontierSWE 和 SWE-Marathon 两个长时程基准上超过 Gemini-3.1-Pro【转引自 AICrier 对论文的解读】。论文摘要的说法是,在最难的任务上能连续工作十小时以上、完成一千次以上工具调用。

十小时什么概念?一个标准工作日。一千次工具调用,折合每分钟按一到两次工具键,连按十个钟头不撒手。

不过有一处限定必须写明。据 AICrier 的解读,FrontierSWE 的平均单次执行是 3.56 小时、648 次工具调用,十小时与一千次那组数字来自其中最难的执行子集,代表的是上限而非平均。另外,论文三十页,权重、训练代码与数据集都还没有放出,第三方暂时无法复跑。

🔍 不读代码的翻译官:开发者自述发布

同一段时间,另一位开发者放出了 Benzi。它的核心主张用一句话说完:让编译器和静态分析替模型把代码读懂。

主流智能体的通行做法是抓代码片段或建向量索引去逼近程序结构,代价是 token 消耗膨胀、上下文漂移、压缩后遗忘,多文件重构时行号一变就崩。Benzi 换了一条路:改代码之前,先让编译器报出这次改动的波及范围,跑完全套静态检查;模型几乎不需要再问这个函数被谁调用。

开发者公布的一组阅读量对比:完成同样的任务,Benzi 加 Sonnet 只读 9125 行代码;Claude Code 加 Sonnet 读 20704 行;DeepSeek 的执行框架读 43598 行;OpenCode 超过六万五千行,还因反复失败被取消资格。加上所谓 truth tiers 分层,静态可验证的事实与静态验证不了的事实分开管理,中间用运行时追踪器搭桥。

基准分数:SWE-bench Verified 78.2%,单次修复成本低于 10 美分,用的是 V4flash 这个型号。语言覆盖从 Python、JS/TS 到 Rust 的九种主流选择。

必须标注:以上数字全部来自开发者自述,目前没有第三方复现报告。【判断】 在这个领域,自述分数与复现分数之间的距离,通常比 0.7 分远得多。

🧮 两条路线的账本

这张表对比的是两条路线各自把宝押在哪里、以及押注的兑现状态。

维度 Marathoner Benzi
核心赌注 耐力可以训练进权重 结构性知识可以从编译器白拿
底座 Qwen3.5-9B 开源小模型 Claude Sonnet 系加编译器工具链
SWE-bench Verified 77.5(底座 43.8) 78.2(自述)
单次修复成本 未披露 低于 0.1 美元(自述)
外部复现 权重与代码未放出 无第三方复现报告
最直接的软肋 最难子集才到十小时 依赖编译器覆盖的语言

有意思的是,两条路线殊途同归的地方在可验证性。Marathoner 的强化学习必须真跑测试拿真反馈,Benzi 的每次写入都要过语法与语义验证。智柴 9 月 14 日那篇 ripwire 拆解里提过一个说法,agent 动手前需要一块确定性地板,grep 丢掉的结构要在索引侧一次付清。Benzi 相当于把那块地板铺满了,Marathoner 则是在地板上练长跑。【判断】

🧭 复现之前,都只是自述

这两个工作还有一个共同的背景音:行业对基准分数的信任正在变薄。九月的智柴已经记过一次沙箱越界与基准口径的争议,这一次的 77.5 与 78.2 能不能被外部团队复跑出来,比分数本身更值得等。

如果复现成立,编程智能体的成本曲线会多出一个明显下折:小模型加好课纲,或者大模型加好工具。如果复现不成立,它们就只是榜单上又两个好看的自述数字。


信源:arXiv 2609.34378(Marathoner,2026-09-28 提交)、AGI Hunt 2026-10-02 日报、AICrier 对 Marathoner 的解读、AGI Hunt 对 Benzi 的报道。

限定:Marathoner 超过 Gemini-3.1-Pro 的对比与 FrontierSWE 平均执行时长均转引自 AICrier,未逐项核对论文正文表格;Benzi 全部数字为开发者自述,无第三方复现;V4flash 具体所指未查明;十小时与一千次工具调用是最难执行子集的上限值,平均数由 AICrier 给出,为 3.56 小时与 648 次。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录