「coding agent 开始比价了:Devin Fusion 把一次任务的账单从 12.4 美元压到 7.9 美元」
2026 年 9 月 11 日,Cognition 把 Fusion 推到 Devin CLI 和 Devin Desktop,官方说法是「跨编码基准便宜 39%」。第二天凌晨,Artificial Analysis 公布独立评测:这是 Coding Agent Index 上第一次出现多模型编码 agent。Fab…
2026 年 9 月 11 日,Cognition 把 Fusion 推到 Devin CLI 和 Devin Desktop,官方说法是「跨编码基准便宜 39%」。第二天凌晨,Artificial Analysis 公布独立评测:这是 Coding Agent Index 上第一次出现多模型编码 agent。Fable 5.1 加 SWE-2 的配置拿到 61.7 分,Claude Code 里跑 Fable 5.1 是 62.2 分;每次任务 7.9 美元对 12.4 美元。差的这 4.5 美元不多,够买一杯咖啡。可一个团队一年跑十万次任务,账单差的是 45 万美元。
💵 先看账单:一次任务到底贵在哪
coding agent 的钱主要烧在两处。一是输入,agent 要把整个仓库的上下文反复喂给模型;二是输出,模型一步步写出来的推理、代码、测试、报错重试全都按 token 计费。
过去两年行业的做法是把模型做大,指望一次做对来省下重试的钱。这条路有效,但边际收益在变小。Cognition 这次换了个方向:不改模型,改分工。
Fusion 的结构是「一个 lead 加一个 sidekick」。lead 用前沿模型(Fable 5.1 或 GPT-6 Astra,都是 xhigh),负责会话计划、解释模糊指令、做最终审查。sidekick 用便宜的 SWE-2(medium),负责代码库探索、实现、跑测试,然后把结果回报给 lead。两个 agent 各自持有独立的上下文,交换的是三样东西:
三样东西分别是带约束和成功标准的任务简报、被委派工作的结果、lead 给的反馈。Cognition 的说法是,这样 frontier 模型在整个会话里始终掌握控制权,sidekick 干的活变难时 lead 可以把工作收回来自己做。
🧭 这件事为什么是现在才发生
三年前这么做没有意义。模型之间的能力落差太大,把活交给便宜模型等于把活做砸,重试的钱比省下的钱多。
2026 年的情况是,中等模型在「探索代码库、写样板代码、跑测试、贴回报错」这类活上已经够用,而前沿模型的价格还在往上走。两侧的价格曲线拉开了,中间才有空间放一个路由层。
还有一条工程上的原因。agent 的任务越跑越长,上下文从几万 token 涨到几十万,输入成本在账单里的占比一路上升。这时候省输出 token 已经不够看了,得动输入侧的结构。Fusion 让两个 agent 各持一份独立缓存,交换的是简报和结果而不是完整历史,省的主要是这一块。
🧠 真正的工程细节在缓存里
Fusion 容易被人理解成「请求级路由」,那就看轻它了。请求级路由是每条请求挑一个模型,Fusion 是一个任务同时养两个模型。
这里有个绕不过去的坑。中途换模型会让 prompt 缓存失效,原来攒下的 KV cache 全丢,新模型要重新做一次完整 prefill。这笔缓存税很容易把省下来的模型差价吃掉。
Fusion 的解法是让两个 agent 各自持有独立的、可缓存的上下文,彼此不共享一份不断膨胀的完整对话历史。Cognition 早前在更通用的版本里还描述过另一种做法:把换模型的时机放在上下文压缩点,因为压缩本来就会造成缓存失效,在那里换模型等于顺路搭车。
📊 第三方测出来的数:分数几乎没掉,钱掉了三成六
Artificial Analysis 用的是 Coding Agent Index v1.5。两个配置的结果分开报:
| 配置 | 指数得分 | 每次任务成本 | 每次任务耗时 |
|---|---|---|---|
| Fable 5.1 xhigh + SWE-2 medium(Fusion) | 61.7 | 7.90 美元 | 35.8 分钟 |
| Fable 5.1 max 带回退(Claude Code) | 62.2 | 12.40 美元 | 34.8 分钟 |
| Astra xhigh + SWE-2 medium(Fusion) | 59 | 便宜 43% | 快 31% |
分项目看,这个「几乎打平」的合成分数底下藏着不对称。Fable 配置对 Claude Code:DeepSWE 1.1 是 63.1 对 64.3,SWE-Atlas QnA 是 65.9 对 64.8,Terminal-Bench 4.0 是 56.1 对 57.6。仓库问答这类偏检索和理解的活涨了 1.1 分,另外两项各降 1.2 分和 1.5 分。
Cognition 自己还公布过一组更极端的数字:用单价 0.75 美元每百万 token 的 SWE-2 当侧翼,跑 Astra 主导的会话拿到 63.4 分、花 2.34 美元;换成单价 0.20 美元的 Luna,拿 62.0 分、花 2.39 美元。价格降到六分之一,第二次反而更贵一点点,分数还低了。侧翼不是越便宜越好。
🐡 同一天,Sakana 把这件事说成了理论
9 月 11 日 Sakana AI 发布 Fugu Max 和 Fugu Ultra v2。它的提法比 Cognition 更直接:行业十年都在单轴上赛跑,把模型做大做贵;真实世界的前沿是二维的,一根轴是能力,另一根轴是成本。用一个数万亿参数的模型去执行一条简单的数据查询,那是浪费。
Fugu Max 定价 2 美元每百万输入 token、6 美元每百万输出 token。Sakana 说输出价相比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40% 到 60%,在十个基准里的七个上把成本性能帕累托前沿往外推了。
Fugu Ultra v2 走另一头。它在 Chartography 上拿 48.3 分,Sakana 报的对照是 Opus 5 的 27.3、Fable 5 的 29.5;DeepSWE 上 74.3 分,超过那些每 token 贵三到五倍的对照模型。关键点在于:Fable 5、Fable 5.1、GPT-6 Astra 都不在它的 agent 池里。
| 系统 | 切法 | 切的依据 |
|---|---|---|
| Devin Fusion | 按角色切:规划归 lead,执行归 sidekick | 会话内的角色分工 |
| Sakana Fugu Max | 按任务切:路由到「能干完的最便宜的模型」 | 任务难度估计 |
| Copilot HydraFusion | 按维度切:四个轴打分后选执行工作流 | 提示的四维特征评分 |
⚖️ 三种切法其实是同一个判断
把它们并排放在一起,能看出来行业在摸同一个东西:一次任务里不同部分的「难度密度」不一样,而难度密度和单价不必挂钩。
规划阶段要的是理解模糊需求、判断取舍,这段贵得有道理。探索代码库、改样板代码、跑一遍测试、把报错贴回来,这些活一个中等模型就够,用前沿模型是在给重复劳动付溢价。
🧪 三条边界
第一,Fusion 的成本数字来自基准测试,不是从你自己的 PR 上跑出来的。Cognition 还报了一个内部数字,自家工程团队合并的 PR 里 88% 走了 Fusion 的自动路由,这一条同样是厂商自述,没有第三方复核。
第二,Sakana 的定价和基准全是厂商自报。Fugu Ultra v2 的训练截止是 2026 年 8 月 28 日,agent 池的完整清单没公开,SWEFish 是它自己的内部编码基准。三组数据都还没被独立复现。
第三,分项分数的不对称。SWE-Atlas QnA 涨、Terminal-Bench 4.0 跌,指向的是交给便宜侧翼的那部分活里,偏判断的那部分掉了分。这条路能省多少钱,取决于你的任务里有多少比例属于探索和测试,有多少属于判断。
一个可验证的指标是 Cognition 那条 88% 的 PR 路由率有没有第三方口径;另一个是 Artificial Analysis 会不会把多模型配置单列成一个常驻分类。它这次明确说,这是第一次有多模型编码 agent 进 index。
参考信源
1. Artificial Analysis 对 Devin Fusion 的独立评测(Coding Agent Index v1.5,2026-09-12),经 AI Primer 与 AGI Hunt 转述:61.7 分 / 7.90 美元 / 35.8 分钟,分项 DeepSWE 1.1、SWE-Atlas QnA、Terminal-Bench 4.0。 2. Cognition 官方发布与 Fusion 技术说明(2026-09-11/12):lead / sidekick 分工、三件交接物、39% 跨基准成本降幅、$0.75/M 与 $0.20/M 侧翼对照。 3. Sakana AI《Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier》(2026-09-11):$2/$6 每百万 token、2 至 6 倍成本、Chartography 48.3、DeepSWE 74.3。 4. 微软工程师对 GitHub Copilot HydraFusion 引擎的讲解(2026-09-12),四轴 HyDRA 评分与三条执行工作流。 5. ExplainX《Devin Fusion CLI: 39% Cheaper Coding Agent Runs》(2026-09):Fusion 与请求级路由、提示缓存的区别。
#AI编码 #智能体 #成本工程