「coding agent 开始比价了:Devin Fusion 把一次任务的账单从 12.4 美元压到 7.9 美元」

2026 年 9 月 11 日,Cognition 把 Fusion 推到 Devin CLI 和 Devin Desktop,官方说法是「跨编码基准便宜 39%」。第二天凌晨,Artificial Analysis 公布独立评测:这是 Coding Agent Index 上第一次出现多模型编码 agent。Fab…

2026 年 9 月 11 日,Cognition 把 Fusion 推到 Devin CLI 和 Devin Desktop,官方说法是「跨编码基准便宜 39%」。第二天凌晨,Artificial Analysis 公布独立评测:这是 Coding Agent Index 上第一次出现多模型编码 agent。Fable 5.1 加 SWE-2 的配置拿到 61.7 分,Claude Code 里跑 Fable 5.1 是 62.2 分;每次任务 7.9 美元对 12.4 美元。差的这 4.5 美元不多,够买一杯咖啡。可一个团队一年跑十万次任务,账单差的是 45 万美元。

💵 先看账单:一次任务到底贵在哪

coding agent 的钱主要烧在两处。一是输入,agent 要把整个仓库的上下文反复喂给模型;二是输出,模型一步步写出来的推理、代码、测试、报错重试全都按 token 计费。

过去两年行业的做法是把模型做大,指望一次做对来省下重试的钱。这条路有效,但边际收益在变小。Cognition 这次换了个方向:不改模型,改分工。

Fusion 的结构是「一个 lead 加一个 sidekick」。lead 用前沿模型(Fable 5.1 或 GPT-6 Astra,都是 xhigh),负责会话计划、解释模糊指令、做最终审查。sidekick 用便宜的 SWE-2(medium),负责代码库探索、实现、跑测试,然后把结果回报给 lead。两个 agent 各自持有独立的上下文,交换的是三样东西:

三样东西分别是带约束和成功标准的任务简报、被委派工作的结果、lead 给的反馈。Cognition 的说法是,这样 frontier 模型在整个会话里始终掌握控制权,sidekick 干的活变难时 lead 可以把工作收回来自己做。

🧭 这件事为什么是现在才发生

三年前这么做没有意义。模型之间的能力落差太大,把活交给便宜模型等于把活做砸,重试的钱比省下的钱多。

2026 年的情况是,中等模型在「探索代码库、写样板代码、跑测试、贴回报错」这类活上已经够用,而前沿模型的价格还在往上走。两侧的价格曲线拉开了,中间才有空间放一个路由层。

还有一条工程上的原因。agent 的任务越跑越长,上下文从几万 token 涨到几十万,输入成本在账单里的占比一路上升。这时候省输出 token 已经不够看了,得动输入侧的结构。Fusion 让两个 agent 各持一份独立缓存,交换的是简报和结果而不是完整历史,省的主要是这一块。

🧠 真正的工程细节在缓存里

Fusion 容易被人理解成「请求级路由」,那就看轻它了。请求级路由是每条请求挑一个模型,Fusion 是一个任务同时养两个模型。

这里有个绕不过去的坑。中途换模型会让 prompt 缓存失效,原来攒下的 KV cache 全丢,新模型要重新做一次完整 prefill。这笔缓存税很容易把省下来的模型差价吃掉。

Fusion 的解法是让两个 agent 各自持有独立的、可缓存的上下文,彼此不共享一份不断膨胀的完整对话历史。Cognition 早前在更通用的版本里还描述过另一种做法:把换模型的时机放在上下文压缩点,因为压缩本来就会造成缓存失效,在那里换模型等于顺路搭车。

📊 第三方测出来的数:分数几乎没掉,钱掉了三成六

Artificial Analysis 用的是 Coding Agent Index v1.5。两个配置的结果分开报:

配置指数得分每次任务成本每次任务耗时
Fable 5.1 xhigh + SWE-2 medium(Fusion)61.77.90 美元35.8 分钟
Fable 5.1 max 带回退(Claude Code)62.212.40 美元34.8 分钟
Astra xhigh + SWE-2 medium(Fusion)59便宜 43%快 31%
差 0.5 分,成本少 36%,耗时多 1 分钟。Artificial Analysis 的原话是两种配置都落在「分数对成本」的帕累托前沿上。

分项目看,这个「几乎打平」的合成分数底下藏着不对称。Fable 配置对 Claude Code:DeepSWE 1.1 是 63.1 对 64.3,SWE-Atlas QnA 是 65.9 对 64.8,Terminal-Bench 4.0 是 56.1 对 57.6。仓库问答这类偏检索和理解的活涨了 1.1 分,另外两项各降 1.2 分和 1.5 分。

Cognition 自己还公布过一组更极端的数字:用单价 0.75 美元每百万 token 的 SWE-2 当侧翼,跑 Astra 主导的会话拿到 63.4 分、花 2.34 美元;换成单价 0.20 美元的 Luna,拿 62.0 分、花 2.39 美元。价格降到六分之一,第二次反而更贵一点点,分数还低了。侧翼不是越便宜越好。

🐡 同一天,Sakana 把这件事说成了理论

9 月 11 日 Sakana AI 发布 Fugu Max 和 Fugu Ultra v2。它的提法比 Cognition 更直接:行业十年都在单轴上赛跑,把模型做大做贵;真实世界的前沿是二维的,一根轴是能力,另一根轴是成本。用一个数万亿参数的模型去执行一条简单的数据查询,那是浪费。

Fugu Max 定价 2 美元每百万输入 token、6 美元每百万输出 token。Sakana 说输出价相比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40% 到 60%,在十个基准里的七个上把成本性能帕累托前沿往外推了。

Fugu Ultra v2 走另一头。它在 Chartography 上拿 48.3 分,Sakana 报的对照是 Opus 5 的 27.3、Fable 5 的 29.5;DeepSWE 上 74.3 分,超过那些每 token 贵三到五倍的对照模型。关键点在于:Fable 5、Fable 5.1、GPT-6 Astra 都不在它的 agent 池里。

系统切法切的依据
Devin Fusion按角色切:规划归 lead,执行归 sidekick会话内的角色分工
Sakana Fugu Max按任务切:路由到「能干完的最便宜的模型」任务难度估计
Copilot HydraFusion按维度切:四个轴打分后选执行工作流提示的四维特征评分
第三行来自微软工程师对 GitHub Copilot HydraFusion 引擎的讲解。每个提示在推理深度、代码生成复杂度、调试难度、工具编排需求四个轴上打分,合成一个 HyDRA 分数,然后选三条执行工作流中的一条,并按阶段派模型。它和单模型上的端到端 Auto 模式的区别是:Auto 是挑一个模型跑到底,HydraFusion 是拆阶段派活。

⚖️ 三种切法其实是同一个判断

把它们并排放在一起,能看出来行业在摸同一个东西:一次任务里不同部分的「难度密度」不一样,而难度密度和单价不必挂钩。

规划阶段要的是理解模糊需求、判断取舍,这段贵得有道理。探索代码库、改样板代码、跑一遍测试、把报错贴回来,这些活一个中等模型就够,用前沿模型是在给重复劳动付溢价。

🧪 三条边界

第一,Fusion 的成本数字来自基准测试,不是从你自己的 PR 上跑出来的。Cognition 还报了一个内部数字,自家工程团队合并的 PR 里 88% 走了 Fusion 的自动路由,这一条同样是厂商自述,没有第三方复核。

第二,Sakana 的定价和基准全是厂商自报。Fugu Ultra v2 的训练截止是 2026 年 8 月 28 日,agent 池的完整清单没公开,SWEFish 是它自己的内部编码基准。三组数据都还没被独立复现。

第三,分项分数的不对称。SWE-Atlas QnA 涨、Terminal-Bench 4.0 跌,指向的是交给便宜侧翼的那部分活里,偏判断的那部分掉了分。这条路能省多少钱,取决于你的任务里有多少比例属于探索和测试,有多少属于判断。

一个可验证的指标是 Cognition 那条 88% 的 PR 路由率有没有第三方口径;另一个是 Artificial Analysis 会不会把多模型配置单列成一个常驻分类。它这次明确说,这是第一次有多模型编码 agent 进 index。

参考信源

1. Artificial Analysis 对 Devin Fusion 的独立评测(Coding Agent Index v1.5,2026-09-12),经 AI Primer 与 AGI Hunt 转述:61.7 分 / 7.90 美元 / 35.8 分钟,分项 DeepSWE 1.1、SWE-Atlas QnA、Terminal-Bench 4.0。 2. Cognition 官方发布与 Fusion 技术说明(2026-09-11/12):lead / sidekick 分工、三件交接物、39% 跨基准成本降幅、$0.75/M 与 $0.20/M 侧翼对照。 3. Sakana AI《Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier》(2026-09-11):$2/$6 每百万 token、2 至 6 倍成本、Chartography 48.3、DeepSWE 74.3。 4. 微软工程师对 GitHub Copilot HydraFusion 引擎的讲解(2026-09-12),四轴 HyDRA 评分与三条执行工作流。 5. ExplainX《Devin Fusion CLI: 39% Cheaper Coding Agent Runs》(2026-09):Fusion 与请求级路由、提示缓存的区别。

#AI编码 #智能体 #成本工程

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens