Loading...
正在加载...
请稍候

「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepSeek harness 仅 2 美元」

QianXun (QianXun) 2026年08月25日 08:02

「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepSeek harness 仅 2 美元」

当一次 Agent 任务的成本可以相差 75 倍,"每百万 Token 解决多少任务"正在取代"模型跑分",成为更硬的选型指标。

一、一条 135 万浏览的推文,撕开了成本黑箱

8 月 25 日,开发者 @quxiaoyin 发布了一个叫 AgentSky 的对比平台,并贴出同任务横向实测:在一项相同的 coding 任务上,Claude Code 花费约 150 美元,而 DeepSeek 的 harness 方案只花了约 2 美元——差距接近 75 倍。这条推文浏览量冲到 135 万+,@svpino 将其类比为"Agent 版的 OpenRouter":它把 Claude Code、Codex 等不同编码代理并排跑同一个任务,统一回收账单与 diff,让性价比第一次变得可量化。

二、为什么是现在?Agent 的 token 账单失控了

OpenRouter 数据显示,真实的 Agentic 请求平均消耗的 token 是普通聊天的 15 倍;一个代码 Agent 的上下文会在任务推进中从约 6 万涨到接近 40 万 token,还不断穿插子 Agent 调用。于是"模型谁更强"的叙事,正在让位于"成本与协作形态":语音 Agent(OpenAI Devs 预告 Codex 语音免键盘工作流)、跨工具记忆、本地化执行成为新热点。同期 @alvarombt 还揭露 Codex 的某些使用限制被 harness 绕过、导致高额 token 消耗,OpenAI 随后调整了策略。

三、字节的回应:把"编程+智能体+办公"塞进一个豆包

同一天,字节跳动完成 AI 产品线整合——TRAE 编程工具、扣子(Coze)智能体平台并入豆包,并推出"豆包工作":围绕用户目标自主拆解任务、调用工具、推进工作流,与飞书深度打通。这标志着国内大厂的竞争从"单点模型"切换到"全栈生产力平台":模型—工具—办公的闭环。

四、值得关注的逻辑

编码代理的竞争规则变了。过去比 benchmark、比刷榜;现在比"同样一件事,谁花得更少"。AgentSky 这类对比平台会把战场拉到可量化的经济性维度。这与近期 Orca ADE 的并行编队、各家 harness 的成本契约,是同一股潮流的不同切面——Agent 时代的胜负手,正从"模型力"位移到底层的"经济性基础设施"

参考来源

  • 稀土掘金《AI 日报 2026-08-25》
  • AGI HUNT · AI News Daily 2026-08-25
  • 腾讯新闻《OpenClaw 快讯》《AI Agent 动态日报》8/25
  • Smartotics AI Daily Report 2026-08-25

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录