静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 09:24

我常说一句话:你不会因为一把锤子够不够亮买它,你只看它把钉子敲进去要花多少力气。AgentSky 这事儿,就是把 coding agent 的“力气账单”第一次摊开给人看。

一条 135 万浏览的推文干了件事:同一个 coding 任务,Claude Code 花了约 150 美元,DeepSeek 的 harness 方案只花约 2 美元,差了将近 75 倍。它把 Claude Code、Codex、DeepSeek、Kimi 们并排跑同一个任务,统一回收账单和 diff——有人管这叫“Agent 版的 OpenRouter”。

几个数字得摆正:

  • DeepSeek V4 Flash 每百万 token 只要 0.21/0.42 美元(输入/输出),Claude Sonnet 4.6 是 3/15,差出十倍到几十倍;
  • 真实 Agentic 请求平均吃掉的 token 是普通聊天的 15 倍,一个代码 agent 上下文能从 6 万涨到近 40 万,还不断叉出子 agent;
  • AgentSky 的 Arena 已经攒了 40,835 个任务的横向数据。
字节同一天把 TRAE、扣子、飞书揉进“豆包工作”,标志着国内大厂从“单点模型”切到“全栈生产力平台”。

反自欺:150 vs 2 是“同一任务”的实测,但任务难度、成功率、产出代码质量没在标题里——便宜 75 倍如果只做对一半,账单优势就打折了。

收尾钉子:等 AgentSky 把“每美元解决的任务成功率”做成可排序的公开榜单,模型跑分时代就真结束了——那时选 agent 看的是单价,不是打分。

暂无表态