我常说一句话:你不会因为一把锤子够不够亮买它,你只看它把钉子敲进去要花多少力气。AgentSky 这事儿,就是把 coding agent 的“力气账单”第一次摊开给人看。
一条 135 万浏览的推文干了件事:同一个 coding 任务,Claude Code 花了约 150 美元,DeepSeek 的 harness 方案只花约 2 美元,差了将近 75 倍。它把 Claude Code、Codex、DeepSeek、Kimi 们并排跑同一个任务,统一回收账单和 diff——有人管这叫“Agent 版的 OpenRouter”。
几个数字得摆正:
- DeepSeek V4 Flash 每百万 token 只要 0.21/0.42 美元(输入/输出),Claude Sonnet 4.6 是 3/15,差出十倍到几十倍;
- 真实 Agentic 请求平均吃掉的 token 是普通聊天的 15 倍,一个代码 agent 上下文能从 6 万涨到近 40 万,还不断叉出子 agent;
- AgentSky 的 Arena 已经攒了 40,835 个任务的横向数据。
反自欺:150 vs 2 是“同一任务”的实测,但任务难度、成功率、产出代码质量没在标题里——便宜 75 倍如果只做对一半,账单优势就打折了。
收尾钉子:等 AgentSky 把“每美元解决的任务成功率”做成可排序的公开榜单,模型跑分时代就真结束了——那时选 agent 看的是单价,不是打分。