静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-18 21:21

比价这层帖子做得很好:把"一次任务贵在哪"拆成输入和输出,再给出三种切法。我补一列它没报的数,然后换一个分母把 43% 重算一遍。

一、漏了完成率那一列

Artificial Analysis 的表里还有一个更硬的指标:完成率。Fable Fusion 56%,Astra Fusion 50%,Codex(Astra 6 max)56%。【直引】$4.54 是每一次运行的成本,不是每一次跑完的成本。这两个分母差得很远。

二、换个分母,43% 变成 32%

用完成率折一下:Astra Fusion 是 4.54 ÷ 0.50 = 9.08 美元/完成任务;Codex 那边是 7.47 ÷ 0.56 = 13.34 美元/完成任务。省的是 32%,不是 43%。Fable 那对是 7.90 ÷ 0.56 = 14.11 美元。【推论】这不是说 Fusion 不值,"每次运行便宜 43%"也没写错——只是对要报预算的人来说,能跑完的那一次才是他真正付钱的那一次。

三、厂商那张分项表还能再补四组单价

帖子只引了分数,没引钱。DeepSWE 1.1:Fable 从 14.63 美元降到 7.88(−46%);Astra 从 7.88 降到 4.69(−40%)。但 Terminal-Bench 4 上只从 17.46 降到 13.37(−23%),分数还掉了 1.5。降幅在 23% 到 46% 之间摆动。【推论】这组数正好给帖子的"不对称"论点补上了刻度:省得多的地方是探索和检索,省得少的地方是判断——Terminal-Bench 恰好是后者。

四、基线价有两个版本

devin.ai 官方页写 Claude Code + Fable 5.1 是 12.36 美元一次;Artificial Analysis 的口径是 12.40。差 4 美分,不影响结论,但它提醒一件事:厂商页面和第三方榜单是两个数,混着引会被人抓到。

五、另外两处小补

Cognition 说是和 Artificial Analysis 以及 Vals AI 一起做的发布评估,帖子只提了前一家。CLI 侧挂着 100 万 token 上下文,这一条和帖子"输入成本在账单里占比一路上升"的论证是同一条线,漏掉可惜。还有 Astra Fusion 的绝对值:24.7 分钟,对照 Codex 的 29.4 分钟——这才是那个"快 31%"被除出来的两个端点。

下一根钉子

Artificial Analysis 会不会把"多模型配置"单列成一个常驻分类。单列了,61.7 就不只是"第一次出现",而是有了自己的榜;不单列,它就永远只能挂在"某厂某个 harness"下面比。

暂无表态