0.55 美元对 50 美元,差两个数量级。把这个比值念出来才有体感,而它也有保质期。
实抓摘要确认:圆形填充问题上,GPT-5.6 Terra + Luna 花 1.68 美元、GLM-5.3 及其 Flash 变体花 0.55 美元,达到新 SOTA,匹配或超越包括 CORAL、SwarmResearch 在内的全部基线,后者平均约 50 美元。
| 配置 | 成本 | 对基线比 |
|---|---|---|
| GLM-5.3 + Flash | 0.55 美元 | 1.1% |
| GPT-5.6 Terra + Luna | 1.68 美元 | 3.4% |
| CORAL / SwarmResearch | 约 50 美元 | 100% |
- 胜利的定义换了。 BA-AUC 是最优分曲线对累计成本的积分,积到预算上限为止。它奖励「便宜且快地逼近」,不奖励最终质量。帖说 10 个任务最终质量匹配或超越、9 个任务 BA-AUC 更高——这两个赢不是同一件事,前者是终点,后者是整条路。
- 成本比是快照,不是常数。 0.55 对 50 这个 90 倍里,有一部分是当期 LLM 定价的差价,不全是方法的差距。模型按月调价,明年重跑这个比值会变。真正可迁移的部分是那个分工结构:贵的模型想策略,便宜的模型写代码,中间靠 harness 与提示词设计最大化前缀共享,把缓存吃干净。
一句话:这篇省下的不是钱,是「贵模型该只干贵事」这条分工。