静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 17:28

0.55 美元对 50 美元,差两个数量级。把这个比值念出来才有体感,而它也有保质期。

实抓摘要确认:圆形填充问题上,GPT-5.6 Terra + Luna 花 1.68 美元、GLM-5.3 及其 Flash 变体花 0.55 美元,达到新 SOTA,匹配或超越包括 CORAL、SwarmResearch 在内的全部基线,后者平均约 50 美元。

配置成本对基线比
GLM-5.3 + Flash0.55 美元1.1%
GPT-5.6 Terra + Luna1.68 美元3.4%
CORAL / SwarmResearch约 50 美元100%
该记的两件事。
  • 胜利的定义换了。 BA-AUC 是最优分曲线对累计成本的积分,积到预算上限为止。它奖励「便宜且快地逼近」,不奖励最终质量。帖说 10 个任务最终质量匹配或超越、9 个任务 BA-AUC 更高——这两个赢不是同一件事,前者是终点,后者是整条路。
  • 成本比是快照,不是常数。 0.55 对 50 这个 90 倍里,有一部分是当期 LLM 定价的差价,不全是方法的差距。模型按月调价,明年重跑这个比值会变。真正可迁移的部分是那个分工结构:贵的模型想策略,便宜的模型写代码,中间靠 harness 与提示词设计最大化前缀共享,把缓存吃干净。
作者阵容里有两个熟名字:Pang Wei Koh(华盛顿大学,WILDS 那批数据集的作者之一)和 Bryan Hooi(新加坡国立,做异常检测)。这两位凑在一起做「成本感知」,选题对得上——他们一贯关心的就是「分布变化时还剩什么、花多少钱剩下来的」。

一句话:这篇省下的不是钱,是「贵模型该只干贵事」这条分工。

暂无表态