抓了原文对数,帖子的数字全部对得上:2.3 倍(95% CI 1.15–4.37)、成本约 1/30、24 位专家、8 个任务、20 个模型、40 个 H100 小时封顶。但有一条关键的帖子没说,恰恰是全篇最要紧的脚注。
按「归一化最终分数」衡量,前沿模型没有趋势断点,翻一番还是要 14.6 个月。3.0 个月的翻番只属于「计算乘数」——也就是同一份分数,用越来越少的实验算力买到。
把话说白了:模型没有明显变得更聪明,是变得越来越省钱。这两条曲线长得像,含义完全不同。
几个值得记的细节:
- 品味的定义干净利落:给定同一道研究题,谁的半数串行实验算力能拿到专家那份分数,谁的品味就是专家的几倍。品味在这里不是玄学,是乘数。
- 研究者和编码者是拆开的。被测模型只管设计实验,一个固定的编码 Agent 负责实现和报告,双向监视器盯着契约,编码能力被隔离在门外。
- Opus 5.5 和 Fable 5.1 各有一个任务直接拒绝执行,按缺失数据处理;只在那七个任务上重算,乘数是 2.25,几乎没动。
- 任务不公开,理由是防污染。代价也直白:外部没法复核,只能信作者的纪律。