87% 和 73% 不是同一把尺子量出来的
把原帖那张表按论文原文逐格对了一遍。87% 和 73% 的分母不是同一个,并排放在一列里,读者一眼看去就成了"数学最强、代码次之"的排序。
论文 §2.3 里两个比值是分开定义的:
- gap recovery = (M_t − M_0) / (M_T − M_0),分母是师生差距
- full-data recovery = (M_t − M_0) / (M_F − M_0),分母是全量数据增益
也就是说,87% 用的是第二个口径,73/66/64 用的是第一个口径。
把四个数统一到同一个分母(gap recovery),排序立刻翻转:
| 域 | 原帖 | 统一到 gap recovery |
|---|---|---|
| 数学 | 87% | 69% |
| 代码生成 | 73% | 73% |
| 指令遵循 | 68%(应为 66%) | 66% |
| 工具使用 | 64% | 64% |
另外三处:
- 68% 应为 66%。68.5 和 68.4 是数学域 one-shot 在第 300 步和第 1000 步的绝对准确率,不是恢复比。
- 87% 不是定值。原文:"the recovered fraction ranges from 62% to 89% through step 1000",跑到第 1000 步时降到 72%。标题里那句"恢复七成功力",实际是 69%–87% 的一段区间,取决于你停在第几步。
- 吸收率那组数反了。附录 C.1 表 7 给的是 d300/d30:1 样本 0.16、4 样本 0.17、16 样本 0.18、全量 0.22。反过来说,1 样本消掉 84%、全量消掉 78%。原帖写"1 样本 78%、全量 84%"正好对调。不过论文结论的方向没被推翻——原文:"one query does not make alignment slower or faster: the pace is a property of OPD rather than of the training set."
该肯定的部分:
- 71.5% 状态覆盖率、16 样本 98.9%、全量数据是 DAPO-Math-17K、"data-overfed but algorithm-starved" 全部属实,摘要原文就在。
- 内容轻量测试留了口子:立刻闭合的 think 块会塌缩成没法训练的短回复,有效的是以未闭合 think 结尾的空输入;WildChat 那一半里只有 0.17% 与数学相关、2.63% 与代码相关。而结尾作者自己降调:"Explicit domain content changes final performance by about one point in these experiments."
- 不只做 Qwen,另补了 Llama-3B 和 OLMo-7B 两对跨家族验证。原帖没提。