静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 23:20

87% 和 73% 不是同一把尺子量出来的

把原帖那张表按论文原文逐格对了一遍。87% 和 73% 的分母不是同一个,并排放在一列里,读者一眼看去就成了"数学最强、代码次之"的排序。

论文 §2.3 里两个比值是分开定义的:

  • gap recovery = (M_t − M_0) / (M_T − M_0),分母是师生差距
  • full-data recovery = (M_t − M_0) / (M_F − M_0),分母是全量数据增益
原文 §3.2 的原话是:数学域 one-shot "recovering 69% of the teacher–student gap and 87% of full-data OPD's gain at step 300";而代码、指令遵循、工具使用分别是 "recovers 73%, 66%, and 64% of the corresponding teacher–student gaps"。

也就是说,87% 用的是第二个口径,73/66/64 用的是第一个口径。

把四个数统一到同一个分母(gap recovery),排序立刻翻转:

域原帖统一到 gap recovery
数学87%69%
代码生成73%73%
指令遵循68%(应为 66%)66%
工具使用64%64%
代码反而是四个里最高的。不是数字错了,是分母换了还当成同一件事在排。

另外三处:

  • 68% 应为 66%。68.5 和 68.4 是数学域 one-shot 在第 300 步和第 1000 步的绝对准确率,不是恢复比。
  • 87% 不是定值。原文:"the recovered fraction ranges from 62% to 89% through step 1000",跑到第 1000 步时降到 72%。标题里那句"恢复七成功力",实际是 69%–87% 的一段区间,取决于你停在第几步。
  • 吸收率那组数反了。附录 C.1 表 7 给的是 d300/d30:1 样本 0.16、4 样本 0.17、16 样本 0.18、全量 0.22。反过来说,1 样本消掉 84%、全量消掉 78%。原帖写"1 样本 78%、全量 84%"正好对调。不过论文结论的方向没被推翻——原文:"one query does not make alignment slower or faster: the pace is a property of OPD rather than of the training set."
最离谱的是教师模型那条。全文检索 70B,零命中。 真实配置(原文表 1):学生 DeepSeek-R1-Distill-Qwen-1.5B,教师 JustRL-1.5B / Nemotron-1.5B / UltraData-IF-1.5B;工具域是 Qwen2.5-Coder-1.5B 对 Hammer-1.5B。师生全是 1.5B 的同家族小模型。这不是笔误,是把论文最要紧的设定讲反了——它讲的是"小模型跟同门师兄学",不是"70B 师傅教 1.5B 徒弟"。

该肯定的部分:

  • 71.5% 状态覆盖率、16 样本 98.9%、全量数据是 DAPO-Math-17K、"data-overfed but algorithm-starved" 全部属实,摘要原文就在。
  • 内容轻量测试留了口子:立刻闭合的 think 块会塌缩成没法训练的短回复,有效的是以未闭合 think 结尾的空输入;WildChat 那一半里只有 0.17% 与数学相关、2.63% 与代码相关。而结尾作者自己降调:"Explicit domain content changes final performance by about one point in these experiments."
  • 不只做 Qwen,另补了 Llama-3B 和 OLMo-7B 两对跨家族验证。原帖没提。
一句话:一个样本确实能顶七成,但那个"七成"是把三个不同分母混着算出来的。把分母对齐,最强的那个不是数学。

OPD:87% 与 73% 不是同一把尺子

暂无表态