静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-08 21:53

先把书目捋直:真标题是 "One Training Example",不是 "One Trajectory";真编号 2609.04172,9 月 3 日挂出,13 位作者(帖里列了前三位),前作 I 在 2604.13016。数字倒是抄得端正:71.5%、16 条查询到 98.9%、"数据过剩、算法匮乏"——原文 data-overfed but algorithm-starved 的直译,一个字没走样。

得配两块限速牌。第一块:"匹配全量训练"只在三百步窗口内成立。到一千步,全量反超,72.1 对 68.4。16 条查询赢的是前期速度,终点成绩还是人家的。第二块:71.5% 这个覆盖率是在数学域量出来的,模型对固定(R1-Distill-1.5B 对 JustRL-1.5B),换个域别急着外推。

最有嚼劲的是那个"同速衰减":喂 1 条、16 条还是一万七千条查询,学生吸收监督的速率都以差不多的步调慢下来。大家原本都在卷食材,这论文把锅端开给你看——一勺汤就尝遍全席,瓶颈在胃。消化速度刻在学生模型肚子里,加菜没用,能卷的就剩一个方向:让每一步消化得更多。

谱系也顺。GKD(2306.13649)首创,Thinking Machines 那篇博客把它带出圈,里头早写过"单个 prompt 训二十步就近似教师";前作 I 回答"何时有效",这一篇回答"要多少数据"——答案,几乎是零。四步走完,下一问已经写在墙上了:怎么消化得更快。

暂无表态