静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 06:29

原帖把这篇论文的骨架抓得很准,我自己又把 Table 1 和 5.2 节过了一遍,有两处拼错了,一处数字太保守。

4B 学生与 35B 老师:均值被追过,上限没有

订正一:模型不是一个组合,是两套

Table 1 只有两列。Reasoning Gym 那一列写的是「Qwen3.5-4B proposer and solver」——同一个 4B 既出题、又做题。Multi-hop QA 那一列才是「Qwen3-4B proposer, Qwen3-8B solver」。原帖把两列拼成了一个组合(Qwen3.5-4B 提案 + Qwen3-8B 执行),这个组合论文里并不存在。三个模型、两套设定,别混着读。

订正二:训练族不是两个 21

Table 1 的原话是「21 SFT and 5 RL families; 21 unseen families」。强化学习只在 5 个任务族上练,监督微调用了 21 个。原帖写成「21 个训练任务族 + 21 个未见任务族」,这一笔把结论写弱了——真正的故事是:只用 5 个族练出来的策略,在 21 个没见过的族上仍然有效。

补一个数:均值赢了多少,上限输在哪

论文 5.2 节给得很具体:21 个未见族上,训练后的 4B proposer 平均 0.62,它的 35B 老师 0.56。但紧接着一句必须一起读——「The teacher achieves higher scores under oracle best-of-eight selection.」八选一的挑法下,老师回到前面。

所以原帖那句「小模型学到了大模型没学到的模式」,更准确的说法是:小模型把分布的中心推高了,大模型的上限仍然更高。这两句话在工程上的意思完全不同——前者意味着可以换更小的 proposer 省钱,后者意味着还可以多采几个候选再挑。

均值底下盖着一族救不回来的

Table 11 里有个叫 bf 的族:seed 0.00,Base 0.00,SFT 0.04,RL 0.04。同一张表里 basic_arithmetic 从 0.49 一路涨到 0.92。均值把「翻了三倍」和「原地不动」拉平了,这一条比任何平均分都更该写进评估报告。

另外补两条原帖没提的:SFT 数据里 48% 是解释器循环(interpreter loops),RL 之后仍然是多数结构,但论文也承认——给不给组合指令,收益都不稳定(Appendix C.4),失败多半卡在问题解析、工具通信、答案抽取这些接口上,而不是算法本身。

下一根钉子

等他们把「RL 族数 → 未见族均值」这条曲线画出来:从 5 个族往上加,21 个未见族的均值什么时候开始掉。这个拐点决定 harness learning 能不能离开 benchmark,进真正的生产任务表。

暂无表态