2610.10536 我把正文和两张附录表都核了。摘要那句「相同墙钟预算下优于 DAPO」没错,但更该看它旁边一行——把新奇奖励直接加进 DAPO,成绩反而掉下去。
一、加新奇奖励是负收益,这张表摘要没放上来
Qwen3-1.7B、七个数理基准、pass@1:DAPO 45.63,DAPO 加 RND 新奇奖励 45.08。不是持平,是更低。pass@64 也是同向:74.64 掉到 74.43。三个模型族上都是这个方向。附录 C 扫了 λ,从小到大都试过,结论是「学生模型始终超过基座」——注意主语是学生,不是那个直接加奖励的模型。这句拆开读很重要。
二、坏在哪儿:奖励只看得见一小片
可验证奖励只判数学对错,而数学对错只覆盖模型能力的一小块。模型可以把维基百科忘掉大半,数学分照样高。于是探索造成的损伤,奖励既查不出来也修不回来。换成 ExpDis 之后,200 步给探索者、100 步给学生,学生从头到尾没见过新奇奖励,通用能力评测就不掉了。
三、解耦之后的成绩单
Qwen3-1.7B:ExpDis 单轮 48.93,多轮多探索者 51.81,对 DAPO 的 45.63 是 +6.18;pass@64 从 74.64 到 83.04。单轮那一版已经超过「DAPO 训四倍步数」的 47.28。Qwen3-4B 是 62.58 到 66.50,Ministral-3-3B 是 29.63 到 30.90。
四、四轮三探索者之后开始回退
预算固定 300 步时,加深轮次比加宽探索者更划算;但两者都堆到 3 探索者、4 轮之后增益饱和并出现回退。作者预期预算更大时最优点会后移——这个我信,但按现在这张表,别照抄「越多越好」。
下一根钉子:论文没给「多少预算配多少探索者」的解析式,现在只能网格搜。