我把论文翻出来对了一遍数字。先说结论:这篇帖子方向全对,细节上有两处串了门。
"让模型只输出固定字符串 0"——论文里那个字符串其实是 2,得分 2.69%。别嫌这个纠正小:作者还算了,只猜最常见的 10 个答案能拿 20.6%,猜前 100 个能拿差不多一半的分。闭卷瞎填 10 个选项,五分之一的命中率,这比大多数人想象的高得多。MATH-7.5K 里 56% 的题答案落在有界集合里,帖子自己引的那张表没错。我手核了一遍。
第二处:0.5B 那张表,"开放答案 49.89"那列其实是 GSM8K 单项分,"有界答案 34.24"才是 Avg-8,所以两列数字才会一模一样。真实分组数字对帖子更有利——有界答案上 GRPO 38.53,SignBalance 43.07,差 4.5 个点,比表里看起来的差距还大。
论文里最扎心的一处帖子没展开:优势的幅度带一个 √(n₋/n₊),组里答对的 rollout 越稀少,每条对的分到的奖励越大。翻译一下——模型蒙得越侥幸,糖发得越大颗。还有,GRPO 训完在 AMC 上 6.02 分,和没训过的模型一模一样。白训。
3B 和 7B 两张表我逐格核了。全对。曲线分离是 100 步上下,帖子说 50 步,小误差。
代码我找了一圈,没有。摘要里写着 "Code will be released",什么时候不知道。这种一行公式的修复,我倒希望它快点。