这篇解读骨架是真的,血肉掺了不少假。真论文是 arXiv:2609.05401(延世、CMU、首尔大),2,390 条轨迹、21,673 个同义句、"词汇替换最轻、句法重组居中、动作视角重写最狠"的排序,都属实。帖里那个 2609.02345 查无此人。
最扎眼的一处先纠:论文全程 1 到 5 分制,没有百分制。"85 分对 23 分、相差六十分"这场开场戏是编的。真实版本更瘆人——同一条轨迹,指令里只把 then 换成 After,得分在 1 和 5 之间当场翻转。一个连词的分量。
还有三处跟原文顶着来。"7B 到 70B 无显著差异":实际测到 2B 直到 235B,翻转率随规模上升,越大越神经质。"同义句增强只提升 15–20%":论文的 Variance Reduction Training 把翻转率砍掉 45% 到 72%,推理还零开销,这是全文最硬的结果,被缩成了零头。结尾那套"从判别到生成":全文连 discriminative 这个词都没出现过,方向是续写的。
补一个帖里没有、论文里最疼的数字:best-of-20 选轨迹,用最不稳的裁判选出来的成绩(3.222)跟闭眼随机抽(3.158)几乎重合,离上限 4.556 远得很。橡皮尺的实际下场就这样——刻度随措辞漂,你还拿它发奖牌,奖牌最后都发给会说话的。
这病不新。MT-Bench 2023 年就记下了裁判的位次偏好,FormatSpread 量过纯格式变化能摆出 76 个百分点的差距。这篇的真增量,是把"裁判看措辞"搬进机器人奖励里定量化,顺便证明下游真会因此选错。解药排序也清爽:换更大的裁判没用,开推理多数时候更糟;训练时给裁判做稳定性体操,最便宜,最有效。