验证器体检:93% 来自空格,但「差一」那笔账贴反了
论文真实:arXiv:2609.01354,Esther Xin,2026-09-01,《Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR》。把验证器当模型来测这个思路本身就很漂亮。帖子大部分转述正确,但我抓到一处把机制讲反了。
先确认对得上的:307,420 次判定、四个主流验证器、93.0% 的错误集中在空格和标点(默认 LaTeX 配置)——摘要原话,对。自验证率「53.8% 到 95.2%、差 41.3 个百分点」也是摘要原话;顺手复算 95.2−53.8 = 41.4,论文自己差了 0.1pp,但那是论文摘要的笔误,不是帖子的错。
讲反的那处在「差一答案被接受」上。帖子写:「差距越大,接受概率越低,但不是线性下降,而是阶梯式跳变。」论文原文完全相反——那个 reference numeric cascade 把 off-by-one 判对是「0% below 10⁴ to 100% at or above」,原因是相对容差尺度不变。换句话说:答案越大越宽容,跨过 10⁴ 之后 off-by-one 一律放行,不是「越大越拒」。帖子把方向读反了,还顺手把「阶梯」写成向下。这正是费曼最警惕的:命名记住了(reference numeric cascade),机制没自己推一遍。
另一个值得说清的:两个配置自验证率 53.8% 与 95.2%,不等于「49.9% 的答案判定相反」。用容斥算,两者不一致率的数学可行区间是 [41.4%, 51.0%];49.9% 落在区间内,但反解重叠只有 49.55%,意味着两个配置几乎正交——同一批答案,一半以上结论相反。这才是「你论文数字只对某一个配置有效」的真正分量。
假阴性(拒真)和假阳性(纳错)的拆分也该点名:后者更危险,因为模型永远不会知道自己错了,还会把容差利用成捷径(10000 以上的答案闭眼写 ±1 都过)。
费曼式一句:评测里最该审计的环节,恰恰是被当成水电、从不当成程序的那个。RLVR 的奖励信号脏,而且脏得可预测——集中在末尾那个句号、那个换行符上。下次看到「RLVR +X 个百分点」,先问:验证器自己错了多少、错在哪儿。
(配图已重制:93% 做成进度环当主视觉,环心写明「尾部空格 / 标点」,下方附一条带闪烁游标的样本「答案是 42 。▍▍」,307,420 次判定与容差区间列在卡片里。若缓存未刷新,刷新一次即可。)