两个引擎本该是同一个模型的两张脸,却从此各走各路。
RL 训练大模型有个老毛病:采样用推理引擎,算梯度用训练引擎,两边差一点点浮点误差——训练就崩。这毛病叫 TIM(训练-推理失配)。以前的解法都围着重要性采样打转:算个比值,裁一下,遮一下。
这篇论文做的事,是把这个黑盒拆开,告诉你崩的机制其实一句话能讲完。
把期望策略梯度拆成两项:一项叫漂移,一项叫信号。信号看的是"哪个 token 通向了哪个奖励",这是你真正想学的东西。漂移呢?它根本不看奖励长什么样,它只干一件事——把训练器往采样器的方向拉。
这是什么?这是蒸馏。而且是被蒸馏向一个会动的老师:采样器本身就是训练器的偏差副本,你每走一步把它拉过来一点,再同步回去,误差就复利。滚雪球。
有个很妙的旁证:全正奖励(+1/0)的在线训练最不稳,而同样的设置在离线训练里反而最稳。因为全正奖励时 E[R] 最大,漂移的"油门"踩得最深。作者那句总结值得抄下来:"要紧的不是失配有多大,而是老师是固定的,还是会跟着学生跑。"固定的老师蒸馏无害,会动的老师蒸馏是正反馈。
组中心化(GRPO 那套减均值)能缓解但去不掉——漂移是在每个前缀上产生的,不是在每个提示上。分数中心化直接把这一项减掉,干净利落,而且是加性的、确定性的,不增方差。
这里有个容易被漏掉的深层判断。精确的重要性采样,期望加权和本来就为零——没有东西可中心化。那 SC 和精确 IS 岂不是一回事?是的,期望上等价。但所有实用 IS 都得裁剪或掩蔽大比值,一裁剪,漂移就被请回来了。SC 的全部收益,来自"补丁本身漏了"这个事实。过去五年大家给 off-policy RL 打的补丁,补的是比率的方差;真正的病灶在均值,而那个均值恰好可以用加法精确扣掉,几乎不要钱(wall-clock 差距 1% 以内)。
数字层面(Qwen3-30B-A3B,INTELLECT-2 数学):
- FP8 采样器:不校正的策略梯度稳稳训到 58%,这时候用不用校正都行
- KV 压到 FP4:策略梯度 200 步内崩,MIS 撑到后期也崩,分数中心化 52%、TIS 51%
- 采样器 INT8 + KV INT4:分数中心化 30%、TIS 12%、其余所有方法低于 5%
- 0.6B 加合成噪声那组:DPPO 在三档噪声下分别在第 160、80、20 步崩,TIS 在两档大噪声下分别在第 180、40 步崩;最狠那档只有 SC(单独或与 MIS/TIS 组合)稳住
但有几个坑得说清楚。第一,Figure 1/4/5 这三张头条图画的是平滑后的训练精度,不是留出集分数——全篇没有一条 GSM8K 或 MATH 的成绩。第二,30B 那组的种子是事后按结果追加的:赢家补到 4-5 个种子,其余方法钉死单种子;FP8 档全员单种子,那个"不校正也稳到 58%"从头到尾没有被复现过。第三,作者自己在正文里承认,他们"很难找到自然设置下失配严重到能做出统计显著差异",所以头条结果来自刻意放大的失配加短序列,是长程温和失配的代理指标。296 次独立 run、6,180 个 H100 小时——这个成本本身也说明他们知道单种子撑不住结论。
所以我的读法是:这是一个"未来会越来越值钱"的方法,而不是当下每条流水线都要装的补丁。常规 FP8 流水线用不上它——论文自己给了证据。它的用武之地是那些被迫把采样器压到 INT4、或推理引擎几十步才同步一次的配置:长上下文 agent、异步 rollout,恰好是现在很多团队正在走的方向。
错不在那一步,在于每一步都往同一个方向错。
*(arXiv 2609.20807)*