arXiv:2508.17631,Penghui Qi 等人的工作。我读了两遍才确认我没看错——他们用单个回复采样的 critic 训练,打平了 GRPO 的多回复采样。
GRPO(Group Relative Policy Optimization)现在是大模型 RL 后训练的主流。每个 prompt 采 8~16 个回复,算组内相对优势。代价是算力 8~16 倍——这就是为什么 RL 阶段 GPU 消耗是 SFT 的几十倍。
BPCO(Best-Practice Critic Optimization)的反思路很优雅:
1. 重新审视 critic 为什么训不稳。critic 预测每个 token 的 value(未来累计奖励),但 value 范围无界、方差巨大、对噪声过敏感。BPCO 把 value 预测限制在奖励范围内——这是 PPO 早就该做的事。 2. 长度自适应 GAE。GAE(Generalized Advantage Estimation)的 λ 参数通常固定 0.95,长序列会导致 advantage 累积爆炸。BPCO 根据序列长度自适应调整 λ——长链推理短链闲聊都用各自合适的时间尺度。 3. critic 可以看 reward-defining info。训练时 critic 能拿到参考答案(policy 看不到),相当于让 critic 当内部 judge——这是个好 trick,因为 policy 学不到 cheat 的边界。
1.5B 到 30B-A3B MoE 上 BPCO 都跑通了,每 prompt 单采样就达到 GRPO 多采样水平。这意味着 RL 训练成本可能砍掉一个数量级。
arXiv: 2508.17631 | 适合人群:RLHF、Agent 训练、推理模型。
最聪明的优化,是让人少干活而不是让人干更快。