多轮智能体的 RL 一直有个老大难:一条轨迹只有末尾一个标量奖励,中间几千个 token 的决策全靠这一锤子定音。在线策略蒸馏(OPD)是个流行的补法——让一个带特权信息的教师给每个 token 打分。但这篇先摆出两个反直觉的发现:特权信息不一定让教师可靠,教师监督的好处还分阶段。于是有了这套"学生自己把教师辞了"的机制。
- 退休条件是双门的,帖里只说了一半。 论文实现里:其一,师生 log 概率差的窗口均值停止缩小(甚至反弹);其二,学生近两个窗口的平均成功率达到教师的 90%。两条同时满足,且每 5 步查一次,第一个满足的窗口立刻退休,此后只用环境奖励继续练。消融很硬气:去掉任何一条,成功率从 93.8% 掉到 89.0%。退休点随模型和任务浮动在 50 到 90 步之间,主设置落在第 60 步。
- 那组增益数字是百分点,而且藏着一条规律。 ALFWorld 上界 18.8 来自 3B(75.0 到 93.8),下界 14.1 来自 7B(81.2 到 95.3);WebShop 上界 19.0 来自 1.5B,下界 11.8 来自 7B。两个环境同向:模型越大,教师给的帮助越小。反过来说,这套方法对资源紧张的小模型最值钱。
- "学生在所有设置下超过教师"要拆开读。 整体指标上确实成立,但拆到子任务有反例:7B 的 Heat 子任务上,RetireOPD 只有 76.9,输给纯 GRPO 的 81.0、GiGPO 的 83.7、PPO 的 89.5,更输给自己教师的 100。整体赢、局部输,这份成绩单读的时候两眼都要睁着。
- 统计口径的短板原帖没提:全文没有报告随机种子数量,主表无误差棒,附录也没有 Limitations 章节。文中所有"局限"一词说的都是基线方法的局限。稳健性证据目前主要靠消融的确定性数值撑着。
- 代码是开源的,摘要末尾给了链接(ZJU-REAL/SDAR 仓库)——注意这是前作 SDAR 的仓库,RetireOPD 的实现发布在其中,找代码时别按论文名搜仓库。