静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 16:29

w7-c5-retireopd.svg

多轮智能体的 RL 一直有个老大难:一条轨迹只有末尾一个标量奖励,中间几千个 token 的决策全靠这一锤子定音。在线策略蒸馏(OPD)是个流行的补法——让一个带特权信息的教师给每个 token 打分。但这篇先摆出两个反直觉的发现:特权信息不一定让教师可靠,教师监督的好处还分阶段。于是有了这套"学生自己把教师辞了"的机制。

  • 退休条件是双门的,帖里只说了一半。 论文实现里:其一,师生 log 概率差的窗口均值停止缩小(甚至反弹);其二,学生近两个窗口的平均成功率达到教师的 90%。两条同时满足,且每 5 步查一次,第一个满足的窗口立刻退休,此后只用环境奖励继续练。消融很硬气:去掉任何一条,成功率从 93.8% 掉到 89.0%。退休点随模型和任务浮动在 50 到 90 步之间,主设置落在第 60 步。
  • 那组增益数字是百分点,而且藏着一条规律。 ALFWorld 上界 18.8 来自 3B(75.0 到 93.8),下界 14.1 来自 7B(81.2 到 95.3);WebShop 上界 19.0 来自 1.5B,下界 11.8 来自 7B。两个环境同向:模型越大,教师给的帮助越小。反过来说,这套方法对资源紧张的小模型最值钱。
  • "学生在所有设置下超过教师"要拆开读。 整体指标上确实成立,但拆到子任务有反例:7B 的 Heat 子任务上,RetireOPD 只有 76.9,输给纯 GRPO 的 81.0、GiGPO 的 83.7、PPO 的 89.5,更输给自己教师的 100。整体赢、局部输,这份成绩单读的时候两眼都要睁着。
  • 统计口径的短板原帖没提:全文没有报告随机种子数量,主表无误差棒,附录也没有 Limitations 章节。文中所有"局限"一词说的都是基线方法的局限。稳健性证据目前主要靠消融的确定性数值撑着。
  • 代码是开源的,摘要末尾给了链接(ZJU-REAL/SDAR 仓库)——注意这是前作 SDAR 的仓库,RetireOPD 的实现发布在其中,找代码时别按论文名搜仓库。
把视角拉远一点,这篇真正的位置在于它回答了一个更普遍的问题:密集监督什么时候该撤。教师和学生方向冲突(GRPO 的更新方向与蒸馏方向相反)时,继续蒸馏反而拖后腿——退休判据本质上是在检测这个冲突点。什么阶段该扶、什么阶段该放,这个判断从人工预设的日程表,变成了在线监测的信号。这套思路从教学搬进了训练管线,值得记住的不只是那十几个百分点。

暂无表态