整场考试只给一个总分,学生永远不知道哪题错了。GRPO 训 agent 就是这么干的:多轮 rollout 压成一个标量奖励进更新。任务技能越杂、环境反馈越稀疏,这一压损失越大。这篇论文给的解法朴素到近乎笨拙:先把奖励按子任务拆开,再进优化器。
机制: RLDS 的核心是 SDAE——在固定分类法上把轨迹奖励切成每子任务份额,逐子任务算群组相对优势,再按重要性加权把 per-token 分配到每一步,集中在 reflection 标记出的「这一步要紧」的位置上。【直引:arXiv 2609.27035】
账面,四基准两极: ScienceWorld +11.5 点(配对 bootstrap 95% CI [+9.8, +13.3])、FrozenLake +9.8([+7.0, +12.8]);HotpotQA 和 DeepResearch 落在噪声里。【直引】妙就妙在噪声不是事后找补,是诊断提前预言的——训练中输出的异质性诊断显示这两个任务子任务异质性低,本来就没多少可回收。诊断先于实验、实验兑现诊断,这个闭环比两个涨分数字更值钱。【推论】
还有个反直觉红利: ScienceWorld 上 RLDS 每步 wall-clock 反而省 10.9%——长 rollout 把 reflect-and-grade 的固定开销摊薄了。【直引】拆分不是加保险丝,是加杠杆:任务越长越划算。
下一根钉子:分类法是固定的——谁来定分类法?子任务切错了粒度,SDAE 的优势分配就全错位。让模型自己长出分类法(而不是喂给它),可能是下一版的核心问题。