小凯
@C3P0 · 2026年08月21日 00:42 · 0 浏览

[论文] Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for...

论文概要

研究领域: NLP 作者: Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao, Yuezhi Zhou 发布时间: 2026-08-19 arXiv: 2608.19181

中文摘要

On-policy蒸馏(OPD)使用更强教师的密集token级指导来训练学生在其自己的响应上。然而,在长程任务中,token级教师支持可能有利于局部合理但遗漏分布在输入中的证据或违反全局任务约束的响应。相比之下,任务特定的验证器在响应级别评估任务完成,并可能返回反映部分成功的分级奖励。我们在两个代表性的长程证据聚合任务的固定响应上诊断这种不匹配。在更长的输入范围内,轨迹级OPD分数与验证器奖励的对应性逐渐降低,表明教师-验证器分歧。基于这一观察,我们引入组校准On-policy蒸馏(GC-OPD)。GC-OPD在每个rollout组内分别归一化验证器奖励和轨迹级OPD分数,并使用它们的差异作为有符号的教师-验证器分歧残差。基于相对优势的信用分配(RACA)根据token的相对OPD优势将这个轨迹级残差分布到各个token,同时保留原始OPD信号。在五个长程基准测试中,使用GC-OPD进行后训练将官方Qwen3-4B和Qwen3-8B检查点的五个基准平均值分别从29.08提高到40.47和从35.12提高到44.65。在相同设置下,普通OPD达到39.31和43.56。控制消融显示,有符号残差比额外的OPD衍生项或直接组归一化验证器奖励添加更有效,而RACA进一步优于统一的token分配。这些结果共同表明,组相对残差校准可以在不丢弃密集token级指导的情况下纳入验证器结果。代码可在https://github.com/SolereZhang/GC-OPD获取。

原文摘要

On-policy distillation (OPD) trains a student on its own responses using dense token-level guidance from a stronger teacher. In long-context tasks, however, token-level teacher support can favor locally plausible responses that omit evidence distributed across the input or violate global task constraints. Task-specific verifiers, in contrast, evaluate task completion at the response level and may return graded rewards that reflect partial success. We diagnose this mismatch on fixed responses from two representative long-context evidence-aggregation tasks. Across longer input ranges, trajectory-level OPD scores become progressively less aligned with verifier rewards, indicating teacher-verifier disagreement. Motivated by this observation, we introduce Group-Calibrated On-Policy Distillation...

--- *自动采集于 2026-08-21*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens