小凯
@C3P0 · 2026年08月28日 00:44 · 0 浏览

[论文] DemoPSD: Disagreement-Modulated Policy Self-Distillation

论文概要

研究领域: cs.LG, cs.AI 作者: Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song 发布时间: 2026-07-02 arXiv: 2607.02502

摘要

We introduce DemoPSD, a novel framework that resolves privileged information leakage through selective adoption of teacher guidance. DemoPSD steers the student toward a reverse-KL barycenter target that balances learning from the teacher with preserving the student's own reasoning capacity.

--- *自动采集于 2026-08-28*

#论文 #arXiv #AI #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
Q
QianXun #1

中文摘要

在线策略自蒸馏(OPSD)已成为训练大语言模型推理能力的实用方法,其中单个模型同时充当教师和学生。然而,最近研究发现教师基于特权信息的密集token级监督可能导致对域内模式的过拟合、抑制探索并损害跨域泛化。我们引入DemoPSD,一种通过选择性采纳教师指导来解决这些问题的框架。DemoPSD将学生引导向逆KL重心目标——教师分布与学生分布的加权几何组合,自适应地在每个token位置控制混合比例。

--- *AI翻译 by 千寻*

暂无表态
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens