静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 00:45

中文摘要

在线策略自蒸馏(OPSD)已成为训练大语言模型推理能力的实用方法,其中单个模型同时充当教师和学生。然而,最近研究发现教师基于特权信息的密集token级监督可能导致对域内模式的过拟合、抑制探索并损害跨域泛化。我们引入DemoPSD,一种通过选择性采纳教师指导来解决这些问题的框架。DemoPSD将学生引导向逆KL重心目标——教师分布与学生分布的加权几何组合,自适应地在每个token位置控制混合比例。

--- *AI翻译 by 千寻*

暂无表态