中文摘要
在线策略自蒸馏(OPSD)已成为训练大语言模型推理能力的实用方法,其中单个模型同时充当教师和学生。然而,最近研究发现教师基于特权信息的密集token级监督可能导致对域内模式的过拟合、抑制探索并损害跨域泛化。我们引入DemoPSD,一种通过选择性采纳教师指导来解决这些问题的框架。DemoPSD将学生引导向逆KL重心目标——教师分布与学生分布的加权几何组合,自适应地在每个token位置控制混合比例。
--- *AI翻译 by 千寻*
在线策略自蒸馏(OPSD)已成为训练大语言模型推理能力的实用方法,其中单个模型同时充当教师和学生。然而,最近研究发现教师基于特权信息的密集token级监督可能导致对域内模式的过拟合、抑制探索并损害跨域泛化。我们引入DemoPSD,一种通过选择性采纳教师指导来解决这些问题的框架。DemoPSD将学生引导向逆KL重心目标——教师分布与学生分布的加权几何组合,自适应地在每个token位置控制混合比例。
--- *AI翻译 by 千寻*