← 返回主题列表
✨步子哥
@steper · 2026年07月27日 17:09 · 0浏览

RL 训练的模型更合群:SFT 与 RL 在模型合并上的根本差异

RL 训练的模型更"合群":SFT 与 RL 在模型合并上的根本差异

> 论文:Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts > 作者:(详见论文) > arXiv:2607.22039(2025年7月24日)

一个工程难题

你手头有三个模型:一个擅长数学、一个擅长代码、一个擅长指令遵循。你想把它们合并成一个"全能模型"。

模型合并(Model Merging)是近两年 LLM 领域的热门技术。它不需要重新训练,只需要把多个模型的参数按某种方式平均或加权组合,就能得到一个多任务模型。听起来很美。

但实际操作中,你合并后的模型经常比任何一个原始模型都差。原因叫"任务冲突"(Task Conflict):数学模型的参数更新方向,可能和代码模型的更新方向相反,合并后两边的能力都被"拉扯"掉了。

这篇论文发现了一个反直觉的现象:用 RL(强化学习)训练的模型,合并后性能损失远小于用 SFT(监督微调)训练的模型。 不管用什么合并方法、不管用什么 RL 算法、不管用什么基座模型,这个结论都成立。

实验设置

作者用 Llama-3.2-3B、Llama-3.1-8B、Mistral-Small-3-24B 三个基座模型,分别用 SFT 和三种 RL 算法(PPO、GRPO、Reinforce++)训练五个任务:

  • 数学:OpenMathInstruct-2 → GSM8K、MATH-500
  • 代码:OpenCodeInstruct → HumanEval、MBPP
  • 指令遵循:Tulu-3-SFT → IFEval、LiveBench
  • 逻辑谜题:Knights and Knaves
  • 排序:Ranking 任务
然后把这些任务训练出的模型两两合并、三三合并、四四合并,看合并后的性能保持率。

核心发现:RL 模型合并后掉得更少

实验结果非常清晰:不管用什么合并方法(线性平均、任务算术、TIES 等),RL 训练的模型合并后性能保持率都显著高于 SFT 训练的模型。

这个结论对合并方法无关、对 RL 算法无关、对基座模型无关。这是一个稳健的规律,不是某个特殊配置下的偶然现象。

三个原因:为什么 RL 更"合群"

作者从理论和实验两方面深挖,找到了三个原因。

原因一:On-policy 数据控制梯度幅度

SFT 用的是固定的标注数据,模型在训练时会"用力过猛"——为了让损失最小化,参数会朝某个方向大幅更新。这种大幅更新容易覆盖其他任务的知识。

RL 用的是 on-policy 数据:模型自己生成回答,再用奖励信号评估。这意味着模型只会"微调"——只在当前策略不够好的地方做小幅修正。梯度更新的幅度更小,更不容易覆盖其他任务的能力。

这就像学习:SFT 是死记硬背标准答案,会形成强烈的路径依赖;RL 是做错题后看反馈,只修正错误的部分,保留其他正确的部分。

原因二:RL 优化目标本身就更"温和"

SFT 的损失函数是负对数似然,它要求模型对正确答案的概率最大化。这是一个"赢家通吃"的目标——正确答案的概率越高越好,其他答案的概率越低越好。这种目标会让参数朝一个方向"猛冲"。

RL 的优化目标是期望回报,它不要求概率最大化,只要求"好的回答比坏的回答概率高"。这是一个相对温和的目标——只要好的回答比坏的回答更可能出现就行,不需要把所有概率质量都压到正确答案上。

这种温和性让 RL 训练的参数更新更"分散",不会集中在某个方向上,从而减少了任务间的冲突。

原因三:正负样本的对称优化

RL 同时处理正样本(高奖励)和负样本(低奖励)。它会同时增加好回答的概率、降低坏回答的概率。这种双向调整让参数更新更"对称"——不是只朝一个方向走,而是在多个方向上做平衡。

SFT 只处理正样本(标准答案),没有"降低坏回答概率"的机制。这让 SFT 的参数更新更"偏科"。

理论分析:冲突范数

作者用数学刻画了"任务冲突"的程度。他们定义了一个"冲突范数"(Conflict Norm),衡量两个任务训练后的参数更新方向之间的冲突程度。

理论分析表明:RL 训练的冲突范数更小。原因是 RL 的优势函数(Advantage Function)有一个"基线"机制——它减去了价值函数的估计,让正负样本的梯度更新在期望上相互抵消,只留下"真正有用"的更新方向。这个抵消机制让 RL 的更新更"聚焦",不容易和其他任务冲突。

SFT 没有这种抵消机制,它的更新方向更"散",更容易和其他任务冲突。

工程意义

这个发现对 LLM 的训练流程有直接影响:

1. 如果你打算做模型合并,优先用 RL 训练。SFT 训练的模型合并后会掉性能,RL 训练的模型合并后基本不掉。 2. RL 不是为了"更强",而是为了"更合群"。在多任务场景下,RL 的价值不在于单任务性能(往往和 SFT 相当),而在于合并友好性。 3. SFT 和 RL 应该组合使用:SFT 做基础能力建设,RL 做合并前的"去冲突化"处理。

诚实评价

这篇论文有几个值得注意的点:

  • 实验规模有限。三个基座模型、五个任务,覆盖面不够广。真实世界的多任务场景可能有几十个任务,冲突模式更复杂。
  • 理论分析基于强假设。冲突范数的推导假设参数更新是独立的,实际中不同层的参数更新高度相关。
  • "Enough is as good as a feast"(知足常乐)这个标题暗示了一个更深的观点:RL 的"温和"不是缺陷,是优势。在多任务合并场景下,不需要"学得最深",需要"学得最合群"。这个观点有启发性,但论文没有充分论证它是否适用于所有场景。

一句话总结

RL 训练的模型之所以合并后更"合群",是因为它的梯度更新幅度更小、优化目标更温和、正负样本更对称——"知足常乐"不是道德说教,是数学定理。

---

论文链接https://arxiv.org/abs/2607.22039 HTML 版本https://arxiv.org/html/2607.22039v1 开源代码:暂无(论文使用了 verlOpenRLHF 作为训练框架)

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens