RL 训练的模型更合群:SFT 与 RL 在模型合并上的根本差异
RL 训练的模型更"合群":SFT 与 RL 在模型合并上的根本差异
> 论文:Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts > 作者:(详见论文) > arXiv:2607.22039(2025年7月24日)
一个工程难题
你手头有三个模型:一个擅长数学、一个擅长代码、一个擅长指令遵循。你想把它们合并成一个"全能模型"。
模型合并(Model Merging)是近两年 LLM 领域的热门技术。它不需要重新训练,只需要把多个模型的参数按某种方式平均或加权组合,就能得到一个多任务模型。听起来很美。
但实际操作中,你合并后的模型经常比任何一个原始模型都差。原因叫"任务冲突"(Task Conflict):数学模型的参数更新方向,可能和代码模型的更新方向相反,合并后两边的能力都被"拉扯"掉了。
这篇论文发现了一个反直觉的现象:用 RL(强化学习)训练的模型,合并后性能损失远小于用 SFT(监督微调)训练的模型。 不管用什么合并方法、不管用什么 RL 算法、不管用什么基座模型,这个结论都成立。
实验设置
作者用 Llama-3.2-3B、Llama-3.1-8B、Mistral-Small-3-24B 三个基座模型,分别用 SFT 和三种 RL 算法(PPO、GRPO、Reinforce++)训练五个任务:
- 数学:OpenMathInstruct-2 → GSM8K、MATH-500
- 代码:OpenCodeInstruct → HumanEval、MBPP
- 指令遵循:Tulu-3-SFT → IFEval、LiveBench
- 逻辑谜题:Knights and Knaves
- 排序:Ranking 任务
核心发现:RL 模型合并后掉得更少
实验结果非常清晰:不管用什么合并方法(线性平均、任务算术、TIES 等),RL 训练的模型合并后性能保持率都显著高于 SFT 训练的模型。
这个结论对合并方法无关、对 RL 算法无关、对基座模型无关。这是一个稳健的规律,不是某个特殊配置下的偶然现象。
三个原因:为什么 RL 更"合群"
作者从理论和实验两方面深挖,找到了三个原因。
原因一:On-policy 数据控制梯度幅度
SFT 用的是固定的标注数据,模型在训练时会"用力过猛"——为了让损失最小化,参数会朝某个方向大幅更新。这种大幅更新容易覆盖其他任务的知识。
RL 用的是 on-policy 数据:模型自己生成回答,再用奖励信号评估。这意味着模型只会"微调"——只在当前策略不够好的地方做小幅修正。梯度更新的幅度更小,更不容易覆盖其他任务的能力。
这就像学习:SFT 是死记硬背标准答案,会形成强烈的路径依赖;RL 是做错题后看反馈,只修正错误的部分,保留其他正确的部分。
原因二:RL 优化目标本身就更"温和"
SFT 的损失函数是负对数似然,它要求模型对正确答案的概率最大化。这是一个"赢家通吃"的目标——正确答案的概率越高越好,其他答案的概率越低越好。这种目标会让参数朝一个方向"猛冲"。
RL 的优化目标是期望回报,它不要求概率最大化,只要求"好的回答比坏的回答概率高"。这是一个相对温和的目标——只要好的回答比坏的回答更可能出现就行,不需要把所有概率质量都压到正确答案上。
这种温和性让 RL 训练的参数更新更"分散",不会集中在某个方向上,从而减少了任务间的冲突。
原因三:正负样本的对称优化
RL 同时处理正样本(高奖励)和负样本(低奖励)。它会同时增加好回答的概率、降低坏回答的概率。这种双向调整让参数更新更"对称"——不是只朝一个方向走,而是在多个方向上做平衡。
SFT 只处理正样本(标准答案),没有"降低坏回答概率"的机制。这让 SFT 的参数更新更"偏科"。
理论分析:冲突范数
作者用数学刻画了"任务冲突"的程度。他们定义了一个"冲突范数"(Conflict Norm),衡量两个任务训练后的参数更新方向之间的冲突程度。
理论分析表明:RL 训练的冲突范数更小。原因是 RL 的优势函数(Advantage Function)有一个"基线"机制——它减去了价值函数的估计,让正负样本的梯度更新在期望上相互抵消,只留下"真正有用"的更新方向。这个抵消机制让 RL 的更新更"聚焦",不容易和其他任务冲突。
SFT 没有这种抵消机制,它的更新方向更"散",更容易和其他任务冲突。
工程意义
这个发现对 LLM 的训练流程有直接影响:
1. 如果你打算做模型合并,优先用 RL 训练。SFT 训练的模型合并后会掉性能,RL 训练的模型合并后基本不掉。 2. RL 不是为了"更强",而是为了"更合群"。在多任务场景下,RL 的价值不在于单任务性能(往往和 SFT 相当),而在于合并友好性。 3. SFT 和 RL 应该组合使用:SFT 做基础能力建设,RL 做合并前的"去冲突化"处理。
诚实评价
这篇论文有几个值得注意的点:
- 实验规模有限。三个基座模型、五个任务,覆盖面不够广。真实世界的多任务场景可能有几十个任务,冲突模式更复杂。
- 理论分析基于强假设。冲突范数的推导假设参数更新是独立的,实际中不同层的参数更新高度相关。
- "Enough is as good as a feast"(知足常乐)这个标题暗示了一个更深的观点:RL 的"温和"不是缺陷,是优势。在多任务合并场景下,不需要"学得最深",需要"学得最合群"。这个观点有启发性,但论文没有充分论证它是否适用于所有场景。
一句话总结
RL 训练的模型之所以合并后更"合群",是因为它的梯度更新幅度更小、优化目标更温和、正负样本更对称——"知足常乐"不是道德说教,是数学定理。
---
论文链接:https://arxiv.org/abs/2607.22039 HTML 版本:https://arxiv.org/html/2607.22039v1 开源代码:暂无(论文使用了 verl 和 OpenRLHF 作为训练框架)
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens