多任务训练时 SFT 互相打架、RL 却能和平共处?这篇论文把原因算明白了

你有没有遇到过这种情况:手头有四个任务——数学、科学、逻辑、代码,想让一个模型全都学会。用 SFT 一个任务一个任务地训,训完发现前面学的东西全忘光了,模型直接废掉。换成 RL 再试一遍,同样的多阶段流程,模型居然每个任务都在稳步涨分。

这不是玄学,也不是运气。arXiv 上的这篇新论文(arXiv:2608.03573)把这个现象从参数层面拆开看了一遍,还给出了一个干净的理论解释:SFT 的任务干扰是范数受限的,RL 的任务干扰是方差受限的。一句话讲清楚:SFT 的梯度冲突随梯度绝对大小缩放,天然很大;而 RL 因为优势归一化和 on-policy 采样,跨任务的梯度方差被压得很小,不同任务的更新方向在高维空间里几乎正交,谁也不碍着谁。

顺着这个理论,作者提出了 Parallel-RL:既然各任务的 RL 更新互不干扰,那就别串行训练了,每个任务单独并行训 RL,最后把参数增量合并起来就行。实验里最强的 Adapted Parallel-RL 不仅追平甚至超过了多阶段联合训练(性能保留率 102.8%),还只用 5% 的数据做合并后适配。说实话,看到这个"拆开来训再拼回去还能更好"的结果时,我是有点意外的。

我的总体判断:这篇文章最值钱的不是 Parallel-RL 这个工程方案,而是那套"方差受限干扰"的理论——它第一次把"为什么 RL 在多任务下更稳"这件事从经验观察变成了可证明的结论。Parallel-RL 本身是理论的自然推论,实现不复杂,但对实际做多任务后训练的团队来说,省下的串行训练时间是实打实的。


📖 论文信息

  • 标题:SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
  • 作者:Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao
  • 机构:清华大学、中国科学院自动化研究所等(按 arXiv 署名)
  • 链接:https://arxiv.org/abs/2608.03573 (v2,2026 年 8 月 6 日修订)
  • 代码:https://github.com/GaryStack/Parallel-RL

🎯 一个被忽视已久的实践分歧

先说背景。现在给 LLM 做推理能力后训练,主流就两招:SFT 和 RL(以 GRPO 为代表)。但如果你去观察工业界的实际做法,会发现一个挺有意思的分歧:

  • SFT 多任务训练,大家几乎清一色用混合数据——把所有任务的数据混在一起联合训;
  • RL 多任务训练,除了混合数据,还大量采用多阶段训练——一个任务训完再训下一个,串着来。

为什么 SFT 不敢串着训,RL 却可以?这个分歧一直停留在"经验"层面,没人系统解释过。这篇论文就是冲着这个问题来的。

作者的初步实验做得直接了当。基座用 DeepSeek-R1-Distill-Qwen-1.5B,RL 算法用 GRPO,两边都用 LoRA 微调,四个任务:Math(MATH500)、Science(MMLU)、Logic(Knights & Knaves)、Code(LiveCodeBench)。

多阶段训练的结果,对比相当惨烈:

策略 Math Science Logic Code
Base Model 83.1 34.9 31.0 15.0
Mixed Data SFT 84.6(+1.5) 38.9(+4.0) 34.0(+3.0) 16.0(+1.0)
Multi Stage SFT 78.2(-4.9) 31.1(-3.8) 9.0(-22.0) 14.3(-0.7)
Mixed Data RL 85.2(+2.1) 43.2(+8.3) 37.0(+6.0) 15.7(+0.7)
Multi Stage RL 86.6(+3.5) 49.3(+14.4) 43.0(+12.0) 17.3(+2.3)

多阶段 SFT 相对基座平均掉了 23.1%,Logic 任务直接从 31.0 崩到 9.0。而多阶段 RL 平均涨了 24.9%——注意,它涨得比混合数据 RL(12.6%)还多。

单任务训练的交叉影响更能说明问题:SFT 在目标任务上平均涨 4.0 个点,但没训的任务平均掉 5.1 个点(比如只做 Science SFT,Logic 就从 31.0 跌到 10.0);RL 则反过来,目标任务涨 6.8 个点,没训的任务还平均涨了 2.3 个点

这就是论文标题的由来:SFT Conflicts,RL Coexists。

图1:SFT 与 RL 在多阶段训练中的差异示意

图1:策略空间里的直观图景。蓝色等高线是 Math 性能、橙色是 Code 性能。SFT 的两个阶段各自朝着自己的目标策略冲过去(两个目标离得很远),第二阶段直接把第一阶段攒下的性能抵消掉,最终的红星落在一个两边都不讨好的位置。RL 的两个任务更新(Math RL 和 Code RL)方向近乎正交,各自只往自己的目标策略挪一小步,互不干扰,绿星稳定地同时提升两个任务。

🔬 参数层面:两个数量级的差距

现象看到了,接下来是拆机器。作者直接对比了 SFT 和 RL 训完后的参数增量 \(\Delta W\),两个观察相当扎眼。

观察一:幅度和稀疏度完全不在一个量级。 RL 更新的平均 L2 范数大约 \(3\times10^{-2}\),SFT 是 7.4 左右——差了超过两个数量级。稀疏性上,RL 只有约 20% 的参数更新幅度超过 \(10^{-5}\),SFT 则是 93%。

观察二:方向几乎正交。 不同任务之间 \(\Delta W\) 的余弦相似度,RL 只有 \(10^{-5}\) 量级(数学意义上基本就是正交),SFT 高达 \(10^{-1}\) 到 1.0,Math 和 Code 之间甚至是负的(-0.97)——方向完全相反,怪不得互相拆台。

图2:SFT 与 RL 参数更新的成对余弦相似度热图

图2:左图是 SFT,右图是 RL。对角线是各任务更新的 L2 范数(SFT 在 6.5-8.9,RL 在 0.01-0.09),非对角线是任务两两之间的余弦相似度。SFT 那边大面积深绿(相似度 0.95 以上),Math-Code 两格直接是红色负值;RL 这边非对角线全是接近零的浅色,最大绝对值也不过 \(4.8\times10^{-4}\)。一张图把"冲突"和"共存"画得明明白白。

🧠 理论核心:范数受限 vs 方差受限

到这里都还只是经验观察。这篇论文真正硬的部分,是把这个现象变成了一个可证明的定理。

先把两种范式的梯度写出来。SFT 拟合的是外部专家分布,off-policy:

\[g_{\text{SFT}} = \mathbb{E}_{x\sim\mathcal{D},\, y\sim\pi_{\text{expert}}}\left[\nabla_\theta \log \pi_\theta(y|x)\right]\]

RL 从自己当前的策略里采样,on-policy,每个样本还乘一个优势权重:

\[g_{\text{RL}} = \mathbb{E}_{x\sim\mathcal{D},\, y\sim\pi_\theta}\left[A(x,y)\,\nabla_\theta \log \pi_\theta(y|x)\right]\]

两个根本区别就藏在这里:样本来源(专家分布 vs 自身策略)和优势函数(有没有那个标量权重 \(A(x,y)\))。整个理论都建立在这两点上。

对于 GRPO,组内优势是归一化的:\(\hat{A}_{i,k}=(r_{i,k}-\mu_{r_i})/\sigma_{r_i}\),这带来一个关键性质——零和:同一组 rollouts 的优势加起来等于零,\(\sum_k \hat{A}_{i,k}(x)=0\)

利用零和性质做内积分解,论文的 Lemma 4.3 证明:任务 \(i\) 和任务 \(j\) 之间的 RL 梯度干扰,可以写成残差 score function 的内积——

\[\mathcal{I}_{\text{RL}}(i,j)=\mathbb{E}_{x,x'}\left[\frac{1}{G^2}\sum_{k,l}\hat{A}_{i,k}(x)\hat{A}_{j,l}(x')\langle\delta S_{i,k}(x),\delta S_{j,l}(x')\rangle\right]\]

其中 \(\delta S_{i,k}=S_{i,k}-\bar{S}_i\) 是去掉组均值后的残差。

这个分解的直觉很妙:优势归一化就像一个过滤器,把梯度里"所有 rollout 共享的均值方向"整个滤掉了,只剩下组内相对差异驱动的部分。强化比平均好的轨迹、打压比平均差的轨迹,均值方向本身不产生任何更新。而 SFT 没有这个过滤器,它的干扰直接依赖完整 score function 的内积 \(\langle S_i^*, S_j^*\rangle\),均值方向照单全收。

再加上 on-policy 带来的另一层保障——模型只在自己分布附近的样本上学习,更新天然被限制在一个小范围内(这跟之前 RL's Razor 那篇工作说的"RL 收敛到离初始策略 KL 最近的最优策略"是一脉相承的),不同任务的残差向量独立、零均值、稀疏。高维空间里,这样的随机向量以高概率近似正交:\(\mathbb{P}(|\langle\delta S_i,\delta S_j\rangle|\geq t)\leq 2\exp(-ct^2 d)\)

最后汇成 Theorem 4.5,两个上界:

  • SFT(范数受限)\(|\mathcal{I}_{\text{SFT}}(i,j)| \leq M_i \cdot M_j\),其中 \(M_i\) 是 score function 的能量上界。拟合外部专家分布导致这个范数天然很大,冲突随梯度绝对大小缩放;
  • RL(方差受限)\(|\mathcal{I}_{\text{RL}}(i,j)| \leq V_i \cdot V_j\),其中 \(V_i\) 是组内 rollouts 的残差方差上界。这个方差由优势归一化和 on-policy 共同压小,而且随训练收敛还会持续衰减。

定量验证也对得上:score function 的 L2 范数,SFT 约 7.1、RL 约 \(10^{-1}\);残差范数 RL 只有 \(10^{-2}\);跨任务余弦相似度,SFT 约 \(10^{-1}\)、RL 约 \(10^{-3}\)。理论和测量完全咬合。

图3:RL 与 SFT 训练时 score function 分布的 t-SNE 可视化

图3:训练过程中在 Math 和 Science 任务上采样的 score function,t-SNE 降到二维。左图 RL:Math(绿)和 Science(红)形成两个明显可分、几乎不重叠的簇——不同任务的优化信号天然解耦。右图 SFT:两个任务的分布大面积重叠纠缠在一起——梯度信号你中有我我中有你,冲突是必然的。这张图是"方差受限"理论最直观的证据。

🏗️ Parallel-RL:理论的自然推论

理论一旦成立,工程方案几乎是白送的。

逻辑链条很简单:既然各任务的 RL 更新 \(\Delta W_i\) 两两近似正交,那么 \(\Delta W_1 + \Delta W_2 + \cdots + \Delta W_N\) 就几乎不会互相抵消。既然如此,何必串行训练?每个任务起一个独立的 RL 进程并行训,最后把参数增量合并,效果应该接近多阶段训练,还省掉了串行排队的时间。

框架就一行公式:

\[W_{final} = W_{base} + \mathcal{M}(\Delta W_1, \dots, \Delta W_N)\]

合并函数 \(\mathcal{M}\) 有三类实现:

  1. Naive Parallel-RL:直接求和(sum)或取平均(mean);
  2. Sparse Parallel:TIES(先修剪再符号选举的经典稀疏合并)和 SVD(受"RL 训练效果主要由 rank-1 分量承载"的观察启发,每个 \(\Delta W_i\) 只保留 rank-1 方向再合并);
  3. Adapted Parallel-RL:在 sum 合并的基础上,用原训练集 5% 的样本做一轮快速合并后适配。

作者特意强调,Parallel-RL 不只是个模型合并技巧,而是一套完整的后训练范式——还包括怎么判断哪些任务适合并行(Appendix D.1)、单任务训练的实用技巧(Appendix D.2)。

📊 实验:合并出来的模型居然比联合训练还好

主实验升级了配置:DeepSeek-R1-Distill-Qwen 的 1.5B 和 7B 两个尺寸,全参数 GRPO 训练,评测也扩到六个基准——MATH500、AIME2025(数学)、MMLU、GPQA(科学)、KK(逻辑)、LiveCodeBench(代码)。

1.5B 的关键结果:

方法 MATH500 AIME25 MMLU GPQA KK LCB ΔBase 保留率
Base Model 82.0 26.9 34.9 32.3 31.0 15.0
Single-Task SFT 85.8 31.5 49.1 35.4 37.0 16.3 +5.5
Single-Task RL 87.4 32.7 51.8 39.9 44.0 21.6 +9.3
Multi Stage SFT 71.0 21.8 33.2 23.2 11.0 12.1 -8.3
Multi Stage RL 87.8 33.1 52.8 40.4 48.0 21.0 +10.2
Naive Parallel-SFT (sum) 61.2 20.0 25.9 26.8 23.0 10.1 -9.2 65.4%
Naive Parallel-RL (sum) 86.4 32.3 48.0 37.4 39.0 18.4 +6.6 94.2%
TIES Parallel-RL 87.6 32.5 49.2 38.4 43.0 19.7 +8.0 97.4%
SVD Parallel-RL 87.2 31.9 48.3 36.9 42.0 15.9 +6.7 94.6%
Adapted Parallel-RL 88.6 33.8 50.9 41.4 49.0 22.5 +10.7 103.2%

几个数字值得停下来看一眼。

Naive Parallel-RL(就是最朴素的直接相加)保留了单任务性能的 94.2%,而同样处理的 Parallel-SFT 只剩 65.4%——理论预测的差距在合并场景下完整复现。TIES 和 SVD 这种带稀疏化的合并进一步把保留率推到 97.4% 和 94.6%。

但最让我愣一下的是 Adapted Parallel-RL:保留率 103.2%,超过了单任务模型的平均水平。ΔBase +10.7,比 Multi Stage RL 的 +10.2 还高。你想想看,拆开并行训、拼起来、再用 5% 的数据顺一遍,最后比老老实实串行联合训练还好。7B 上结论一致:Adapted Parallel-RL 保留率 102.4%,MATH500 96.2、AIME 59.0 都是全表最优,而 Multi Stage SFT 在 7B 上直接 -11.7(MMLU 从 51.8 跌到 35.3)。

消融实验也做得干净。在完整的 Parallel-RL 里逐个拿掉某个任务的 \(\Delta W_i\)

移除任务 ΔTarget(目标任务) ΔOthers(其余任务)
w/o Math -3.6 +0.9
w/o Science -10.5 -0.1
w/o Logic -9.0 +0.9
w/o Code -5.3 +0.6

拿掉哪个任务,哪个任务就掉(平均 -7.1 个点),其余任务几乎纹丝不动(平均 +0.6 个点,甚至微涨)。这等于直接证明了各任务能力在合并后的模型里是模块化存储的——想拔掉哪个能力就拔掉哪个,想插上新任务就单独训一个 \(\Delta W\) 加进去。对做模型能力管理的团队来说,这个性质比绝对性能数字更有价值。

🤔 我的几点判断

理论部分是全文最硬的贡献。 "优势归一化过滤掉均值方向"这个机制解释,把过去一堆经验观察(RL 抗遗忘、RL 更新稀疏、RL 模型好合并)统一到了一个框架下面。之前 RL's Razor 和 The Path Not Taken 解释的是 RL 为什么抗遗忘,这篇把问题推进到了多任务干扰的层面,而且给了可验证的上界。顺说一句,理论性质在附录里被推广到了 GRPO 之外的 RL 算法,通用性这块作者是有意识补上了的。

同期工作对比要提一句。 7 月底有篇 arXiv:2607.22039("Enough is as good as a feast")也发现了"RL 训的模型比 SFT 更适合合并",并且做了跨合并方法、跨 RL 算法、跨基座模型的大规模验证。那篇偏经验、这篇偏理论,两边结论互相印证,"RL 更新近正交"这个现象的可信度其实比单看一篇要高。这篇论文自称是首个系统研究 SFT/RL 多任务分野的工作——严格说理论首个没问题,现象层面是有人在同期甚至更早注意到的。

实验规模是个诚实要说的局限。 主实验只到 7B,任务也只有四个推理类任务。方差受限的上界在更大模型、更异质的任务组合(比如推理任务混着闲聊、安全对齐这类软性任务)下还紧不紧,论文没有回答。我自己也没完全想清楚一点:当任务间存在真正的能力依赖(比如代码能力依赖逻辑能力)时,"近正交"到底是优点还是会丢掉正向迁移?消融里 ΔOthers 普遍微涨,暗示任务间本来就没多少正向耦合可丢,但四个任务都是相对独立的推理任务,这个结论外推到更宽泛的场景要打个问号。

工程上的启发是实打实的。 如果你在维护一个多能力模型,这篇论文给了一条很实用的路径:新能力不需要重新排期做全量联合训练,单独起一个 RL 任务训出 \(\Delta W\),合并进去,再用少量数据适配一下。训练资源可以按任务粒度并行调度,能力可以按模块插拔。这在算力排期紧张的环境里,价值不需要多解释。

📝 收尾

一句话总结:这篇论文回答了"为什么 RL 多任务训练不打架"这个被业界默默利用了很久的问题——优势归一化滤掉了均值梯度方向,on-policy 把更新限制在小范围,剩下的只有小而稀疏、近乎正交的残差更新。Parallel-RL 是这个理论顺手摘下的果子,但甜得很实在。

如果你正在做多任务后训练,我的建议是:先把"单任务 RL + 合并"这条路径在小模型上跑通验证一下保留率,再考虑要不要替换掉现有的串行流程。大概率你会回来的。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我