把教师监督"塞"进RL目标:Distilled RL 的三板斧

你有没有这种感觉:调LLM后训练的时候,GRPO跑起来reward曲线稳步上升,但模型解题能力好像"原地踏步"?或者说,让小模型学大模型,KL蒸馏一上,pass@1确实上去了,但pass@k上不去了——学生很快被教师"压扁",后续再怎么训练也突破不了天花板。

这两个痛点分别卡住了当前LLM后训练的两条主流路径: - 纯强化学习(RL/GRPO):信用分配只在序列级别做,奖励信号粗糙,强化已有行为很强,但学到新东西的能力有限。 - 在线策略蒸馏(OPD):用KL散度把学生拽向教师,教师-学生越像,互补知识越少;差异越大,分布失配越严重,token级模仿噪声爆炸

南开、中关村学院、浙大、北理工、中科院自动化所、哈工大七位作者(Chen Wang、Zhaochun Li、Jionghao Bai、Yining Zhang、Hexuan Deng、Ge Lan†、Yue Wang)在 arXiv:2607.17247 中提出 Distilled RL(蒸馏强化学习),把教师的 token 级偏好 选择性 嫁接到 RL 目标里,既不丢KL蒸馏的细粒度信号,又不丢RL的探索性。同家族和跨家族蒸馏都稳赢,pass@1 和 pass@k 同时涨。

我的判断:这不是什么惊天动地的底层突破,但它踩中了2026年LLM后训练里"梯度信号密度"那条最痛的神经。下面展开聊。


论文信息

  • arXiv ID: 2607.17247
  • 标题: Distilled Reinforcement Learning for LLM Post-training
  • 作者: Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan†, Yue Wang
  • 机构: 南开大学、北京理工大学、浙江大学、中科院自动化所、哈尔滨工业大学、中关村学院
  • 日期: 2026-07-19
  • 代码: https://github.com/597358816/Distilled-RL

核心摘要

痛点:RL 靠粗粒度结果奖励做信用分配,无法获取新知识;OPD 用 KL 无条件模仿教师,相似教师没料、差异教师跑偏,跨家族场景直接失效。

方案:Distilled RL 把教师对每个 token 的似然转化为"重要性权重",重新分配 RL 的学习信号;通过反向重要性采样+裁剪负样本重置序列级几何归一化三板斧,让蒸馏有选择性、不被负样本误导、不被序列长度系统性抑制。

关键效果:在 3 个学生模型 × 10 个数学推理基准上,Distilled RL 在 pass@1 上比最强 baseline 平均再涨 1.16~4.73 个点;DSQW-1.5B 这种跨家族设置,pass@1 涨 4.73 个点、Pass@16 涨 11.67~15 个点;MMLU-Pro / SuperGPQA 知识密集基准也保持最佳或最强竞争。

真实定位:这是一个工程级整合 + 直觉上很漂亮的权重设计——把 GRPO 的 PPO 风格目标与"教师相对偏好权重"做了一次正交解耦,三个补丁各打各的痛点。值得细读,但别指望它挑战 RL/RLHF 的根本假设。


问题动机:为什么RL和OPD都"半截子工程"?

把两边的痛点摆到一张图上看更直观:

图1:RL、OPD、Distilled RL的对比总览

图1:上半部分展示 RL 与 OPD 各自的结构与痛点——RL 只能拿到 coarse-grained 的可验证奖励,对"更广博的知识"访问受限;OPD 用 KL 散度把学生压向教师,但相似教师提升有限、差异教师分布严重失配。下半部分是本文 Distilled RL:把教师 logits 转化成 token 级重要性权重 ρ,在 GRPO 风格的 PPO 目标上做"选择性"加权,再通过三大机制规避负样本误导和序列长度偏差。

RL:强化已有行为强,获取新知识弱

GRPO 用组内相对奖励做 advantage,去掉了 critic,训练一气呵成。但 reward 只有 0/1 的可验证信号,整条序列共享同一个 advantage——100个token里只有最后几个数学符号决定对错,前面的推理全被一视同仁地强化或抑制。这在 DeepSeek-R1 训练早期是被默认接受的代价。

代价就是:RL 适合"打磨已学会的策略",对引入新知识帮助有限。这正是作者的判断。

OPD:分发奖励 + 模仿,跨家族就崩

Thinking Machines(2025-10)和 Qwen3 技术报告(2025)把 OPD 推成"低成本替代RL"的香饽饽——Qwen3 报告里 OPD 在 AIME'24 上做到 74.4%,GPU 时长是 RL 的 1/10 左右。听着很美,但论文作者做了三组对照实验,发现 OPD 的"性价比"故事经不起细看:

  • OPD 收敛快但后劲不足:跨家族场景下(DSQW-1.5B),OPD 早期上升明显,但很快饱和甚至回撤,160步后落后于纯RL
  • 增大 rollout 没用:把 G 从 1 增到 4、8,OPD 表现几乎没变——瓶颈不在采样方差,而在KL模仿目标本身
  • OPD+RL 简单叠加也救不回来:把 KL 损失和 RL 损失 1:1 混在一起,后期照样掉

为什么?作者给了一个很清晰的直觉:无条件KL模仿会让学生过快地贴到教师的局部最优上,留给RL的"探索空间"被压缩了。换句话说,OPD 自己挖了个坑,然后RL也填不回去。

所以问题变成:能不能既保留RL的探索性(不被KL压扁),又吸收教师的细粒度信号(RL拿不到的部分)?这正是 Distilled RL 要回答的。


方法核心:把教师偏好"加权"到 RL 目标

Distilled RL 沿用 GRPO 的整体骨架:对每个 prompt 采 G 个回复,组内归一化得到 advantage \(A_i\),用 PPO 风格 clip 目标做策略更新。唯一不同的是——在每个 token \(t\) 上,把教师的相对似然比作为一个权重 \(w_{i,t}\) 乘进去:

\[ \mathcal{J}_{\text{Distilled RL}}(\theta) = \mathbb{E}\left[ \frac{1}{G} \sum_{i=1}^G \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \min\left(r_{i,t}(\theta) \, w_{i,t} A_i, \, \text{clip}\left(r_{i,t}(\theta), 1-\epsilon_{\text{low}}, 1+\epsilon_{\text{high}}\right) w_{i,t} A_i\right) \right] \]

其中关键权重链是:

符号 含义
\(r_{i,t}(\theta)\) 学生策略比 \(\pi_\theta / \pi_{\theta_{\text{old}}}\)(标准 PPO 项)
\(A_i\) 组内归一化优势(标准 GRPO 项)
\(\rho_{i,t}\) 反向重要性比 \(\pi_{\text{teacher}} / \pi_{\theta_{\text{old}}}\),衡量教师相对旧学生对该 token 的偏好
\(\bar{\rho}_{i,t}\) \(\rho_{i,t}\) 裁到 \([1/\epsilon_\rho, \epsilon_\rho]\) 区间
\(\tilde{\rho}_{i,t}\) \(\bar{\rho}_{i,t}\) 除以同回复所有 \(\bar{\rho}\) 的几何均值
\(w_{i,t}\) \(\tilde{\rho}_{i,t}\)\(A_i>0\);1 当 \(A_i \le 0\)负样本重置

这一连串符号看着头大,其实就做了三件事:

第一板斧:反向重要性采样 + 裁剪

传统的"重要性采样"是从行为策略(旧策略)出发,把当前策略的更新矫正回旧策略的分布。这里反过来——把学生自己采的轨迹,按教师的相对偏好重新加权

直觉上,\(\rho_{i,t} > 1\) 意味着"教师觉得这个token比旧学生认为的更应该被采样",这是一个有信息量的方向;\(\rho_{i,t} < 1\) 意味着教师觉得它不太行。这种"相对偏好"是 token 级的,比整条序列一个 advantage 密度高得多。

\(\rho\) 可能极不稳定(教师-学生分布差异大时方差爆炸),所以再 clip 到 \([1/3, 3]\) 做冗余保险(实验里 \(\epsilon_\rho = 3\))。

第二板斧:负样本重置(这是论文最漂亮的一刀)

如果只做第一板斧,会踩到一个坑。论文在 Table 1 里把四种情况摊开看:

\(\rho\) 情况 \(A_i > 0\)(正样本) \(A_i < 0\)(负样本)
\(\rho > 1\)(教师偏好) ↑ 强化 → 期望行为 ↑ 加重惩罚 → 把学生推离教师,破坏蒸馏!
\(\rho < 1\)(教师不偏好) ↓ 抑制 → 期望行为 ↓ 减轻惩罚 → 放过负样本,破坏RL!

负样本上的教师重加权是两边不讨好:要么把学生推离教师(破坏蒸馏),要么削弱对错答案的惩罚(破坏RL)。

论文的解法干脆利落:负样本上把 \(\rho\) 重置为 1——蒸馏只发生在正样本上,负样本维持原始的 RL 惩罚。

听起来简单,但这一刀切下去让"选择性蒸馏"成为可能:教师只在学生做对的方向上提供额外引导,错的方向上不添乱

第三板斧:序列级几何归一化

还有最后一个工程上的小细节。因为自回归概率是乘性的,如果学生采样的 token 在教师下普遍概率偏低,\(\prod_t \rho_{i,t}\) 会随序列长度指数级衰减,长回复的正样本会被系统性压制

解法:把每条回复的所有 \(\bar{\rho}_{i,t}\) 算出几何均值 \(G_i = \exp(\frac{1}{|o_i|}\sum_s \log \bar{\rho}_{i,s})\),然后让 \(\tilde{\rho}_{i,t} = \bar{\rho}_{i,t} / G_i\)。这样保证 \(\left(\prod_t \tilde{\rho}_{i,t}\right)^{1/|o_i|} = 1\)教师指导不全局放大或抑制整条回复,只在 token 之间按教师相对偏好重新分配学习信号

说实话这块我在第一次读时差点略过,但回看消融实验才发现它是必要的——移除几何归一化后,性能持续下降但幅度较小(约1-2个点),与"系统性削弱正样本"的理论预期完全吻合。

一个可解释的"温度控制"案例研究

为了证明 Distilled RL 真的能从教师侧吸收"奖励之外的信号",论文设计了一个很精巧的 case study:

  • 学生用自己作为教师,但温度动态变化——学生熵 > 0.5 时用 \(T=0.8\) 的低温教师(更尖锐的分布),学生熵 ≤ 0.5 时用 \(T=1.2\) 的高温教师(更平滑的分布)。
  • 观测学生熵的轨迹。

图2:熵控制案例研究——学生熵被教师拉到目标阈值

图2:学生策略熵(蓝线)随训练步数的变化。横轴是 step(0-160),左轴是熵值,右轴是教师温度(橙虚线)。可以看到学生熵从初始的 0.2 快速上升到 0.5 附近,并在阈值附近持续波动;与此同时教师温度在阈值上下切换。说明 Distilled RL 真的把"目标熵"这个 reward 里完全没有的信息学到手了。

这是个很 clever 的设计:reward 函数跟熵完全无关,能学到目标熵纯粹是因为 Distilled RL 在 token 级上利用了教师分布形状的信号。标准 RL 做不到这个。

消融里移除"负样本重置"后,case study 直接崩了——熵一路掉到 0.1 附近(学生被推到一个教师认为"不该这么自信"的区域),训练 120 步之后才反弹:

图3:消融 case——移除负样本重置后熵控制失效

图3:与图2同样的设置,但去掉了"负样本重置"。学生熵从 0.2 一路掉到 0.1(学生过度自信),在 120 步之后才反弹并突破阈值。这说明"负样本重置"是 Distilled RL 能选择性吸收教师信息的关键。


实验结果:稳赢,但要"看仔细"

训练动态:跨家族场景更显差距

论文对比了 Qwen3-4B(同家族)和 DSQW-1.5B(跨家族)上的训练过程:

图4:Qwen3-4B(同家族)训练动态

图4:Qwen3-4B 上的训练曲线(4列从左到右:Reward、Entropy、Response Length、Competition Score)。Distilled RL(红)全程保持最高奖励和最低熵,长度稳定在 4500 左右,竞赛得分明显拉开。RL(橙)在后期熵回升(探索恢复但没用对方向)。OPD(蓝)和 OPD+RL(绿)长度爆炸但 reward 拉不开差距。

图5:DSQW-1.5B(跨家族)训练动态

图5:DSQW-1.5B 跨家族蒸馏的训练曲线。Distilled RL(红)在 reward 和竞赛分上明显领先;RL(橙)熵飙到 3+(训练崩溃迹象),长度反而下降到 3000(被压短)。OPD/OPD+RL 长度暴涨到 7500+——典型的"用长度换 reward"的 hack。跨家族场景下,Distilled RL 的优势比同家族更明显。

跨家族时 RL 出现"熵暴涨+长度缩短"是非常典型的训练不稳定信号,Distilled RL 把这俩都压住了。说明当教师-学生分布差异大时,token 级选择性加权比无差别KL模仿更鲁棒

主实验:Pass@1 全面涨,跨家族涨最多

10 个数学推理基准上的 Pass@1 平均分(Table 2 节选):

Method DSQW-1.5B(跨家族) Qwen3-4B(同家族) Qwen3-1.7B(同家族)
Base 31.70 46.33 39.86
OPD 35.27 55.97 45.21
RL (GRPO) 36.86 57.40 44.76
OPD+RL 36.54 56.38 44.89
Distilled RL 40.00 58.96 46.37
Δ vs 最强 baseline +3.14 +1.56 +1.16

跨家族涨 3.14 个点,同家族涨 1.16~1.56 个点——符合"教师-学生差异越大,Distilled RL 优势越明显"的预期。因为差异大时 OPD 的 KL 模仿首先失效,Distilled RL 的选择性加权反而能稳定工作。

Pass@16 / Pass@k 上 Distilled RL 优势更突出。以 DSQW-1.5B 为例,AIME24 Pass@16 从 60.00(RL)涨到 70.00,CMIMC25 从 22.50 涨到 27.50。这说明 Distilled RL 不仅提升了最高概率响应的质量,还把整个响应分布的上限往右推了——这正是论文最值钱的一个点。

消融实验:三个组件一个都不能少

Qwen3-4B 上移除各组件的 AVG 下降:

配置 AVG Pass@1 相对完整方法下降
完整 Distilled RL 58.96
w/o 负样本重置 50.15 -8.81
w/o 几何归一化 57.49 -1.47

负样本重置贡献最大(8.81 个点)——和 case study 的结论一致。几何归一化虽然单项小(1.47),但它是"系统性偏差"的修正,少了它整个蒸馏信号会随序列长度变弱,是结构性必要。


我的判断

论文的亮点

  1. 问题定义非常清晰:把"RL 拿不到新知识"和"OPD 跨家族失效"两个长期痛点合并成一个"教师监督应该被选择性吸收"的问题。
  2. 负样本重置那一刀很 sharp:Table 1 把四种组合摊开看,一目了然为什么无条件模仿会双向破坏——这种把直觉画成矩阵的方式,工程上很值得借鉴。
  3. 温度控制 case study 比"模型涨几个点"的说服力强 10 倍。用熵作为探针,证明了 Distilled RL 能吸收 reward 之外的信息
  4. 三个补丁的职责解耦得很干净:每个组件打一个独立的点,加在一起不打架。代码友好性应该不错。

论文的局限 / 我的疑虑

  1. 基线 OPD 用的是 reverse KL——这是当前 LLM 蒸馏的事实标准,但作者没对比 forward KL、RKL+JS、Adaptive KL 等变体。如果用 forward KL(mode-covering)会不会有不一样的故事?论文没说。
  2. 教师固定为 Qwen3-8B-GRPO——在 DSQW-1.5B 这种跨家族场景里,教师本身就是在 Qwen3 家族 RL 过的,本身就强于学生。但作者没测"教师差异更大"(比如 Qwen3-32B 当教师)会不会进一步放大优势,也没测"教师更弱"会不会反而引入负向偏好。
  3. 学习信号耦合的风险:负样本重置把教师的反向作用切断了,但正样本上教师权重仍然可能"系统性偏好某种 token 风格"。这跟 RL 里的"reward hacking"是一类问题,只是没奖励信号那么显眼。
  4. 在 DAPO-17K 这种数学专项数据上训练,拿到 MMLU-Pro / SuperGPQA 的提升,是否真的代表"通用知识保留"?还是因为数学推理和知识题有部分重叠?作者没有深入做分布外分析。
  5. 没和 Qwen3 报告里的 OPD 配置直接比较。Qwen3 团队也是 OPD 重度用户,他们的实现细节(数据混合、KL 系数调度)可能与这里的"GRPO+reverse KL"基线有差异。拿 Distilled RL vs "Qwen3-style OPD" 才算公平对决,但论文没做。

一些技术吐槽

  • \(\epsilon_\rho = 3\) 是怎么选的?作者没做 sensitivity 分析。clip 区间对权重分布的影响是结构性的,这个超参至少应该扫一下。
  • 学习率 1e-6、训练 160 步——这个预算其实很小。如果加预算,RL 的曲线是不是会追上 Distilled RL?论文没给更长训练步的对比。
  • 教师-学生选择:"DSQW-1.5B + Qwen3-8B 教师"是跨家族,但底座模型都是 Qwen 蒸馏的,远没到"GPT 当教师蒸馏 LLaMA"那种真跨家族的程度。真正的跨家族测试在更异构的模型对之间才能见真章。

对工程实践的启发

如果你正在做小模型蒸馏,这篇论文至少给三个可借鉴的点:

  1. 别再 1:1 混 KL 损失和 RL 损失了——OPD+RL 的"小升级版"在该实验里基本没收益。要么纯 RL,要么走 Distilled RL 这种"耦合式"目标。
  2. "教师权重只在正样本上生效"是个被低估的工程经验——很多团队做RL+KD时不会区分样本正负,结果教师信号把负样本也"误导"了。这一刀零成本,但效果立竿见影。
  3. 几何归一化可以独立使用——即便你暂时不打算用完整 Distilled RL,把教师权重除以同序列几何均值这一招,对长序列蒸馏的稳定性提升是很实在的

跟同期工作的位置

  • vs Thinking Machines 的 OPD(2025-10):OPD 是 KL 模仿 + 通用 RL 框架;Distilled RL 是在 OPD 思路上的"信号选择器升级版"。前者追求"更便宜的RL",后者追求"更有选择的蒸馏"。
  • vs Qwen3 报告里的 OPD:Qwen3 的 OPD 是"大教师教小学生"的成熟工业方案,Distilled RL 的差异化在于跨家族场景下的稳定性。
  • vs DeepSeek 的 GRPO:GRPO 解决了"如何去掉 critic",Distilled RL 解决的是"如何用更密的梯度"。两者是正交的,可以叠加。

收尾

总结一下,Distilled RL 的本质是把"教师相对偏好"作为信号选择器接入 GRPO 目标,三个组件(反向重要性采样+裁剪、负样本重置、序列级几何归一化)各管一摊、各打各的痛点。跨家族场景涨 3+ 个点、Pass@16 涨 10+ 个点、case study 证明能吸收 reward 之外的信息——这套打法在工程上站得住脚,值得在小模型蒸馏的 pipeline 里试一把

但也别神化它。它没有挑战 RL/RLHF 的根本假设(credit assignment 仍然是序列级,token 级只是更细而非真正的 step 级),教师-学生匹配仍然是依赖人工选择的隐含超参。真正"无教师也能涨点"的纯 RL 路径,仍然是更值得长期投入的方向

如果你也对"教师-学生匹配"、"选择性蒸馏"、"token 级信用分配"这些话题感兴趣,欢迎评论区聊聊你踩过的坑。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我。