RSTG:只在失败处蒸馏——自适应教师指导恢复负零方差组的学习信号

论文:Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance arXiv:2608.00782(2026-08-01 提交,cs.CL) 作者:Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi Gu, Xunliang Cai, Deyi Xiong(天津大学 TJUNLP Lab × 美团 LongCat 团队,通讯作者 Deyi Xiong) 链接:https://arxiv.org/abs/2608.00782


一、一句话总结

GRPO 在组内 rollout 全错(负零方差提示)时梯度为零,而朴素地把在线策略蒸馏(OPD)加进 GRPO 反而更差;RSTG 提出"只在学生失败且教师擅长的地方蒸馏"——样本级按教师置信度加权、token 级只选高熵/大分歧 token、再辅以教师正确轨迹的 SFT 注入正梯度,在数学上比 naive GRPO+OPD 提升 +4.02%、代码上 +3.05%。

二、研究背景与动机

2.1 RLVR 与 GRPO 的梯度消失问题

基于可验证奖励的强化学习(RLVR)已成为 LLM 后训练标准范式(Qwen3、DeepSeek-R1、Gemini 2.5 等)。GRPO 对一组 rollout 的结果奖励做组内归一化得到标量优势,统一施加到每个 token,导致两个痛点:

  • 奖励稀疏:只有序列级 0/1 奖励;
  • 梯度消失:当组内所有 rollout 全对或全错时,优势坍缩为零,梯度完全消失。论文将这两类提示分别称为正零方差提示(positive zero-variance prompts)负零方差提示(negative zero-variance prompts)

2.2 OPD 是天然补救,但 naive 组合会失败

在线策略蒸馏(OPD)让学生生成自己的 rollout,用教师的逐 token log 概率提供密集监督,理论上正好弥补 GRPO 的稀疏性。然而实验发现(Figure 1),直接相加 GRPO 与 OPD 损失效果甚至不如纯 GRPO。论文归因于三点:

  1. 样本级均匀性(Sample-level Uniformity):并非所有样本都受益于蒸馏,教师指导质量取决于教师对该样本的熟练程度;
  2. 教师有界性(Teacher-boundedness):OPD 收敛快但上限被教师封顶,过早向教师收敛会严重损害 RL 的探索能力;
  3. 优势不对称(Advantage Asymmetry):教师通常给学生生成的 token 分配低概率,导致大多数 token 级优势为负,学习信号被抑制;且 OPD 本质上是局部的——以可能错误的学生前缀为条件,产生不可靠梯度。

三、方法:RSTG

核心思想:仅在"学生失败而教师擅长"的地方精确施加蒸馏。整体流程(Figure 2):遇到负零方差提示时激活 RSTG 分支,其余提示走标准 GRPO 分支。

3.1 样本级选择 + 教师置信度加权

动机实验:将 57K 数学数据集 𝒟 按模型表现划分为嵌套子集: - 𝒟_sw(9K):学生 8 次 rollout 全失败(mean@8 = 0); - 𝒟_swtr(2K):𝒟_sw 的子集,教师成功率满分(mean@8 = 1)。

关键发现(Figure 3):只在"学生错且教师对"的样本上做 OPD,仅用 3.63% 的数据就超过在全量数据上做 OPD。这类样本恰好对应 GRPO 中的负零方差提示。

混合优势函数(Eq. 9):

A^Hybrid_{i,t} = β · ω_i · A^OPD_{i,t}    若 r_j = 0, ∀j ∈ G(负零方差)
               = A^GRPO_{i,t}              否则

其中 ω_i ∈ [0,1] 为教师的 mean@8 分数(教师置信度代理),β 为控制 OPD 信号强度的缩放超参(线性退火)。教师越自信,蒸馏权重越大。

3.2 Token 级选择

目的:减缓学生向教师收敛、降低梯度噪声。受 TIP 启发,选取两类高价值 token:

  1. 高熵 token(学生不确定,通常是关键推理节点):h_t = −Σ_v p_{t,v} log p_{t,v}(Eq. 10)
  2. 大分歧 token(师生差异大、信息量更丰富):d_t = |A^OPD_{i,t}|(Eq. 11)

对二者做 min-max 归一化后用 Soft-OR 合成选择分数(Eq. 12):

s_t = ĥ_t + d̂_t − ĥ_t · d̂_t

Token 掩码 OPD 优势(Eq. 13):仅保留按 s_t 排序的 top-k% token,其余置零。

3.3 辅助 SFT 增强

问题:负零方差提示上的 OPD 优势在整个训练过程中始终比正零方差提示更负(Figure 4),形成纯惩罚性、无建设性的优化信号。

方案:对负零方差提示,在教师预生成的正确轨迹上附加 SFT 损失。论文从统一 RL 视角论证:SFT 等价于给教师轨迹每个 token 赋予均匀正优势 A^SFT_t = 1,从而注入纯正梯度、提供解空间全局视角、缓解优势不对称。

最终训练目标(Eq. 14):

J_Final(θ) = J_GRPO(θ; β·ω_i·Â^OPD_{i,t}) + β·J_SFT(θ)   若 r_j = 0, ∀j ∈ G
           = J_GRPO(θ; A^GRPO_{i,t})                       否则

SFT 与 OPD 共享同一系数 β,保证正则强度一致。SFT 数据构建:每提示从教师预采样 n=8 个响应,保留最短的正确响应作为参考;离线生成,零训练成本(57K 数据、2 张 A100 约 2 小时)。

四、实验设置

4.1 模型对(3 对师生,覆盖 2 个模型家族)

编号 Student Teacher
Pair ❶ Qwen3-1.7B-Instruct Qwen3-4B-Instruct-2507
Pair ❷ Qwen3-4B-Instruct Qwen3-4B-Instruct-2507
Pair ❸ Qwen2.5-3B-Instruct Qwen2.5-14B-Instruct

4.2 数据与评估

  • 训练数据:数学为 DeepMath 中筛选难度 ≥6 的 57K 样本;代码为 Eurus-RL-Code(25K)。
  • 评估基准:数学——AIME 2024 / AIME 2025 / MATH-500 / OLMPIAD Bench;代码——APPS(均匀抽 500 题、三难度等量)、MBPP+。
  • 采样:temperature=1.0,top-p=1.0,最大长度 8192;数学每题 16 解、代码每题 4 解。

4.3 实现细节

batch size=256,rollout 数 8,学习率 1e-6,禁用 thinking 模式;数学训 550 步、代码 400 步;β 线性退火(β_init=5e-3,δ=5e-5,β_min=1e-3);基于 VeRL,8×A100。

4.4 Baselines(5 个)

GRPO、OPD、GRPO+OPD(naive 组合,遵循 KDRL 配置,从全样本/学生失败样本/负零方差提示三种变体取最佳)、ReLIFT(负零方差提示上用 ground-truth 做 SFT)、RL-ZVP(对零方差提示设计基于 token 熵的非对称优势)。

五、主要结果(Table 1)

Pair ❶:Qwen3-1.7B → Qwen3-4B-2507

Method AIME24 AIME25 MATH500 OLMPIAD MATH AVG APPS MBPP+ CODE AVG
Vanilla 12.08 10.83 72.66 40.26 39.96 30.80 49.22 40.01
OPD 32.29 20.62 84.32 53.46 47.67 32.41 75.10 53.76
GRPO 34.79 27.71 88.64 55.15 51.57 50.39 69.66 60.03
GRPO+OPD 35.21 26.88 88.27 55.13 51.37 57.03 72.06 64.55
ReLIFT 35.21 30.42 88.65 55.79 52.52 60.17 60.98 60.58
RL-ZVP 31.87 25.62 86.99 53.46 49.49 49.73 70.12 59.93
RSTG 42.98 31.87 89.36 57.36 55.39 61.81 72.41 67.11

Pair ❷:Qwen3-4B → Qwen3-4B-2507

Method AIME24 AIME25 MATH500 OLMPIAD MATH AVG APPS MBPP+ CODE AVG
Vanilla 24.38 18.33 83.84 52.20 44.69 43.93 74.22 59.08
OPD 50.83 40.63 91.93 63.71 61.78 53.10 86.19 69.65
GRPO 54.37 45.00 94.29 66.08 64.94 65.29 77.82 71.56
GRPO+OPD 50.42 41.87 93.95 67.25 63.37 73.46 84.53 79.00
ReLIFT 58.13 42.71 94.74 64.61 65.05 76.12 85.41 80.77
RL-ZVP 50.42 42.71 93.54 63.41 62.52 68.16 82.98 75.57
RSTG 57.08 47.92 95.30 67.24 66.89 75.68 88.42 82.05

Pair ❸:Qwen2.5-3B → Qwen2.5-14B

Method AIME24 AIME25 MATH500 OLMPIAD MATH AVG APPS MBPP+ CODE AVG
Vanilla 4.58 1.25 62.14 27.04 23.75 16.60 62.84 39.72
OPD 6.67 1.46 63.56 28.98 25.17 23.14 66.63 44.89
GRPO 6.04 3.33 68.16 32.09 27.41 37.18 66.63 51.91
GRPO+OPD 6.88 4.58 67.68 31.95 27.77 49.72 73.37 61.55
ReLIFT 6.46 2.71 67.44 32.05 27.17 52.60 71.50 62.05
RL-ZVP 6.46 3.33 67.24 31.72 27.19 42.03 71.01 57.52
RSTG 8.33 5.42 68.14 32.74 28.66 53.01 74.03 63.52

结果要点

  • 数学:naive GRPO+OPD 相对 GRPO 变化 −0.2% / −1.57% / +0.36%(基本无效甚至有害);RSTG 相对 naive GRPO+OPD 提升 +4.02% / +3.52% / +0.89%
  • 代码:naive GRPO+OPD 相对 GRPO +4.52% / +7.44% / +9.64%;RSTG 再进一步提升 +2.56% / +3.05% / +1.97%
  • Pair ❷ 师生同为 4B、能力差距小,收益相对较弱——印证 OPD 依赖师生能力差。
  • 训练动态(Figure 5):RSTG 在几乎每个训练步都优于所有基线。

附加分析

  • 优势不对称缓解(Figure 6):RSTG 的优势值更高,更多 token 获得正向学习信号。
  • 收敛速度:以师生 top-16 token 重叠率衡量,step 200 时 OPD=69.7%、naive GRPO+OPD=67.6%、RSTG=65.81%——RSTG 减慢向教师收敛,保留更大探索空间。
  • 响应长度(Figure 7):OPD 存在长度骤胀问题,RSTG 有效抑制,与 GRPO 相当。
  • 计算成本:负零方差提示初始约占训练步的 15.6%,随模型提升而下降;RSTG 相对标准 GRPO 额外开销很小(8×A100、550 步约 +12 小时)。

六、消融实验

6.1 组件逐步叠加(Table 3,Pair ❶,数学)

配置 AIME24 AIME25 MATH500 OLYMPIAD AVG
GRPO 34.79 27.71 88.64 55.15 51.57
GRPO+OPD(全样本) 35.62 24.79 86.76 55.55 50.68
GRPO+OPD(仅负零方差) 35.21 26.88 88.27 55.13 51.37
+优势加权 36.88 28.75 88.74 56.39 52.69
+Token 选择 37.92 29.58 88.75 56.69 53.24
+SFT(完整 RSTG) 42.98 31.87 89.36 57.36 55.39

每个组件均有实质贡献,其中 SFT 增强提升最大(+2.15 AVG)。反证实验:移除教师置信度加权和 token 选择后,数学 AVG 降至 51.74%,甚至低于 ReLIFT(52.52%)——说明没有精心设计的 OPD 反而有害。

6.2 β 系数策略(Table 2,数学)

策略 AIME24 AIME25 MATH500 OLMPIAD AVG
退火 β_init=5e-3 35.21 26.88 88.27 55.13 51.37
退火 β_init=1e-2 36.04 26.46 87.35 54.01 50.97
常数 β=5e-3 35.00 25.21 87.40 53.32 50.23
常数 β=5e-2 34.79 24.58 86.55 52.18 49.53
常数 β=1e-1 32.08 24.38 85.81 51.51 48.45

结论:常数 β 始终损害性能(OPD 上限低于 GRPO,过拟合教师);退火初值过大导致过早收敛、过小则信号太弱。

七、图表索引

图表 内容
Figure 1 MATH 训练动态:naive GRPO+OPD 无效,RSTG 更高
Figure 2 RSTG 框架:负零方差提示走 RSTG 分支(置信度加权 OPD + token 掩码 + 教师参考答案 SFT),否则走标准 GRPO
Figure 3 不同数据划分(全量 𝒟 / 学生错 𝒟_sw / 学生错且教师对 𝒟_swtr)上做 OPD 的表现,验证样本选择动机
Figure 4 训练中正/负零方差提示上的 OPD 优势曲线:负零方差优势持续更负
Figure 5 三个模型对在 MATH500 上的训练动态
Figure 6 RSTG vs naive GRPO+OPD 训练期间优势值对比
Figure 7 RSTG vs OPD 响应长度曲线:RSTG 抑制长度骤胀
Figure 8 组件逐步添加时数学基准性能变化
Figure 9/10 Pair ❶ / ❸ 全程训练在数学各基准上的表现
Table 1 三对模型主结果;Table 2 β 策略消融;Table 3 组件消融

八、结论与局限

结论:RSTG 通过三项设计解决 naive GRPO+OPD 的性能退化——(1) 仅在学生未掌握的困难样本(负零方差提示)上施加 OPD 并按教师熟练度加权;(2) 细粒度 token 选择减缓收敛、降低梯度噪声;(3) 辅助 SFT 注入正梯度并提供全局视角。在两个领域、三对模型上均一致优于标准 GRPO 与 naive GRPO+OPD。

局限:仅在数学和代码两个领域验证,未探索 agentic 任务;受算力限制及 OPD 对师生能力差距的要求,实验规模有限,更大规模的有效性留待未来工作。

九、个人点评

  • 问题定位精准:把"GRPO 零梯度"与"OPD 教师封顶"两个已知痛点对齐到同一批样本(负零方差提示)上,"distill where you fail"的样本选择逻辑简洁且有数据支撑(3.63% 数据超过全量蒸馏)。
  • SFT 的统一 RL 视角(SFT ≡ 全 token 正优势)为"RL+SFT 混合训练"提供了干净的理论解释,这一视角本身有迁移价值。
  • 工程上友好:SFT 数据离线预生成、额外开销仅约 12 小时/550 步,易于复现落地。
  • 隐忧:方法依赖一个足够强且与学生有合适能力差的教师(Pair ❷ 收益明显变弱),ω_i 需要教师额外 rollout 估计 mean@8;top-k% 的 k 值与 β 退火计划是新的调参面。