当 LLM 化身"教练":经验学习如何把标量奖励按在地上摩擦
论文:LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks 链接:https://arxiv.org/abs/2607.18110 作者:Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei 机构:Microsoft Research(清华、北大实习生参与) arXiv: 2607.18110 · 提交时间 2026/07/20
核心摘要
你有没有遇到过这种场景:让 LLM 写一段摩洛哥旅游指南,结果上来就是"Morocco is an amazing country with amazing food and amazing culture","amazing" 三连击外加"saffron and cumin"这种凑字数的香辛料大杂烩。这种 "啥都沾点但啥都没说"的毛病,本质上就是 LLM 在最大似然下的求稳策略——它学会了所有"通用好话",但就是没学会针对具体问题给出有质感的具体内容。
要治这个病,标准思路是 RLHF/RL:用 LLM-as-a-Judge 打个 7 分或 8 分,然后用 GRPO 把分数往高了推。但作者团队(MSR,Li Dong、Furu Wei 那帮老熟人)发现一个问题:1-10 分这个标量信号最多承载 3.3 bit 信息量,根本没法把"哪句写得好、哪句是空话"这种细颗粒度的反馈传过来。 7 分的 response 和 8 分的 response,在训练时被压缩成两个标量,但它们之间的真实差异——比如"用具体场景替代笼统形容词"——可能价值连城,却被丢进了垃圾桶。
这篇论文给的解法是 Experiential Learning (EL):把 Judge 升级为 Coach,让它对每个 on-policy response 写一段"经验知识"(experiential knowledge)——不是对这一条 response 的具体批改,而是"以后遇到类似题,怎么写会更好"的可迁移指导。然后通过 on-policy context distillation,把这段上下文指导的 teacher 分布内化到 policy 参数里。
效果上,在 WildChat、AlpacaEval、WildBench 等 5 个开放任务上,EL 一致跑赢 Rubric-as-Reward + GRPO 这个强 baseline,最猛的提升是 OLMo-3-7B 上 AlpacaEval 涨了 4.9 个点(45.9 → 50.8)。更有意思的是 EL 在训练集上反而涨得比 RL 少(+1.3 vs +1.7),但测试集和 OOD 基准上大幅领先——这恰恰是缓解 reward hacking 的标志性症状。
我的判断:这不是又一篇"prompt engineering + DPO 变体"的工程小改,而是把"反馈形式本身就是学习瓶颈"这个根本问题摆到台面上来解的方法论。属于底层范式革新那一类。如果你正在做非可验证任务的对齐/微调,强烈建议至少通读一遍方法部分。
论文信息
- 机构:Microsoft Research(lead),清华大学(Ye Tianzhu、Chen Guanheng),北京大学(Zhu He)
- 系列:本文是 Experiential Learning 系列的 Part III(Part I: On-Policy Context Distillation,Part II: Online Experiential Learning),同一团队 2025-2026 年间连续三篇
- 代码:aka.ms/el-code
- 数据/模型:WildChat-IF(7500 条真实用户 query),Qwen3-8B / OLMo-3-7B-Instruct 两种 policy,GPT-4o 或 policy 自身做 feedback
痛点:标量奖励是个"信息沙漠"
先把这个事讲清楚。我们现在训练 LLM 应对开放任务(写作、对话、推荐、解释……),没有 ground truth,所以一般这么干:
- 用 GPT-4o 之类的强模型,给每个 prompt 生成一组 rubrics(多维度的评分标准)
- 让 LLM-as-a-Judge 拿着 rubrics 去评 response,打 1-10 分
- 用 GRPO / PPO 等 RL 算法,把分数往高了推
这个 pipeline 的问题,不在于 rubric 写得不好,也不在于 Judge 打分不准确——问题出在优化器只能看到一个数字。Judge 可能写了 200 字详细分析:"开头太套路化、中段举例不具体、结尾用词重复",但 GRPO 只看最后那个 7。
作者把这个现象叫做反馈带宽瓶颈,并给了一个很直观的计算:
| 反馈形式 | 最大带宽 | 直观解释 |
|---|---|---|
| 1-10 离散打分 | \(\log_2(10) \approx 3.3\) bits | 一共就 10 个数,撑死 3.3 bit |
| bf16 标量 reward head | 16 bits | 比 1-10 多,但实际只用一小段范围 |
| 1024 token 文本上下文 | \(1024 \times \log_2(150000) \approx 17,600\) bits | 约是 1-10 打分的 5000 倍 |
这 5000 倍不是花架子。在 converged regime 里,所有拿到满分的 response 都被压成同一个梯度信号——RL 没办法告诉你"这个满分 response 比那个满分 response 更好",因为你只能看到奖励峰值,看不到峰的形状。

图 1:RL 和 EL 的反馈通道对比。同样一组 rubrics、同样一段 policy response,RL 只看到 "7";Coach 不仅指出"amazing country/food/culture"是空话,还给出一段"用具体场景替代笼统形容词、把抽象论断落到感官细节"的可迁移建议。3.3 bit vs 17,600 bit,5000 倍带宽差不是营销话术,是直接列出来的。
更阴险的是,这个瓶颈会训练时放大成 reward hacking。RL 拿着稀薄的标量信号梯度,会让 policy 漂向"专门刷分"的模式。比如 "I hope this helps!"、"Here are some key points:" 这种客套话和模板开头,Judge 不会专门扣分,但反复出现会让平均分微微上扬。policy 就被训练成"加分匠",而不是"解决问题的人"。
这事儿我自己的项目里碰到过——早期做对话质量对齐时,policy 学会了在每个回答结尾加一段总结,reward 涨了 2 个点,但人工评估说"信息密度反而变低了"。这就是典型的 reward hacking,标量信号的锅。
方法:从 Judge 到 Coach
EL 的核心思路一句话:既然 Judge 已经写出了 200 字的分析,那我们就直接用这 200 字,不要压缩成 1 个数字。
具体拆开看,pipeline 长这样:
2.1 RL baseline:Rubric-as-Reward + GRPO
标准的标量信号 RL: - prompt \(x\) 喂给 policy \(\pi_\theta\),生成 response \(y\) - 反馈模型 \(M\)(LLM-as-a-Judge)拿着 rubrics \(\mathcal{R}_x\) 评 1-10 分 - 只把分数 \(r = \text{Extract\_Reward}(M(x, y, \mathcal{R}_x))\) 喂给 GRPO - 最大化 \(\mathbb{E}[r]\)
2.2 EL:把 Judge 变成 Coach
EL 复用了完全同一个反馈模型 \(M\) 和完全同一组 rubrics \(\mathcal{R}_x\),只是改了 prompt 里的角色设定: - Judge 角色:输出最终分数 - Coach 角色:把对 \(y\) 的评估蒸馏成一段 experiential knowledge \(e\)——可迁移的指导("以后遇到类似题,应该……")
然后 EL 用 on-policy context distillation (OPCD) 把这段指导内化进 policy:
- Teacher \(\pi_{\text{teacher}}(\cdot \mid e, x)\):把经验 \(e\) 拼在 prompt 前面的 teacher 分布
- Student \(\pi_\theta(\cdot \mid x)\):当前 policy
- Loss:token-level reverse KL 散度,把 student 拉向加了经验上下文的 teacher
注意几个关键设计:
- 不是把 \(e\) 拼到 student 输入——那样 inference 时还得带 Coach,cost 不行。EL 是把 \(e\) 通过蒸馏烧进参数。训练完后,policy 不再需要 Coach,也不需要 \(e\)。
- Teacher 可以是 frozen 的初始 policy,也可以迭代更新(每个 epoch 末尾的 policy 当下一轮的 teacher)。后者涨分更猛,但有 catastrophic forgetting 的副作用,需要掺 Tulu3 这种通用 prompt 来稳。
- 完全没有 scalar reward。policy 的梯度信号全部来自 \(e\) 引发的 teacher 分布变化,天然避开 reward hacking。

图 2:RL 和 EL 的 pipeline 对比。RL 那一路:policy → response → Judge → scalar reward → 优化 \(\max \mathbb{E}[r]\)。EL 那一路:policy → response → Coach → experiential knowledge \(e\) → context-conditioned teacher → 最小化 reverse KL。输入的 prompt \(x\)、用的 feedback 模型 \(M\)、rubrics \(\mathcal{R}_x\) 都一模一样,区别只在优化目标。
2.3 Judge vs Coach:一张表讲清楚
| 维度 | LLM-as-a-Judge | LLM-as-a-Coach(本文) |
|---|---|---|
| 角色 | 评估:衡量 response 质量 | 指导:提炼可迁移的改进建议 |
| 学习信号 | 序列级标量分数 | 经验知识文本 |
| 反馈带宽 | 低(3.3-16 bits) | 高(~17,600 bits per 1024 tokens) |
| 风险 | 标量瓶颈 + reward hacking | Coach 自己可能提炼错(需要 prompt 工程约束) |
一个重要的澄清(作者反复强调的):Judge 和 Coach 用的不是两个不同模型。是同一个 LLM \(M\),只是 prompt 里的指令不同。"LLM-as-a-Judge produces detailed textual analysis but standard RL retains only its final score"——这不是 \(M\) 能力的问题,是 RL pipeline 主动丢弃了那些文字。
实验:8 个数据点,2 个模型家族,5 个评测集
3.1 设置(细节拉满)
- 训练数据:WildChat-IF(7500 条真实 user query),每个 prompt 用 GPT-4o 预生成一组 rubrics
- Policy 模型:Qwen3-8B(non-thinking mode)、OLMo-3-7B-Instruct
- Feedback 模型:初始 frozen policy 或 GPT-4o
- Baseline:Rubric-as-Reward + GRPO(1-10 离散分)
- 训练超参:batch 256,每 prompt 采样 8 个 response,LR 1e-6,max response 4096 tokens,3 epochs,每 10 step checkpoint
- 评测:WildChat 250 条 held-out + 4 个 OOD 基准(AlpacaEval v2.0、WildBench、ArenaHard v2.0、CreativeWritingV3),统一用 GPT-4o 做 rubric-conditioned judge
3.2 主结果(Table 2)
| Policy + Feedback | Method | WildChat | AlpacaEval v2 | WildBench | ArenaHard v2 | CW-v3 |
|---|---|---|---|---|---|---|
| Qwen3-8B + Qwen3-8B | Base | 78.1 | 34.5 | 17.6 | 29.1 | 73.8 |
| RL | 79.2 | 37.3 | 18.4 | 30.5 | 74.3 | |
| EL | 80.0 | 40.0 | 21.8 | 31.0 | 76.0 | |
| Qwen3-8B + GPT-4o | RL | 80.4 | 38.2 | 19.2 | 31.2 | 74.4 |
| EL | 80.7 | 37.4 | 22.0 | 31.9 | 75.3 | |
| OLMo-3-7B + OLMo-3-7B | Base | 75.7 | 43.6 | 39.0 | 21.8 | 78.7 |
| RL | 76.0 | 45.9 | 42.1 | 23.3 | 78.8 | |
| EL | 77.1 | 50.8 | 47.5 | 26.2 | 78.8 | |
| OLMo-3-7B + GPT-4o | RL | 76.8 | 44.7 | 40.3 | 22.5 | 77.8 |
| EL | 78.2 | 48.5 | 46.2 | 25.1 | 78.0 |
几个关键观察:
- EL 在几乎所有格子里都跑赢 RL,只有 1 格(Qwen3-8B+GPT-4o 的 AlpacaEval 37.4 vs 38.2)输了一丢丢。
- OLMo-3-7B 的提升比 Qwen3-8B 更猛——AlpacaEval 涨 4.9 个点(45.9 → 50.8),WildBench 涨 5.4 个点(42.1 → 47.5),ArenaHard 涨 2.9 个点(23.3 → 26.2)。原因可能是 OLMo-3-7B 的 base 相对弱一些,反馈带宽增加带来的收益更大。
- 不管 feedback 是 self(policy 自己)还是 GPT-4o,EL 都跑赢 RL。说明 EL 的优势不来自 feedback 模型更强,而来自"用了更宽的信号通道"。
3.3 EL 泛化性更好(Figure 3)—— 这才是最有意思的地方

图 3:相对 base model 的分数提升。训练集 WildChat Train 上 RL(+1.7)反而比 EL(+1.3)涨得多——这是 RL 的强项,专门刷训练分布。但到了 WildChat Test,EL 反超(+2.0 vs +1.1)。OOD 基准 AlpacaEval(+2.8 → +5.5)和 WildBench(+0.8 → +4.2)上 EL 拉开更大差距。
这就是 reward hacking 的典型特征——在训练集上刷分刷得很欢,换个稍微不同的 prompt 就不行了。EL 在训练集上"克制"地涨分(policy 不会被同一个 scalar reward 反复往某个套路推),但因为学习的是可迁移的指导,测试集和 OOD 上反而涨得更猛。
作者对原因的解读是:RL 拿到的 scalar signal 信息量有限,policy 会"漂向刷分模式";EL 的信号是完整的 distributional shift(teacher 整个分布都被 \(e\) 改变了),policy 学到的是"在什么情境下应该用什么样的语言",这种知识更容易跨任务迁移。
说实话,这个泛化差距比我预想的大。 5.5 vs 2.8、4.2 vs 0.8,接近翻倍。如果有人在做需要"泛化到分布外"的指令微调,EL 这个性质是个大杀器。
3.4 消融:Context 形式很重要(Table 4)
作者还问了一个好问题:必须用 "experiential knowledge" 这种抽象指导吗?能不能直接用 raw critique(Judge 的全文分析)或者 rubrics 本身?
| 配置 | WildChat Score | IFEval OOD Acc. |
|---|---|---|
| Base Model | 64.8 | 68.0 |
| RL | 67.7 | 67.6 |
| Full Critique(直接用 Judge 全文) | 67.9 | 64.6 |
| Rubrics Only(只用评分标准) | 68.1 | 65.6 |
| Multiple-Choice(选 10 个预定义指令之一) | 66.3 | 68.5 |
| Default EL(提炼可迁移知识) | 68.6 | 68.8 |
几个值得划重点的发现:
- Default EL 在两个指标上都最强。说明 "提炼" 这个动作本身有价值——raw critique 太啰嗦、rubrics 太抽象、multiple-choice 又把带宽压回 3.3 bit。experiential knowledge 在抽象程度和信息量之间找到了甜点。
- Full Critique 和 Rubrics Only 都让 IFEval 掉分。作者的解读很到位:critique-style 上下文会让 teacher 偏向 "critiquing distribution"(评头论足)而不是 "task-solving distribution"(解决问题),policy 模仿了这种偏移,OOD 能力掉了。
- Multiple-Choice 在 OOD 上反而涨。因为它的反馈带宽只有 3.3 bit,policy 没有被 critic 化,但带的信息又太少,所以 WildChat 上提升有限(+1.5 vs EL +3.8)。这是个反直觉但很有意义的 trade-off。
- 作者还试了 "把 raw critique 加上原始 response 一起塞 context",几步就训崩了。说明 critique 和 response 之间的 distribution mismatch 是致命的,必须提炼成 transferable 形式。
3.5 控制性分析:scalar reward 在多模态目标上有结构性缺陷(Figure 4)

图 4:构造的 200 类 toy 实验。左图:目标分布是二值的(可验证任务),RL 和 EL 都能拟合。右图:目标分布是 bimodal Gaussian mixture(5 个 reward level),EL 复原了光滑的双峰形状,RL 收敛成"楼梯形"——peak 上每个拿到最大 reward 的 token 都被压成同一个概率。
这个分析是整个论文最有理论深度的部分。作者构造了一个极简的 categorical policy 实验,目标是让 policy 拟合某个先验分布 \(p^*\):
- Verifiable setting(\(p^*\) 是二值的):1 bit 足够,scalar reward 不丢信息,RL 和 distributional matching 都能完美拟合
- Non-verifiable setting(\(p^*\) 是 bimodal,被量化成 5 个 reward level):EL 的 reverse KL 直接对 \(p^*\),完美恢复双峰;RL 因为同一 level 的 token 都拿到同一个奖励,peak plateau 上所有 token 都被压成同一个概率,形成"楼梯"
这个 staircase 现象是 scalar reward 不可避免的 structural limitation——只要你的目标分布是连续的而奖励是离散的,就一定会出现 plateau 内信息丢失。
等等,这里得批判性看。作者在文中也明说了:"This construction isolates the representation of feedback: it is not intended as a faithful simulation of the full RL and EL training pipelines, nor as a proof of a fundamental limitation shared by all scalar-reward methods."——也就是 Figure 4 只是给个直觉,不是严格证明所有 scalar RL 都有这个毛病。真实的 RL 还可以加 entropy bonus、reward shaping、PPO clip 等等技巧缓解 plateau 问题。所以别把 Figure 4 当成 "RL 永远不行" 的证据,它只是 EL 的 motivation。
相关工作定位:放在上下文里看
这部分不能省,不然你不知道 EL 跟现在一票蒸馏/scalar RL 方法到底什么关系。
vs Rubric-as-Reward(Gunjal et al., 2025)
这就是本文的 baseline,思路和 EL 一样:rubric-driven feedback。区别只在最后是把 rubric 评估压成 1-10 分(Rubric-as-Reward)还是提炼成知识(EL)。EL 是 Rubric-as-Reward 的自然升级,但代价是 feedback 端多一次 LLM forward(生成 knowledge 比 extract score 慢一点)。
vs On-Policy Distillation (OPD, Thinking Machines Lab, 2025)
OPD 的 teacher 通常是更强的模型(比如把 70B 的分布蒸馏到 8B),它没有 coach 这一步,feedback 来自 teacher 自身参数化的知识。EL 的 student 和 teacher 经常是同一个模型(迭代教师配置),knowledge 来自外部 Coach 的文本输出。所以 OPD 的带宽是 \(O(N)\)(response 长度的 per-token distribution),EL 的带宽是 \(O(L)\)(context 长度)。两者信息源不同:OPD 抽 teacher 的 parametric knowledge,EL 抽 Coach 的 textual assessment。
vs Context Distillation(Askell et al., 2021)
最早的 context distillation 想的是 "in-context 信息能不能烧进参数"。EL 是它的 on-policy 升级版(用 OPCD 而不是离线 distillation),并把 context 从 "随便什么提示" 限定到 "Coach 提炼的可迁移知识"。
vs Self-Distillation(Hubotter et al., 2026)
最近比较火的"RL via self-distillation"——teacher 和 student 是同一个模型,context 里塞 ground truth 或者环境反馈。EL 的特别之处在于 context 是 rubric-grounded 的语言反馈,不是特权信息。
vs Critique-conditioned RL(Huang et al., 2026)
之前有工作把 critique 塞进 RL 优化的 context 里,但仍然是 off-policy 的,且最终瓶颈还是 scalar reward。EL 是 on-policy 的 distribution matching,根本不走 scalar reward 这条路。
这一系列工作的演化脉络大概是:标量 RL → 加 critique 改 off-policy → on-policy distillation → on-policy context distillation with rubric-grounded textual feedback (EL)。EL 站在这条线最末端,每一步都在解决前一步的某个瓶颈。
我的判断
亮点
- 把"反馈形式本身就是瓶颈"这个洞察摆到台面上。之前大家讨论 reward hacking、discuss-skill tradeoff 都在 reward shape 上做文章(reward shaping、process reward、dense reward),但很少有人问"reward 这个形式本身是不是有问题"。EL 直接说:别要 reward 了,把背后的文字吃下来。
- 极简的工程改动。整个方法不需要换主训练框架(还是 on-policy sampling + KL 散度),只是把 reward extract 换成 knowledge extract,context 加到 teacher 输入。代码上能很快复现。
- 泛化性的反超很有说服力。训练集 +1.3 / 测试集 +2.0 / OOD +4-5 这种 pattern 才是真正的卖点——不是 "在 WildChat 上多 1 分",而是 "OOD 几乎翻倍"。
局限和可疑点
- Coach prompt 的依赖。整个方法的核心假设是 "Coach 能从 rubric-based assessment 提炼出可迁移知识"。这个能力有多稳?作者没给 Coach 自己的评估,只是看下游 student 的提升。如果 Coach 提炼的是错的("以后都用华丽的形容词"),policy 反而会学坏。这是个 failure mode,但没看到专门的分析。
- Feedback 模型的偏差问题没有解。作者承认 EL 解决的是"feedback 到 policy 的带宽瓶颈",不解决 feedback 模型本身有偏的问题。如果 Coach 给的指导系统性偏差(倾向于某种风格),EL 会比 RL 更快地把这个偏差内化进参数。这是一个 transfer 到生产环境必须警惕的风险。
- 成本并没有真的省。EL 在每次 step 多了 "Coach 生成 knowledge + 上下文 teacher forward"。作者说 "method-specific updates 是 small relative to shared rollout cost",但Coach 生成知识本身是个不便宜的 LLM call。我估计 EL 的总成本比 RL 高 20-30%,但作者没给具体数字。
- 5000×带宽优势是个"上界"。作者也明说了 "This comparison is a feedback-bandwidth intuition rather than a measure of usable supervision."——实际 usable 信息远小于理论上限,自然语言冗余度很高。不要被 5000× 这个数字晃到。
- 泛化性实验只有一个图表。Figure 3 只展示了 Qwen3-8B + self-feedback 的情况,作者说 "GPT-4o 做 feedback 也有类似现象",但没有 Figure 5 那种详细对比。我更想看到 GPT-4o feedback 下 WildChat Train/Test 的具体数字。
适合谁
- 做非可验证任务对齐/微调:直接拿来用,比 GRPO/RLOO 强
- 做 reward hacking 严重的 RL 微调:EL 的 "训练集涨分慢、测试集涨分快" 性质可能正是你需要的
- 做 agentic 任务(tool use、长程):open-ended 的成分很高,rubric 难写但能写,EL 可能比 scalar RL 合适
- 做 reasoning(数学/代码):不建议——这些任务有 verifiable reward,RL 的 1 bit reward 足够,EL 的高带宽优势发挥不出来。Figure 4 左图也说明了这事。
工业部署的现实问题
如果我想把这套用到生产 pipeline,会问几个问题:
- Coach 模型的延迟。每次 rollout 都要等 Coach 生成一段 knowledge,整体 step time 会涨。如果用 GPT-4o 做 Coach,光是 API 延迟就够喝一壶。
- Knowledge 的版本管理。如果 Coach 升级(GPT-4o → GPT-5),生成的 knowledge 风格变了,policy 要不要从头训?
- Rubric 的质量。rubric 是用 GPT-4o 离线生成的,不会随着 policy 进化。这个 mismatch 在长程训练里会放大。
- 多任务/多风格的冲突。一个 Coach 可能对 "幽默" 和 "严肃" 给出相反的指导,policy 怎么 fold?多 coach ensemble 是不是必要?
这些问题论文里都没答,实战前必须自己测一遍。
收尾
回到开头那个摩洛哥旅游指南的例子。RL 训练下,policy 可能学会 "Morocco is an amazing country with amazing culture" 这种套路化表达(每多一个 amazing,Judge 大概率不会扣分)。EL 训练下,Coach 看到这种表达会直接生成:
"Use varied and specific descriptors rather than repeating general superlatives. When multiple sentences rely on the same adjective, the passage becomes vague. Ground abstract claims in concrete sensory details or personal anecdotes that the reader can visualize."
这段指导通过 reverse KL 蒸馏进 policy 参数,下次遇到旅游/景点类 prompt,policy 就自发地避开套路词,往具体场景和感官细节走。这才是 5000× 带宽差该有的效果——不是嘴皮子上的数字,是生成质量上肉眼可见的差异。
如果你在做的事涉及 "open-ended 任务 + rubric-based feedback",我建议你先拿 8B 量级的 Qwen3 把 EL 跑一遍 baseline。哪怕只换 100 步 training step,你都能感觉到 scalar reward 给不了的"细颗粒度对齐"是什么体验。这是 2026 年到现在为止,对"非可验证任务怎么对齐"这个问题给的最值得一试的答案。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。