用"教师减基座"的差值信号蒸馏多语言数学推理:OPD² 在韩日语上比英语还猛
你有没有遇到过这种情况:一个模型英文数学题做得风生水起,换成韩文或日文题目,分数直接掉十几分?多语言推理的"语言鸿沟"一直是个让人头疼的问题。之前大家主要用 RL 做后训练,最近 On-Policy Distillation(OPD)作为 RL 的替代方案火了起来,但几乎所有 OPD 研究都只在英文上验证过。NAVER AI Lab 这篇新论文(arXiv:2608.05802)把 OPD 及其升级版 OPD² 拉到了英语、韩语、日语三语数学推理场景下做了系统评测,结论挺有意思——OPD² 在韩语和日语上的收益甚至比英语还大,而且只喂英文数据也能"顺带"提升韩日语成绩,但代价是模型开始用英文回答韩文题。
核心摘要:这篇论文把 On-Policy Delta Distillation(OPD²)扩展到多语言数学推理。OPD² 的核心思路很巧妙:不用"教师 logits 减学生 logits"做蒸馏信号,而是用"教师 logits 减教师自己的基座模型 logits"——也就是把后训练获得的推理能力从通用偏好里剥离出来。在 Qwen3-1.7B/8B 上,OPD² 全面超过原版 OPD,韩日语提升尤其猛(1.7B 日语从 37.2 涨到 52.0)。更反直觉的发现是:纯英文 OPD² 也能把韩日语 benchmark 刷上去,但目标语言回复率从 90%+ 暴跌到 30-48%——分数涨了,模型却在用英文答题。论文不长、实验不算大,但把"推理能力迁移"和"目标语言保持"这两件事拆开了,这个观察对做多语言模型的团队很值钱。
📖 论文信息
- 标题:On-Policy Delta Distillation for Multilingual Math Reasoning
- 作者:Byeongho Heo、Jaehui Hwang、Sangdoo Yun、Dongyoon Han
- 机构:NAVER AI Lab
- 链接:https://arxiv.org/abs/2608.05802 (arXiv:2608.05802v1,2026-08-06)
- 代码:https://github.com/naver-ai/opd2
🎯 问题动机:OPD 很火,但没人验证过多语言
先快速对齐一下背景。LLM 后训练主流是 RL(比如 GRPO),但 RL 是序列级监督——一整段回答只给一个分数,信号稀疏。On-Policy Distillation(OPD)换了个思路:学生模型自己 rollout 生成回答,然后把这条轨迹喂给教师模型,拿教师在每个 token 上的概率当反馈。这样监督信号从"一句话一个分"变成了"每个 token 一个分",数据和算力效率都更高。
OPD² 是这个团队之前的升级版(arXiv:2607.15161),改动就一处,但很关键。原版 OPD 的 token 级 reward 是:
也就是教师概率减学生概率。OPD² 把第二项的学生 \(\pi_\theta\) 换成了教师的基座模型 \(\pi^*_{\text{base}}\):
这个 delta 信号的直觉是:教师相对它自己基座的概率差,恰好刻画了"后训练到底学到了什么"——主要是推理能力,而把基座里已有的通用偏好和文风滤掉了。说实话我第一次看到这个改动的时候觉得也太简单了,但他们之前在英文数学/科学/代码任务上确实验证了有效性。
问题来了:之前所有 OPD 工作都在英文 benchmark 上打转。有一篇把工作扩展到非洲语言(Liu et al., 2026),但那是自蒸馏(学生教师是同一个模型),不是强教师蒸馏;东亚语言(韩语、日语)完全没人碰。NAVER 做韩日语有天然动机,这篇就是来填这个空白的。
论文围绕三个问题展开:OPD² 在多语言下还能打过原版 OPD 吗?OPD² 后训练能缩小语言间差距吗?只用英文数据训练,会发生什么?
🧪 实验设置
- 训练数据:100K 多语言数学题,英:韩:日 = 1:1:1,语言间题目不重叠。韩日题来自 Nemotron-SFT-Multilingual-v2,英文题来自 Nemotron-Math-v2。另外单独构建了 100K 纯英文集做对照。因为 OPD 不需要参考答案或推理轨迹,只保留题目字段——这一点工程上很友好。
- 模型:学生是 Qwen3-1.7B 和 Qwen3-8B,教师是 Qwen3-30B-A3B-2507。thinking 和 non-thinking 两种模式都测。
- 评测:PolyMath、Global-MGSM(英/韩/日三语)、HRM8K(英/韩,含 GSM8K、MATH、Omni、KSM、M-MMLU 五个子集)、MAWPS(日语)。
- 训练:统一 100 个优化步,多语言和纯英文设置超参一致,用官方 OPD² 实现。
📊 主实验:OPD² 在韩日语上收益反超英语

图1:PolyMath + Global-MGSM 平均分(non-thinking 模式),左 Qwen3-1.7B、右 Qwen3-8B。浅灰是基座,中蓝是 OPD,深蓝是 OPD²。注意韩日语上深蓝柱子相对中蓝的领先幅度明显大于英语。
看图1的数字。Qwen3-1.7B 上,OPD² 把基座平均分从 55.1 拉到 63.6(英语)、40.9 到 51.9(韩语)、37.2 到 52.0(日语)。Qwen3-8B 上对应是 62.8→70.5、57.0→64.4、57.1→65.0。日语 1.7B 涨了 14.8 个点,这个幅度相当能打。
更有意思的是 OPD² 相对 OPD 的增量。1.7B 上,OPD² 比 OPD 在韩语高 3.1 个点、日语高 4.0 个点,而英语只高 2.1 个点;8B 上韩语 3.3、日语 3.1,英语只有 0.7。也就是说 delta 信号的优势在非英语语言上至少不打折,甚至更大。
我的理解是:英文场景下学生和教师的能力差距本来就小一些,"教师减基座"和"教师减学生"差别不大;但在韩日语上,学生模型自己的分布偏得更厉害,用学生 logits 做参照会把噪声引进来,而教师-基座差值是个更干净的"纯推理增量"信号,跨语言迁移时更稳。当然这是我自己的解释,论文没有展开论证,这块我觉得还可以再挖。
🔬 语言鸿沟:OPD² 在 7 个 benchmark 里缩小了 6 个

图2:Qwen3-1.7B thinking 模式下英语与韩语的准确率差(单位:百分点),柱子越矮说明语言鸿沟越小。注意 Global-MGSM 和 GSM8K 基座差距高达 13.4 和 12.1 个点,训练后明显收窄。
基座模型的英韩差距在 Global-MGSM 上高达 13.4 个点、HRM8K-GSM8K 上 12.1 个点——同一个模型,换个语言就掉十几分,这就是多语言推理的残酷现实。
OPD 训练后,PolyMath 差距从 6.4 缩到 4.4,Global-MGSM 从 13.4 缩到 8.6,KSM 从 3.3 缩到 0.4——几乎抹平。但 OPD 不稳定:M-MMLU 上的差距反而从 1.1 扩大到 4.6。
OPD² 更一致:PolyMath 5.0、Global-MGSM 9.3、GSM8K 从 12.1 缩到 9.2,MATH、Omni、KSM 都在缩,M-MMLU 维持 1.1 不变。七个 benchmark 缩了六个、一个持平,没有恶化的。关键是这不是靠牺牲英文换来的——英文分数也在涨,只是韩文涨得更猛,差距自然收窄。
⚠️ 最反直觉的发现:纯英文训练也能刷韩日语榜,但模型在用英文答题

图3:Qwen3-1.7B 上纯英文 OPD²(中蓝)与多语言 OPD²(深蓝)对比,左 thinking、右 non-thinking。non-thinking 模式下两者韩日语分数几乎打平,但这只是表象——见表1的语言回复率。
看到这个图我愣了一下:只用 100K 英文题训练,韩日语成绩居然也涨了。non-thinking 模式下,纯英文 OPD² 把韩语从 40.9 提到 52.6、日语从 37.2 提到 53.4,和多语言训练的 51.9/52.0 基本打平甚至略高。thinking 模式下多语言训练略占优(59.2/59.1 vs 57.6/57.5),但纯英文也远超基座。
这说明推理能力的跨语言迁移是真实存在的——英文蒸馏信号学到的东西能泛化到没见过韩日题的学生身上。
但论文没有停在这里,而是多问了一句:分数涨了,模型是用什么语言答的? 他们统计了目标语言回复率(输出语言与题目语言一致的比例),结果很扎心:
| 训练数据 | 模式 | 指标 | OPD 韩语 | OPD 日语 | OPD² 韩语 | OPD² 日语 |
|---|---|---|---|---|---|---|
| 纯英文 | thinking | 目标语言回复率 | 83.1% | 36.9% | 36.1% | 30.8% |
| 多语言 | thinking | 目标语言回复率 | 72.9% | 70.1% | 97.6% | 95.2% |
| 纯英文 | non-thinking | 目标语言回复率 | 83.6% | 40.5% | 48.3% | 29.6% |
| 多语言 | non-thinking | 目标语言回复率 | 99.7% | 99.8% | 90.5% | 90.9% |
纯英文 OPD² 训练后,韩语回复率从 97.6%(多语言)跌到 36.1%,日语从 95.2% 跌到 30.8%。也就是说纯英文训练刷出来的韩日语高分,一大半是模型用英文思考、英文作答换来的。
这个区分我觉得是全文最值钱的地方。benchmark 分数衡量的是"推理能力迁移",回复率衡量的是"目标语言保持"——这是两个独立的维度,纯看分数会被骗。如果你做一个面向韩国用户的产品,模型韩文题答得再对、但全程飙英文,用户体验是崩的。多语言数据保住的不是推理能力,是"用对的语言表达"这件事。
📈 附录完整数据
附录给了三张完整的分语言大表,挑关键的说。
Qwen3-1.7B 多语言训练(HRM8K 全子集,avg 列):
| 模式 | 模型 | 英语 Avg | 韩语 Avg | 日语 Avg |
|---|---|---|---|---|
| Non-thinking | Base | 47.6 | 37.4 | 55.5 |
| Non-thinking | +OPD | 61.7 | 48.7 | 62.9 |
| Non-thinking | +OPD² | 65.7 | 56.5 | 65.4 |
| Thinking | Base | 70.4 | 63.7 | 68.5 |
| Thinking | +OPD | 71.4 | 66.2 | 70.5 |
| Thinking | +OPD² | 73.4 | 68.2 | 71.2 |
Qwen3-8B 多语言训练(avg 列):
| 模式 | 模型 | 英语 Avg | 韩语 Avg | 日语 Avg |
|---|---|---|---|---|
| Non-thinking | Base | 58.7 | 55.4 | 70.2 |
| Non-thinking | +OPD | 74.0 | 67.1 | 73.4 |
| Non-thinking | +OPD² | 75.3 | 72.2 | 75.2 |
| Thinking | Base | 80.9 | 78.0 | 77.7 |
| Thinking | +OPD | 79.9 | 75.7 | 77.6 |
| Thinking | +OPD² | 83.2 | 80.4 | 78.9 |
注意 8B thinking 模式下,原版 OPD 反而把英语从 80.9 拉到 79.9、韩语从 78.0 拉到 75.7——基座已经很强时,OPD 会帮倒忙,而 OPD² 还能继续涨到 83.2/80.4。这个现象在原版 OPD² 论文里也出现过:当学生很强时,"教师减学生"的信号会退化,因为学生的分布已经很接近教师,reward 里混入了学生自身的噪声;而 delta 信号不依赖学生,更可靠。坦白讲,这算是 OPD² 相对 OPD 最实质的一个卖点。
纯英文训练的附录里还有一个值得警惕的数据:1.7B thinking 模式下,纯英文 OPD 把韩语平均分从 63.7 干到 48.5,暴跌 15 个点——纯英文 OPD 在 thinking 模式会严重损害韩语能力,OPD² 勉强守住 65.1。这说明"英文数据能不能迁移"强烈依赖蒸馏目标和生成模式,不是个能一概而论的结论。
💡 我的判断
亮点:
- delta 信号的多语言有效性验证得很扎实,两个模型尺寸、两种生成模式、三种语言,结论一致。OPD² 在韩日语上相对 OPD 的增益(3-4 个点)比英语(0.7-2.1 个点)还大,这个"非英语收益更大"的现象值得后续研究。
- 把"推理迁移"和"语言保持"拆开评估,用回复率揭穿了纯英文训练的分数假象——这个评估视角对多语言社区有方法论意义。
- 工程友好:OPD 不需要标注答案和推理轨迹,只要题目;代码开源。
问题和保留意见:
- 规模偏小。只有 100 个优化步、两个 Qwen3 学生、一个教师,没有更大模型或更多语言(中文、欧洲语言缺席)。结论的普适性还需要更多验证。
- 核心机制没有新东西——OPD² 是他们自己上一篇的方法,这篇定位就是多语言扩展研究,属于扎实的 follow-up,不是方法突破。
- "目标语言回复率"怎么测的论文说得很简略(识别输出文本语言),日语和英语混排时判定的鲁棒性存疑,我自己没完全确认这个指标的测量细节。
- 韩日语 OPD² 增益更大的原因,论文只给了现象没给机制解释。是学生分布在非英语上偏离更多?还是 delta 信号天然抗语言偏移?留了个坑。
对工程的启发:如果你在用一个语言的数据蒸馏/RL 后训练多语言模型,别只看 benchmark 分数——加一个"回复语言一致性"指标,可能你会发现分数涨得漂亮,模型却悄悄叛逃到了英文。如果目标市场是非英语的,多语言数据不是可选项。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我