蒸馏 Claude 给 Qwen 总是翻车?问题出在「风格」上

核心摘要

我们用闭源大模型(Claude、GPT、Gemini)当老师、开源模型(Qwen3-1.7B/4B)当学生做蒸馏训练,想让开源学生学会 agentic search。这事儿有两道坎:一是 token 词汇表对不上、专有模型的 logits 又不可见,传统 KL 对齐在数学上根本定义不了;二是退一步让开源模型模仿老师的自然语言轨迹,结果学生学了一身"老师的说话腔调",检索-推理该干嘛还是不会,风格漂移和幻觉一起来。

这篇论文(arXiv:2607.24280)的解法挺直接:用一个结构化 JSON 协议当中间表示——让专有模型驱动的多智能体系统把"怎么思考、查什么、证据是什么"打包成任务类型、推理计划、抽取式事实、答案校验五个字段,然后把这套协议作为特权信息喂给学生模型的训练分支。这套方案叫 MAPD(Multi-Agent Protocol Distillation),在 7 个 QA benchmark 上比最强 baseline(SDAR)平均多拿 3-5 个点,多跳任务提升尤其猛(最高 7.9%)。

读完的感受:这不是"用闭源老师"的胜利,而是"风格解耦"的胜利。把专有模型特有的语言外壳剥掉,只学它的认知策略——这个想法本身比框架花活儿值钱得多。值得做 agent / 蒸馏方向的人细读。


论文信息

  • 论文标题:From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
  • 作者:Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou
  • arXiv: 2607.24280
  • 代码:https://github.com/AaronLiu0702/MAPD
  • 发布时间:2026 年 7 月 27 日

为什么要从闭源模型蒸馏?这事儿的坑到底在哪

我之前在团队里推 agentic search 训练的时候,第一反应就是"用 GPT-4 蒸馏到 Qwen,肯定比从 Qwen 自己蒸馏强"。这个直觉其实很朴素——闭源模型推理能力强,蒸馏出来的小模型应该能继承。

但实操就翻车了。我观察到的现象和这篇论文在 Introduction 里写的完全一致:

  • 直接对 logits 做 KL 散度?算不了。Qwen 的 token 体系和 Claude 的 token 体系不是一套词汇表,tokenize 出来的东西没法对齐;而且 Claude 根本不给你 logits(API 调用返回的只有文本)。
  • 退一步,让学生模型模仿老师的自然语言轨迹?表面能学,实质在走偏。学生把"好的,让我先想想……"、"从某个角度来说……"这种 Claude 特有的"腔调"学了个十足,轮到真正要拆解问题、检索证据、综合答案的时候,能力并没有真的迁移过来。风格漂移和幻觉一起来。

这两道坎就构成了"闭源老师带不动开源学生"的核心矛盾。Figure 1 把这件事总结得很清楚——

图1:闭源到开源蒸馏的两大瓶颈与 MAPD 的解法

图 1:三种蒸馏路径的对比。红色路线(直接 KL 对齐)被"异构 token 词汇表 + logits 不可见"卡死;橙色路线(自然语言轨迹模仿)诱发风格漂移和幻觉;绿色路线是 MAPD,用结构化协议当桥,把风格问题和事实问题分离。

注意 Figure 1 最右边那张脸的对比:失败、苦脸、苦笑。这就是我们之前调试时看到"训练 loss 在降但准确率没动"时的心情。


怎么解决:让多智能体系统先生成一份"标准答案"

MAPD 的核心思想其实一句话就能讲清:别让学生学老师的"话",让学生学老师的"思路"

那这个"思路"怎么获得?作者设计了一个离线多智能体系统(MAS)来生成"标准答案"——一个结构化的 JSON 协议。这个 MAS 流水线分三步:

第一步:多智能体协作搜索(Stage A)

MAS 里有三个角色:Orchestrator(编排者)、Searcher(搜索者)、Repair(修复者)。

工作流是这样的: 1. Orchestrator 把问题 \(x\) 拆成带依赖关系的子任务,并行分派给多个 Searcher 2. 每个 Searcher 最多发 \(K=3\) 个检索查询,从 wiki-18 语料库拿 top-3 段落,压缩成简短发现 3. Orchestrator 汇总后做精确匹配(EM)检查,通过就过;没通过就调用 Repair agent 4. Repair agent 用 ground-truth 答案诊断——是"表达问题"(证据对了但答案格式没对齐)还是"搜索问题",针对性重做,最多 2 轮

这里有个细节我之前没在别的工作里看到:ground-truth 答案只用作 Repair 的诊断信号,绝不进入探索日志和检索查询。这是为了避免"开卷作弊"——如果学生训练时看到的证据就是答案本身,那蒸馏出来的不叫学生,叫复读机。

第二步:协议生成(Stage B)

Protocolizer agent 把 Stage A 的非结构化探索日志转换成结构化 JSON 协议。两种情况: - 成功轨迹 → 生成 Succeeded Protocol,包含完整验证的答案 - 失败轨迹 → 生成 Evidence Protocol,省掉答案,替换成"已确认 X,但是 Y 缺证据"这种中性表述

协议长这样(5 个字段):

字段 含义
Task Type 任务类型(single_hop / multi_hop / comparison / others),决定整体策略
Reasoning Plan 有序子目标数组,把复杂任务拆成可处理的检索+推理步骤
Grounding Facts 从检索段落里逐字抽取的事实集(必须是字面子串)
Partial Findings 失败轨迹中的中间发现(可选)
Answer Verification 最终答案 + 布尔标志 answer_grounded

第三步:质量门控(Stage C)

协议进训练集之前过四道关:JSON 格式合法、答案 EM 匹配、事实抽取可验证、无 oracle 泄露。作者报告在 3000 个实例上达到了 99.33% 的通过率——挺扎实的。

整个 MAS 流水线只在离线阶段跑一遍。一次性成本:25,600 个实例、25,584 个协议通过、每实例约 6.3 次 LLM 调用、约 12.5K tokens,整份训练集生成一次只要 1454 美元。推理时这个 MAS 完全不参与,零开销。


怎么用这份协议训练学生模型

光生成协议不够,问题是这玩意儿怎么作为监督信号送进学生模型。

这里 MAPD 用了 On-Policy Self-Distillation(OPSD)的框架,但是改了特权信息的来源。

标准的 OPSD 是这样的:让一个学生模型的两个分支共享参数—— - 学生分支:条件于 \(s_t = (x, y_{<t})\) - 教师分支(特权分支):条件于 \(s_t^+ = (x, p, y_{<t})\)

两个分支都从同一当前策略参数采样下一个 token 的分布,然后最小化反向 KL:

\[\mathcal{L}_{\text{OPSD}}^{(t)} = \mathbb{D}_{\text{KL}}\bigl(\pi_{\theta_k}(\cdot \mid s_t) \parallel \pi_{\theta_k}(\cdot \mid s_t^+)\bigr)\]

梯度只通过学生路径回传。这个设计精妙在同源:因为学生和老师都是同一个模型自己,所以 token 词汇表天然对齐了,不再有"Claude 的 token 怎么对应到 Qwen 的 token"这个根本问题。

但标准的 OPSD 里 \(p\) 来自学生自己的成功 rollout,这就把监督质量封顶在学生现有能力上限。MAPD 的关键改造:把 \(p\) 换成 MAS 生成的结构化协议 \(p = f(z)\)

最终的联合目标:

\[\mathcal{L}(\theta) = \lambda_{\text{OPSD}} \cdot \mathcal{L}_{\text{OPSD}}(\theta) + \mathcal{L}_{\text{GRPO}}(\theta)\]
  • \(\mathcal{L}_{\text{OPSD}}\):从结构化协议来的 dense token 级信号,负责逐步信用分配
  • \(\mathcal{L}_{\text{GRPO}}\):从最终 EM 来的 sparse RL 信号,负责对结果负责
  • \(\lambda_{\text{OPSD}}\):控制蒸馏压力的超参

图2:MAPD 框架总览

图 2:MAPD 框架。左边蓝色框是 Stage A 多智能体协作搜索(带 Repair 机制),中间橙色框是 Stage B 协议生成 + Stage C 质量门控,右边绿色框是联合训练阶段(OPSD 蒸馏信号 + GRPO RL 信号)。重点:协议在训练前一次性预合成,推理时学生模型只需要原始输入。

Figure 2 让我觉得作者讲故事能力挺强——他们没有把协议生成和训练混着画,而是先离线(左边和中间),再在线(右边),用颜色一区隔,训练时协议怎么进入特权分支的路径就一目了然了。


实验数据说话

主实验:7 个 QA benchmark、3 个教师、2 个学生规模

训练数据只用 NQ + HotpotQA 的训练集。评估用 7 个 benchmark——NQ、TriviaQA、PopQA(单跳)和 HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle(多跳)。其中 5 个完全没在训练里出现(分布外测试),2 个共享的确保无问题级别重叠。

学生用 Qwen3-1.7B 和 Qwen3-4B,从预训练 checkpoint 初始化。教师默认是 Claude-Opus-4.6,对比还跑了 GPT-5.5 和 Gemini-3.1-Pro。超参:8 卡 GPU,batch size 128,每 prompt 8 rollout,学习率 1e-6,200 步,max prompt 长度 4096,max response 长度 512。

先看 1.7B 的主结果(Table 1 完整版):

Method NQ TriviaQA PopQA HotpotQA 2Wiki MuSiQue Bamboogle Avg.
Vanilla 29.9 46.4 39.1 23.9 18.8 4.9 16.8 25.7
OPSD 4.2 8.3 4.6 6.6 15.3 0.7 1.6 5.9
GRPO 36.9 54.6 43.1 29.8 27.5 6.8 22.4 31.6
GRPO+OPSD 37.0 54.6 41.4 29.9 23.3 6.5 20.8 30.5
SDAR 43.4 58.1 47.6 37.0 34.3 10.6 32.0 37.6
MAPD 45.1 58.6 48.6 39.0 36.2 11.2 36.8 39.4
相对 SDAR 增益 +3.9% +0.9% +2.1% +5.4% +5.5% +5.7% +15.0% +4.8%

Qwen3-4B 上同样稳定——MAPD 拿到 44.4% 平均分,比 SDAR 的 43.0% 多 3.3%。

几个数据点必须拎出来说:

1) 纯 OPSD 灾难性崩溃。 在 agentic 训练配置下,纯 OPSD 把 Qwen3-1.7B 从 25.7% 砸到 5.9%,4B 也从 28.8% 跌到 20.9%。作者诊断说长度截断比例从 5% 飙升到 74%——纯 self-distillation 在长轨迹上根本撑不住,它需要一个质量高于学生自身的特权信息源。这点对所有想做自蒸馏的人是警示:没有外部 PI 的自蒸馏,把学生自己的高分答案当老师,效果反而比纯 RL 还差

2) 多跳任务提升远超单跳。 1.7B 在多跳平均 7.9% 增益,单跳只有 2.3%。Bamboogle 上更夸张——比 SDAR 多拿 15.0%。这其实非常符合直觉:多跳任务正好是 MAS 协作分解和证据聚合的拿手好戏,单跳任务主要靠记忆,闭源老师的优势没那么明显。

3) 增益的稳定性。 看 Table 1,MAPD 在所有 7 个 benchmark 上全部超过 SDAR,没有任何一个子任务掉队。这种全点位领先在我看来比"平均涨 5 个点"更有说服力。

消融实验:三个组件各自值多少

Table 2 把 MAPD 的三个关键组件拆开看——PM(专有模型)、SP(结构化协议)、MAS(多智能体系统):

变体 PM SP MAS 1.7B Avg. 4B Avg.
GRPO+OPSD 30.5 38.3
SDAR 37.6 43.0
Raw trajectory (single PM) 30.1 37.3
Raw trajectory (MAS) 29.2 36.1
Protocol (single PM) 37.1 42.9
MAPD 39.4 44.4

这个消融能看出几个事:

  • 结构化协议是跨模型蒸馏的命脉:拿原始自然语言轨迹当 PI(变体 3、4)比不用闭源老师(GRPO+OPSD)还差。换成结构化协议(变体 5)就直接拉回到 SDAR 同一水平,1.7B 涨 7 个点、4B 涨 5.6 个点。
  • MAS 不能替代结构化协议:变体 4(带 MAS 但不带 SP)甚至略差于变体 3(不带 MAS 也不带 SP),因为 MAS 让轨迹变长变丰富,但同时也更嘈杂,反而加剧风格转移。
  • MAS 解决的是信号质量问题:完整 MAPD 比"用协议但不用 MAS"再多拿 2-3 个点——MAS 让协议事实更准确、推理更完整。

我的解读:这其实呼应了我之前的怀疑——"风格解耦"是核心,MAS 是工具。作者的写作很清醒,没有把功劳全归在多智能体框架上,消融直接把"协议结构"和"MAS 流水线"的贡献拆得很清楚。

损失权重 λ 的甜点位

Table 3 扫了三种教师 × 两种学生规模 × 三个 λ 值(0.01、0.05、0.10):

图3:OPSD 损失权重 λ 与平均成功率的关系

图 3:λ 在 0.01-0.10 区间内的表现。绿色阴影区是 0.04-0.06 的"sweet spot"。实线是 4B,虚线是 1.7B。三种教师模型用不同颜色区分。

数据里能看到:

  • λ=0.01(弱蒸馏):平均比 0.05 低 1-2 个点。作者诊断是"蒸馏信号过早消失"——大概训练 100 步时师生分布差距就坍缩了
  • λ=0.10(强蒸馏):4B 上 KL 散度膨胀到 1.06,约为 λ=0.01 的 4 倍。响应长度从 135 tokens 崩到 42 tokens,工具调用饱和在最大值 3.0/episode。模型学会了"检索不推理"的捷径——单跳略升,但多跳急剧下降
  • λ=0.05:所有教师、所有学生规模上都是最佳或次佳,是真正的甜点位

这个曲线很优雅,也跟经验吻合——太弱的蒸馏信号没意义,太强的会让 RL 失衡。

跨教师泛化

图4:三个专有教师模型的性能对比

图 4:Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro 三种教师下 MAPD 的表现。虚线是 SDAR 基线(1.7B=37.6, 4B=43.0)。MAPD 在三个教师上全部超过基线,方差在 1-2 个点内。

数据看下来,三种教师在 1.7B 上分别是 39.4% / 39.0% / 37.9%,4B 上是 44.4% / 44.6% / 44.0%。协议成功抽象了教师特异性——这意味着如果哪天某个闭源 API 涨价了或者下架了,工程上可以直接换教师,训练流程不用动。


我的判断:风格解耦这条路值得更多人去走

读完 MAPD 我最大的收获不是"多智能体系统做协议生成"这个具体方案,而是它背后一个更普遍的洞察——在异构模型之间做知识迁移,瓶颈往往不是"知识"本身,而是"知识的表达形式"

闭源大模型的推理能力为什么难迁移到开源小模型?因为开源学生一旦模仿闭源老师的语言风格,就被拉到了分布外的区域——token 概率分布偏离自然语料的统计规律,模型内部的注意力机制也跑偏。这个观点作者没直接讲,但消融数据完全支持。

从工程角度看 MAPD 的几个亮点:

1) 协议设计是真正可复用的资产。 JSON 的 5 个字段(task type / reasoning plan / grounding facts / partial findings / answer verification)很工程化,团队要自己搭一套类似的 pipeline,抄这个 schema 就能起步。相比之下,许多 agent 蒸馏论文里的"teacher trajectory"基本是"AI 自己聊了一段",没法直接拿来当接口用。

2) "离线生成 + 在线训练"的解耦是个聪明选择。 一次性的 $1454 成本换 25K 条高质量协议,比每步训练都调用闭源老师便宜太多。而且推理时协议完全不参与——零延迟开销。

3) 跨教师泛化不是 PR 词。 Table 3 + Figure 4 的数据是真做了三种教师实验,不是空喊。如果你们团队的闭源 API 经常换(比如做多供应商备份),这个特性值不少钱。

需要批评或者打个问号的地方:

  • 纯 OPSD 崩溃的现象是反直觉的。 作者给了一个解释(长度截断饱和),但这个机制是不是唯一原因我没完全想清楚。是不是 token-level 的 reverse KL 在长轨迹上的数值稳定性本身就有问题?这个我猜值得再深挖。
  • MAS 协议生成引入了 ground-truth 答案的依赖。 Repair agent 用 ground-truth 做诊断,ground-truth 不进训练数据这件事是作者自己说的。但协议生成阶段用了 GT 答案这件事会不会在某些场景下"过度优化"——比如真实业务里很多 QA 任务根本没有 GT 答案可以用?
  • "Style drift"被论文当作主要负面效应,但度量并不直接。 论文没有专门 ablation 协议和"去掉风格词"的对比——他们说"协议结构解耦了风格",但要更严格地验证,可能需要类似"教师模型的句法特征是否还残留在学生输出里"这种测量。

不过整体看,这篇论文我觉得是近一两个月 agent + 蒸馏方向里问题意识最清楚的一篇。它没有堆"我们在 X benchmark 上多涨 3 个点"这种空话,而是把"为什么之前的蒸馏方案不 work"这件事掰开讲清楚了,再针对每个失败点给出一个具体的、可复现的解法。


工程落地的几点建议

如果你也在做 agentic search 的训练,下面几个点可能用得上:

1) 先检查你的 PI 是不是"高质量且风格解耦"。 MAPD 的实验反复证明:没有好 PI,self-distillation 比纯 RL 还差。PI 的关键是 (a) 质量高于学生自身,(b) 与学生输出风格分离。直接拿学生的成功 rollout 当 PI 在 agentic 场景下基本不 work。

2) JSON 协议这种"中间表示"是个被低估的工程模式。 比起"让大模型生成自然语言解释"再让小模型学,强制结构化输出能 (a) 用程序自动验证质量,(b) 剥离风格,(c) 让下游训练流程不用解析自由文本。先把能学的教会,剩下的再搜(Treasure the data, search for the rest)。

3) 离线协议合成的成本敏感性。 1454 美元做 25K 条协议,听起来不多,但协议质量门控的通过率是 99.94%——这个数字背后是 4 项自动检查 + 3000 样本的人工复核。如果你的协议生成没有这么严格的质检,训练效果大概率打折。

4) λ=0.05 可以当默认值。 论文在三种教师 × 两种规模上反复确认了 0.05 的甜点位。如果你想复现这个方案,别忘了这个超参——直接拿 0.01 或 0.10 跑出来会失望。


最后

MAPD 这套方案,说到底是在讲一件事:在异构模型之间迁移能力,不要让学生去模仿老师的"语言",让学生去模仿老师的"思路"。

把这条原则落地,靠的是三个工具的组合: - 多智能体系统负责把"思路"从无序轨迹里抽取出来 - 结构化 JSON 协议负责把"思路"和"语言"解耦 - OPSD 联合 GRPO负责把"思路"以密集 + 稀疏两种粒度灌给学生

对研究者来说,协议 schema 本身可能比整个框架更值得带走——你完全可以把 MAS 替换成单 agent pipeline,把 Claude 替换成 GPT,把 Qwen 替换成 Llama,核心 idea 是"风格解耦 + 同源自蒸馏"这两个不变的东西。

对做产品的人来说,这篇论文最有用的信息是:闭源模型蒸馏到开源模型,在 agentic 任务上,成本 1454 美元 + 200 步训练 + 7 个 benchmark 涨 3-5 个点。这事儿值得做。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。