多轮长程规划的"物理定律":一份统一框架把预训练、RL后训练和多教师蒸馏讲透了

论文:The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation 链接:https://arxiv.org/abs/2607.24720 作者:Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao(中国科学院自动化研究所) 代码:https://github.com/Quester-one/PlanPhysCode 模型/数据:https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models


核心摘要

做 Agent 的人都有一个共同感受:模型在短任务上跑得很稳,任务一长就开始"飘"。但问题到底出在预训练、后训练,还是多教师蒸馏?没人说得清。

这篇来自中科院自动化所的论文做了一件"笨功夫"但极其有价值的事情:他们构建了一个完全可控的多轮长程规划 Gym(三个域:Fantasy Alchemy、Livestock Farming、Electronic Assembly),从零训练了一个 1.2B 模型,然后在三个训练阶段里系统性地切变量——预训练阶段看数据格式、分布、质量的影响,后训练阶段用互信息框架区分"规划模式"和"规划知识"并比较 GRPO 与 OPD,多教师阶段看 MOPD 怎么整合能力。

最大的反直觉发现是:次优轨迹能彻底搞垮长程规划(短程还行,中长程直接归零);OPD 在低质量数据上比 GRPO 稳健得多(因为梯度方向更一致);MOPD 成功的前提是教师间有"共享的规划模式",否则就是灾难性遗忘。

这不是一个底层突破,更像是一份训练手册级别的实证研究——但对于真正在调 Agent 的人,这份手册非常值。


论文信息

  • 标题:The Physics of Multi-Turn Long-Horizon Planning
  • arXiv:2607.24720v1 [cs.CL](2026 年 7 月 27 日)
  • 机构:中国科学院自动化研究所复杂系统认知与决策智能重点实验室、中国科学院大学人工智能学院
  • 代码与模型:已开源(HuggingFace + GitHub)

一、为什么需要这篇论文

OSWorld 2.0、EdgeBench、Long-Horizon-Terminal-Bench、DeepPlanning 这些近期的长程基准都指向同一个结论:基础模型在长程规划任务上依然严重不足。但问题难回答的恰恰是"为什么不足"——

模型在不可控、不透明的互联网数据上被训练,规划能力是怎么来的、怎么被塑造的、怎么被整合的,这个黑盒我们一直打不开。

你想调一个数据混合比例,验证不了。你想换一个 RL 算法,看不出是数据问题还是算法问题。你想做多教师蒸馏,崩了也不知道是教师的问题还是顺序的问题。

这篇论文的切入点是:与其在不可控的互联网数据上做实验,不如自己造一个可控环境。这样每个变量都能被独立切出来研究。


二、可控的"规划 Gym"长什么样

作者造了一个长程规划模拟器(Controllable Planning Gym),三个域共享同一套结构:

  • Fantasy Alchemy(FA):幻想炼金术——把草药、宝石、符文炼成装备
  • Livestock Farming(LF):畜牧养殖——从牧草到羊毛到毛衣
  • Electronic Assembly(EA):电子组装——从电阻电容到电路板

每个域是一个多层技能图(5 层、每层 40 类别、每类别 20 实例、200 个转移/环境)。合成规则是 AND/OR 树状逻辑,类似 Minecraft 那种"先合成基础再合成高级"的配方图。任务难度由合成步骤数控制:

难度 步数
Short 1–5 步
Middle 6–8 步
Long ≥ 9 步

每个测试任务跑 8 次,报告 avg@8(Pass@1 均值)和 pass@8(至少一次成功的任务比例)。

选这个环境是有讲究的——它能精确控制难度、长度、数据质量、知识库,规划"模式"和"知识"还能被解耦。这是任何真实互联网数据集都做不到的。

Figure 1:研究总览

图 1:论文的核心结构。横轴是训练阶段(预训练 → RL 后训练 → MOPD 整合),纵轴是被研究的物理量:数据格式、分布、质量、规划模式 vs 规划知识、共享模式 vs 冲突模式。最上面那头长颈鹿是论文的 logo,长脖子代表"长程"。

Figure 2:环境与训练流水线

图 2:左上是 Fantasy Alchemy 的一个多轮交互示例(左上角那条对话)。左下是规划知识到 CoT 模式的转换——知识是合成规则("草+水=羊毛"),模式是 DFS 遍历 + Grounding 流程。中间是技能图的一个片段(4 层、5 类别)。右边是环境配置(3 域、5 层、200 类、200 转移、20 实例/类)和训练管线(1. 构规划图 2. 映射到 gym 3. 构建 Oracle 数据 4. 训练 tokenizer 5. 预训练 6. 单教师 OPD 7. 多教师 OPD)。


三、预训练阶段:什么数据才有效

3.1 内化世界模型是"长程泛化"的关键

作者对比两种动作生成方式:

  • 直接回答(w/o WM):模型直接预测每步动作
  • 世界建模规划(w/ WM):先在 CoT 里输出状态转移函数("草+水 → 羊毛"),再执行

直觉上世界建模多了一层 CoT 浪费 token,但实验数据很打脸——

难度 avg@8 提升 pass@8 提升
Short +9.4% +6.9%
Middle +39.3% +32.9%
Long +45.8% +42.9%

长程任务提升 45 个点。早期阶段直接回答的上升速度更快(1800–5400 步之间),但最终被世界建模反超并远远甩开。

说实话这个结果我挺震惊的。直觉上多写 CoT 浪费 token,但世界模型把"环境动力学"内化进了模型的隐空间之后,它在长程上才能"看到"未来的状态空间。这不是 reasoning 技巧,这是泛化机制本身。

3.2 原子技能无法自动组合,但少量长程数据就能激活

这是这篇论文最反直觉的发现之一。直觉上:模型会了"草+水"、"水+棉"、"棉+布",它应该能学会"草+水+棉=布"这种三步组合吧?

实验数据打了所有人一巴掌(Table 1 关键行):

  • 只训练短程任务(100% S):短程 pass@8 达 93.12%,中程骤降到 0.83%,长程直接归零
  • 加 5% 中程数据:中程 pass@8 从 0.83% 跃升到 51.88%
  • 加 5% 长程数据:长程 pass@8 从 0.00% 跃升到 11.46%

"组合泛化"这个事在 LLM 上不会自动发生。你必须见过一些长程样本,模型才能"看到"完整路径。但好消息是少量就够——5% 的长程轨迹就足以激活规划能力。

这个发现对工业界很有价值:做数据配比时,"长程覆盖"是稀缺资源,但只要 5%–50% 就能带来质变。不需要堆 100% 长程数据。

3.3 次优轨迹是长程规划的毒药

数据质量这一栏的结果让我愣了一下。8 种规划模式,按"4 最优 / 4 最优 4 次优 / 4 最优 8 次优"配比训练:

  • 4 Opt(全是金标准):中程 pass@8 约 85%
  • 4 Opt:4 Sub(一半次优):中程 pass@8 掉到 36%
  • 4 Opt:8 Sub(次优更多):中程和长程 pass@8 几乎为零

短程任务还能保留一些能力(因为错误还没来得及放大),但中长程任务因为决策链长,每一步的次优选择都会让智能体偏离不可恢复的路径

复利效应听过吧?RL 训练里"复合误差"就是这个意思。一步错了,下一步的选择空间就被污染了,到第 9 步你已经不知道自己在哪了。做 SFT 数据清洗的人要把这个数字刻在脑子里——长程任务对次优轨迹的容忍度几乎为零


四、后训练阶段:GRPO vs OPD 的边界

4.1 互信息框架:规划模式 vs 规划知识

进入后训练之前,作者先做了一个概念上的解耦——用互信息把"规划模式"和"规划知识"分开:

  • 规划模式 P:CoT 的算法骨架(识别目标、回忆知识、grounding、输出动作),跨样本共享,\(I(T;P)\) 较低
  • 规划知识 K:任务特定的程序化信息("草+水 → 羊毛"的合成规则),与任务强相关,\(I(T;K)\) 较高

这个区分很关键,因为这两个东西应该用不同的方法优化——

  • 模式:低互信息,跨样本泛化,RL 能搞定
  • 知识:高互信息,逐点优化,RL 搞不定,应该 SFT

4.2 三个适用区域

基于这个区分,作者提出后训练有三个适用区域:

区域 含义 推荐方法
A:不必要 不同模式性能相似,模式选择没意义 SFT 注入知识即可,不需要 RL
B:有效 不同模式有明显性能差异 RL 能发现好模式,GRPO/OPD 都行
C:不支持 存在更好的模式但 RL 算法设计不够好 当前的 RL 算法激活不了最佳模式

这其实是一个很优雅的诊断框架——RL 不是万能的,有些场景就别上 RL

4.3 GRPO vs OPD 的真正差异

在低质量数据(4 Opt:8 Sub)长程任务上的对比非常说明问题(Table 3 关键行):

Pattern Mix Model avg@8 长程 avg@8 三级均值(△)
4 Opt:4 Sub Long OPD 10.13 +15.12
4 Opt:4 Sub Long GRPO 8.52 +12.34
4 Opt:8 Sub Long OPD 5.29 +18.59
4 Opt:8 Sub Long GRPO 0.00 -1.58

GRPO 在 4 Opt:8 Sub 长程任务上完全没提升(甚至负增长),而 OPD 涨了 18.59 个点。

为什么?作者用 SVD 分析了梯度方向(Figure 9-10):

  • GRPO 的梯度方向在长程任务上噪声很大——因为稀疏结果奖励(最后一步才对/错)导致信用分配粗糙,每个 token 的优势估计不准确
  • OPD 的梯度方向更一致——因为教师提供的是密集的 token 级监督,每一步都有"教师更倾向选什么"作为学习信号

简单说:GRPO 靠稀疏奖励回传,OPD 靠教师 token 监督。在低质量、长 horizon 场景下,教师监督比奖励回传更稳。

这也是为什么 DeepSeek 的 GRPO 之后有那么多工作转向 on-policy distillation:教师提供一致方向的能力在长程任务上是硬刚需。

4.4 知识不匹配的灾难

后训练还有一个很反直觉的负向结果(Table 4 关键行):

  • Teacher A(用水+草籽+羔羊做羊毛)→ 100% 通过率
  • Teacher B(用水+棉籽+纺织做羊毛)→ 100% 通过率
  • Student + Teacher A:平均 41.37
  • Student + Teacher B:平均 31.50(比基础模型 26.13 没强多少

目标都是"做羊毛",但路径完全不同。结果:学生蒸馏 Teacher B 时,原有的世界建模(对 Recipe A 的记忆)反而被打碎了,新知识又没学到手。

Figure 14(token 级概率热图)揭示了原因——RL 早期确实在优化跨样本泛化的模式,但后期想注入 Recipe B 这种与学生先验高度冲突的知识时,RL 的更新幅度根本不够把 A→B 的转移完成。

这里有一个工程上的重要教训:别让教师教学生完全陌生的程序化路径。如果必须教,要么先 SFT 注入知识框架,要么教师和学生共享至少一个"模式骨架"。


五、MOPD 阶段:多教师蒸馏的三种命运

5.1 工业界已经在用 MOPD

Table 5 调研了 4 个工业基础模型(MiMo-V2-Flash、GLM-5、Nemotron-Cascade 2、DeepSeek-V4)已经在用 MOPD,但分两种范式:

  • 跨域整合:学生=SFT 模型,教师=域专家(SFT 后再 RL 出来的)
  • 跨阶段保留:学生=上一阶段 RL checkpoint,教师=当前阶段 RL checkpoint

目标函数很简单:\(\mathcal{L}_{\text{Agent-OPD}}^{(m)} = \mathbb{E}_{\tau \sim \pi_\theta}[\sum_k \sum_t D_{\text{KL}}(p_{k,t} \| q_{k,t}^{(m)})]\),依次从 \(m=1\)\(M\) 迭代。

5.2 三种模式对应三种命运

作者把教师间的关系分成三类,结论极其清晰:

Type I:共享且兼容(FA/LF/EA 三个域专家教师共享一个规划模板)

Table 6 关键行(4 Opt:4 Sub (a)):

阶段 avg@8 三级均值
Instruct 42.77
After FA 56.50
After LF 57.93
After EA 53.64

每个教师都为学生贡献了正迁移——MOPD 收敛到共享模式,跨域能力成功整合。

Type II:部分共享(每个域覆盖部分模板)

学生能持续学习,缓解灾难性遗忘,但跨域泛化受限。

Type III:完全冲突(教师间模板不重叠或行为完全相反)

学生因为过拟合新教师,严重灾难性遗忘。After EA 后整体均值从 57.93 跌到 53.64。

这里的工程含义很重要:MOPD 不是"教师越多越好"。多教师蒸馏的成败取决于规划模式的兼容性。如果你想做跨域整合,先验证教师之间的"思考方式"是否兼容,否则就是灾难。

5.3 MOPD 的核心机制

Figure 16 给出了作者的分析框架——

Figure 16:MOPD 分析框架

图 16:MOPD 的 token 级概率热图。横轴是学生生成的 token 序列,纵轴是每个 token 在不同模型下的概率分布(cyan=学生 A、blue=Teacher A、orange=Teacher B,颜色越深概率越高;红色斜杠条表示该 token 不在教师的 top-k 预测中)。这展示了多教师 OPD 怎么在 token 级别做对齐——前期主要优化跨样本泛化的模式,后期尝试注入教师特有知识时容易失败。

MOPD 的核心是在多教师间找到一个共享的规划模式分布。当分布能合并(兼容),就泛化成功;当分布部分重叠(部分共享),就持续学习;当分布完全不重叠(冲突),就灾难性遗忘。


六、和前序工作的对比

论文还有一个我挺欣赏的"客观定位"——Table 5 不是吹自己,而是把工业界的 4 个 MOPD 范式都列出来,承认它们已经在用。论文贡献不在于"发明了 MOPD",而在于在可控环境里把 MOPD 的物理机制讲清楚了

对比相关工作: - 现有长程基准(OSWorld 2.0、DeepPlanning 等)只报告"模型不够好",不分析为什么 - 现有 on-policy distillation(Kimi、DeepSeek 系列)报告经验性提升,但不解释什么条件下 OPD 优于 GRPO - 现有 GRPO 工作(DeepSeek-R1)讨论 credit assignment,但不区分"模式"和"知识"

这篇论文的定位是实证机制研究,不是新算法。它的价值在于把"调参经验"提升到"可解释的物理机制"。


七、我的判断

亮点

  1. 可控环境是真正的贡献——有了这个环境,未来所有"多轮 RL 调参"的研究都能复用同样的实验台面
  2. 模式 vs 知识的解耦是优雅的理论框架——它直接指导"什么时候上 RL、什么时候上 SFT"
  3. 实验设计很扎实——每个结论都有多个数据点支撑,不是单点 anecdotal

局限/值得注意的点

  1. 域是合成环境——三个域都是规则化的合成任务,能不能迁移到 OSWorld 那种真实 GUI 长程任务上不好说
  2. 1.2B 模型规模偏小——更大规模下 OPD vs GRPO 的边界会不会变?
  3. 没有讨论"非规划"能力的影响——比如 reasoning、tool use、memory 这些非规划能力怎么和长程规划能力交互
  4. MOPD 的 Type III 实验是重要的负面结果,但作者没给出"如何检测教师间冲突"的实用工具

对工程实践的启发

如果你也在做 Agent 训练,这篇论文给你几个直接的 actionable 建议:

阶段 建议
预训练 数据格式上用 CoT 建模世界模型(不是直接预测动作)
预训练数据配比 少量长程数据就够(5%–50%),不需要堆 100%
预训练数据清洗 次优轨迹是毒药——长程任务对次优的容忍度几乎为零
后训练 知识走 SFT,模式走 RL——别用 RL 注入程序化知识
后训练算法 长程 + 低质量数据用 OPD,短程 + 高质量用 GRPO 没问题
多教师蒸馏 先验证教师兼容性——共享规划模式才能泛化,否则就是灾难

八、结尾

读完这篇论文,我最大的感受是:Agent 训练已经从"大力出奇迹"阶段进入"机制研究"阶段

过去两年大家都在堆数据、堆模型、堆算力,调参靠经验。这篇论文的价值是把经验变成可解释的机制——什么数据有效、什么算法有效、什么条件下多教师能整合,都给了清晰的边界条件。

不是底层突破,但对于真正在生产环境调 Agent 的人来说,这份手册比十篇 SOTA 论文都有用


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。