多轮长程规划的"物理定律":一份统一框架把预训练、RL后训练和多教师蒸馏讲透了
论文:The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation 链接:https://arxiv.org/abs/2607.24720 作者:Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao(中国科学院自动化研究所) 代码:https://github.com/Quester-one/PlanPhysCode 模型/数据:https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models
核心摘要
做 Agent 的人都有一个共同感受:模型在短任务上跑得很稳,任务一长就开始"飘"。但问题到底出在预训练、后训练,还是多教师蒸馏?没人说得清。
这篇来自中科院自动化所的论文做了一件"笨功夫"但极其有价值的事情:他们构建了一个完全可控的多轮长程规划 Gym(三个域:Fantasy Alchemy、Livestock Farming、Electronic Assembly),从零训练了一个 1.2B 模型,然后在三个训练阶段里系统性地切变量——预训练阶段看数据格式、分布、质量的影响,后训练阶段用互信息框架区分"规划模式"和"规划知识"并比较 GRPO 与 OPD,多教师阶段看 MOPD 怎么整合能力。
最大的反直觉发现是:次优轨迹能彻底搞垮长程规划(短程还行,中长程直接归零);OPD 在低质量数据上比 GRPO 稳健得多(因为梯度方向更一致);MOPD 成功的前提是教师间有"共享的规划模式",否则就是灾难性遗忘。
这不是一个底层突破,更像是一份训练手册级别的实证研究——但对于真正在调 Agent 的人,这份手册非常值。
论文信息
- 标题:The Physics of Multi-Turn Long-Horizon Planning
- arXiv:2607.24720v1 [cs.CL](2026 年 7 月 27 日)
- 机构:中国科学院自动化研究所复杂系统认知与决策智能重点实验室、中国科学院大学人工智能学院
- 代码与模型:已开源(HuggingFace + GitHub)
一、为什么需要这篇论文
OSWorld 2.0、EdgeBench、Long-Horizon-Terminal-Bench、DeepPlanning 这些近期的长程基准都指向同一个结论:基础模型在长程规划任务上依然严重不足。但问题难回答的恰恰是"为什么不足"——
模型在不可控、不透明的互联网数据上被训练,规划能力是怎么来的、怎么被塑造的、怎么被整合的,这个黑盒我们一直打不开。
你想调一个数据混合比例,验证不了。你想换一个 RL 算法,看不出是数据问题还是算法问题。你想做多教师蒸馏,崩了也不知道是教师的问题还是顺序的问题。
这篇论文的切入点是:与其在不可控的互联网数据上做实验,不如自己造一个可控环境。这样每个变量都能被独立切出来研究。
二、可控的"规划 Gym"长什么样
作者造了一个长程规划模拟器(Controllable Planning Gym),三个域共享同一套结构:
- Fantasy Alchemy(FA):幻想炼金术——把草药、宝石、符文炼成装备
- Livestock Farming(LF):畜牧养殖——从牧草到羊毛到毛衣
- Electronic Assembly(EA):电子组装——从电阻电容到电路板
每个域是一个多层技能图(5 层、每层 40 类别、每类别 20 实例、200 个转移/环境)。合成规则是 AND/OR 树状逻辑,类似 Minecraft 那种"先合成基础再合成高级"的配方图。任务难度由合成步骤数控制:
| 难度 | 步数 |
|---|---|
| Short | 1–5 步 |
| Middle | 6–8 步 |
| Long | ≥ 9 步 |
每个测试任务跑 8 次,报告 avg@8(Pass@1 均值)和 pass@8(至少一次成功的任务比例)。
选这个环境是有讲究的——它能精确控制难度、长度、数据质量、知识库,规划"模式"和"知识"还能被解耦。这是任何真实互联网数据集都做不到的。

图 1:论文的核心结构。横轴是训练阶段(预训练 → RL 后训练 → MOPD 整合),纵轴是被研究的物理量:数据格式、分布、质量、规划模式 vs 规划知识、共享模式 vs 冲突模式。最上面那头长颈鹿是论文的 logo,长脖子代表"长程"。

图 2:左上是 Fantasy Alchemy 的一个多轮交互示例(左上角那条对话)。左下是规划知识到 CoT 模式的转换——知识是合成规则("草+水=羊毛"),模式是 DFS 遍历 + Grounding 流程。中间是技能图的一个片段(4 层、5 类别)。右边是环境配置(3 域、5 层、200 类、200 转移、20 实例/类)和训练管线(1. 构规划图 2. 映射到 gym 3. 构建 Oracle 数据 4. 训练 tokenizer 5. 预训练 6. 单教师 OPD 7. 多教师 OPD)。
三、预训练阶段:什么数据才有效
3.1 内化世界模型是"长程泛化"的关键
作者对比两种动作生成方式:
- 直接回答(w/o WM):模型直接预测每步动作
- 世界建模规划(w/ WM):先在 CoT 里输出状态转移函数("草+水 → 羊毛"),再执行
直觉上世界建模多了一层 CoT 浪费 token,但实验数据很打脸——
| 难度 | avg@8 提升 | pass@8 提升 |
|---|---|---|
| Short | +9.4% | +6.9% |
| Middle | +39.3% | +32.9% |
| Long | +45.8% | +42.9% |
长程任务提升 45 个点。早期阶段直接回答的上升速度更快(1800–5400 步之间),但最终被世界建模反超并远远甩开。
说实话这个结果我挺震惊的。直觉上多写 CoT 浪费 token,但世界模型把"环境动力学"内化进了模型的隐空间之后,它在长程上才能"看到"未来的状态空间。这不是 reasoning 技巧,这是泛化机制本身。
3.2 原子技能无法自动组合,但少量长程数据就能激活
这是这篇论文最反直觉的发现之一。直觉上:模型会了"草+水"、"水+棉"、"棉+布",它应该能学会"草+水+棉=布"这种三步组合吧?
实验数据打了所有人一巴掌(Table 1 关键行):
- 只训练短程任务(100% S):短程 pass@8 达 93.12%,中程骤降到 0.83%,长程直接归零
- 加 5% 中程数据:中程 pass@8 从 0.83% 跃升到 51.88%
- 加 5% 长程数据:长程 pass@8 从 0.00% 跃升到 11.46%
"组合泛化"这个事在 LLM 上不会自动发生。你必须见过一些长程样本,模型才能"看到"完整路径。但好消息是少量就够——5% 的长程轨迹就足以激活规划能力。
这个发现对工业界很有价值:做数据配比时,"长程覆盖"是稀缺资源,但只要 5%–50% 就能带来质变。不需要堆 100% 长程数据。
3.3 次优轨迹是长程规划的毒药
数据质量这一栏的结果让我愣了一下。8 种规划模式,按"4 最优 / 4 最优 4 次优 / 4 最优 8 次优"配比训练:
- 4 Opt(全是金标准):中程 pass@8 约 85%
- 4 Opt:4 Sub(一半次优):中程 pass@8 掉到 36%
- 4 Opt:8 Sub(次优更多):中程和长程 pass@8 几乎为零
短程任务还能保留一些能力(因为错误还没来得及放大),但中长程任务因为决策链长,每一步的次优选择都会让智能体偏离不可恢复的路径。
复利效应听过吧?RL 训练里"复合误差"就是这个意思。一步错了,下一步的选择空间就被污染了,到第 9 步你已经不知道自己在哪了。做 SFT 数据清洗的人要把这个数字刻在脑子里——长程任务对次优轨迹的容忍度几乎为零。
四、后训练阶段:GRPO vs OPD 的边界
4.1 互信息框架:规划模式 vs 规划知识
进入后训练之前,作者先做了一个概念上的解耦——用互信息把"规划模式"和"规划知识"分开:
- 规划模式 P:CoT 的算法骨架(识别目标、回忆知识、grounding、输出动作),跨样本共享,\(I(T;P)\) 较低
- 规划知识 K:任务特定的程序化信息("草+水 → 羊毛"的合成规则),与任务强相关,\(I(T;K)\) 较高
这个区分很关键,因为这两个东西应该用不同的方法优化——
- 模式:低互信息,跨样本泛化,RL 能搞定
- 知识:高互信息,逐点优化,RL 搞不定,应该 SFT
4.2 三个适用区域
基于这个区分,作者提出后训练有三个适用区域:
| 区域 | 含义 | 推荐方法 |
|---|---|---|
| A:不必要 | 不同模式性能相似,模式选择没意义 | SFT 注入知识即可,不需要 RL |
| B:有效 | 不同模式有明显性能差异 | RL 能发现好模式,GRPO/OPD 都行 |
| C:不支持 | 存在更好的模式但 RL 算法设计不够好 | 当前的 RL 算法激活不了最佳模式 |
这其实是一个很优雅的诊断框架——RL 不是万能的,有些场景就别上 RL。
4.3 GRPO vs OPD 的真正差异
在低质量数据(4 Opt:8 Sub)长程任务上的对比非常说明问题(Table 3 关键行):
| Pattern Mix | Model | avg@8 长程 | avg@8 三级均值(△) |
|---|---|---|---|
| 4 Opt:4 Sub | Long OPD | 10.13 | +15.12 |
| 4 Opt:4 Sub | Long GRPO | 8.52 | +12.34 |
| 4 Opt:8 Sub | Long OPD | 5.29 | +18.59 |
| 4 Opt:8 Sub | Long GRPO | 0.00 | -1.58 |
GRPO 在 4 Opt:8 Sub 长程任务上完全没提升(甚至负增长),而 OPD 涨了 18.59 个点。
为什么?作者用 SVD 分析了梯度方向(Figure 9-10):
- GRPO 的梯度方向在长程任务上噪声很大——因为稀疏结果奖励(最后一步才对/错)导致信用分配粗糙,每个 token 的优势估计不准确
- OPD 的梯度方向更一致——因为教师提供的是密集的 token 级监督,每一步都有"教师更倾向选什么"作为学习信号
简单说:GRPO 靠稀疏奖励回传,OPD 靠教师 token 监督。在低质量、长 horizon 场景下,教师监督比奖励回传更稳。
这也是为什么 DeepSeek 的 GRPO 之后有那么多工作转向 on-policy distillation:教师提供一致方向的能力在长程任务上是硬刚需。
4.4 知识不匹配的灾难
后训练还有一个很反直觉的负向结果(Table 4 关键行):
- Teacher A(用水+草籽+羔羊做羊毛)→ 100% 通过率
- Teacher B(用水+棉籽+纺织做羊毛)→ 100% 通过率
- Student + Teacher A:平均 41.37
- Student + Teacher B:平均 31.50(比基础模型 26.13 没强多少)
目标都是"做羊毛",但路径完全不同。结果:学生蒸馏 Teacher B 时,原有的世界建模(对 Recipe A 的记忆)反而被打碎了,新知识又没学到手。
Figure 14(token 级概率热图)揭示了原因——RL 早期确实在优化跨样本泛化的模式,但后期想注入 Recipe B 这种与学生先验高度冲突的知识时,RL 的更新幅度根本不够把 A→B 的转移完成。
这里有一个工程上的重要教训:别让教师教学生完全陌生的程序化路径。如果必须教,要么先 SFT 注入知识框架,要么教师和学生共享至少一个"模式骨架"。
五、MOPD 阶段:多教师蒸馏的三种命运
5.1 工业界已经在用 MOPD
Table 5 调研了 4 个工业基础模型(MiMo-V2-Flash、GLM-5、Nemotron-Cascade 2、DeepSeek-V4)已经在用 MOPD,但分两种范式:
- 跨域整合:学生=SFT 模型,教师=域专家(SFT 后再 RL 出来的)
- 跨阶段保留:学生=上一阶段 RL checkpoint,教师=当前阶段 RL checkpoint
目标函数很简单:\(\mathcal{L}_{\text{Agent-OPD}}^{(m)} = \mathbb{E}_{\tau \sim \pi_\theta}[\sum_k \sum_t D_{\text{KL}}(p_{k,t} \| q_{k,t}^{(m)})]\),依次从 \(m=1\) 到 \(M\) 迭代。
5.2 三种模式对应三种命运
作者把教师间的关系分成三类,结论极其清晰:
Type I:共享且兼容(FA/LF/EA 三个域专家教师共享一个规划模板)
Table 6 关键行(4 Opt:4 Sub (a)):
| 阶段 | avg@8 三级均值 |
|---|---|
| Instruct | 42.77 |
| After FA | 56.50 |
| After LF | 57.93 |
| After EA | 53.64 |
每个教师都为学生贡献了正迁移——MOPD 收敛到共享模式,跨域能力成功整合。
Type II:部分共享(每个域覆盖部分模板)
学生能持续学习,缓解灾难性遗忘,但跨域泛化受限。
Type III:完全冲突(教师间模板不重叠或行为完全相反)
学生因为过拟合新教师,严重灾难性遗忘。After EA 后整体均值从 57.93 跌到 53.64。
这里的工程含义很重要:MOPD 不是"教师越多越好"。多教师蒸馏的成败取决于规划模式的兼容性。如果你想做跨域整合,先验证教师之间的"思考方式"是否兼容,否则就是灾难。
5.3 MOPD 的核心机制
Figure 16 给出了作者的分析框架——

图 16:MOPD 的 token 级概率热图。横轴是学生生成的 token 序列,纵轴是每个 token 在不同模型下的概率分布(cyan=学生 A、blue=Teacher A、orange=Teacher B,颜色越深概率越高;红色斜杠条表示该 token 不在教师的 top-k 预测中)。这展示了多教师 OPD 怎么在 token 级别做对齐——前期主要优化跨样本泛化的模式,后期尝试注入教师特有知识时容易失败。
MOPD 的核心是在多教师间找到一个共享的规划模式分布。当分布能合并(兼容),就泛化成功;当分布部分重叠(部分共享),就持续学习;当分布完全不重叠(冲突),就灾难性遗忘。
六、和前序工作的对比
论文还有一个我挺欣赏的"客观定位"——Table 5 不是吹自己,而是把工业界的 4 个 MOPD 范式都列出来,承认它们已经在用。论文贡献不在于"发明了 MOPD",而在于在可控环境里把 MOPD 的物理机制讲清楚了。
对比相关工作: - 现有长程基准(OSWorld 2.0、DeepPlanning 等)只报告"模型不够好",不分析为什么 - 现有 on-policy distillation(Kimi、DeepSeek 系列)报告经验性提升,但不解释什么条件下 OPD 优于 GRPO - 现有 GRPO 工作(DeepSeek-R1)讨论 credit assignment,但不区分"模式"和"知识"
这篇论文的定位是实证机制研究,不是新算法。它的价值在于把"调参经验"提升到"可解释的物理机制"。
七、我的判断
亮点
- 可控环境是真正的贡献——有了这个环境,未来所有"多轮 RL 调参"的研究都能复用同样的实验台面
- 模式 vs 知识的解耦是优雅的理论框架——它直接指导"什么时候上 RL、什么时候上 SFT"
- 实验设计很扎实——每个结论都有多个数据点支撑,不是单点 anecdotal
局限/值得注意的点
- 域是合成环境——三个域都是规则化的合成任务,能不能迁移到 OSWorld 那种真实 GUI 长程任务上不好说
- 1.2B 模型规模偏小——更大规模下 OPD vs GRPO 的边界会不会变?
- 没有讨论"非规划"能力的影响——比如 reasoning、tool use、memory 这些非规划能力怎么和长程规划能力交互
- MOPD 的 Type III 实验是重要的负面结果,但作者没给出"如何检测教师间冲突"的实用工具
对工程实践的启发
如果你也在做 Agent 训练,这篇论文给你几个直接的 actionable 建议:
| 阶段 | 建议 |
|---|---|
| 预训练 | 数据格式上用 CoT 建模世界模型(不是直接预测动作) |
| 预训练数据配比 | 少量长程数据就够(5%–50%),不需要堆 100% |
| 预训练数据清洗 | 次优轨迹是毒药——长程任务对次优的容忍度几乎为零 |
| 后训练 | 知识走 SFT,模式走 RL——别用 RL 注入程序化知识 |
| 后训练算法 | 长程 + 低质量数据用 OPD,短程 + 高质量用 GRPO 没问题 |
| 多教师蒸馏 | 先验证教师兼容性——共享规划模式才能泛化,否则就是灾难 |
八、结尾
读完这篇论文,我最大的感受是:Agent 训练已经从"大力出奇迹"阶段进入"机制研究"阶段。
过去两年大家都在堆数据、堆模型、堆算力,调参靠经验。这篇论文的价值是把经验变成可解释的机制——什么数据有效、什么算法有效、什么条件下多教师能整合,都给了清晰的边界条件。
不是底层突破,但对于真正在生产环境调 Agent 的人来说,这份手册比十篇 SOTA 论文都有用。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。