固定谱、自由帧:ISO 把 RLVR 训练提速 2.7×,还不丢点

你有没有过这种别扭感觉——RLVR(可验证奖励强化学习)现在如火如荼地把模型从 Qwen 训到 DeepSeek,从 AIME 训到 Codeforces,但你手里那把"优化器",说到底还是预训练留下的 AdamW?

论文 arXiv:2607.19331 的作者们显然也觉得别扭。他们做了一件简单但漂亮的事:把权重矩阵做 SVD 分解 \(W = U\Sigma V^\top\),然后盯着 RLVR 训练全程看——\(\Sigma\)(谱)到底变了没?

答案是:基本没变。

谱不变,方向变。这个观察被他们命名为 spectral inheritance(谱继承),并由此设计出一整套叫 ISO(Isospectral Optimization,等谱优化)的优化栈:复用基模型的谱 \(\Sigma_0\),只优化两侧奇异方向 \((U, V)\)。在 1.5B–8B 规模上,ISO-AdamW 在 Qwen3-8B-Base 上用 100 步就达到了 AdamW 270 步的聚合精度,少了 2.7× 训练步数,并且还能再涨到 0.509(vs AdamW 的 0.495)。离线版本 ISO-Merger 还能把多个 RL 专家无数据、无 rollout、无蒸馏地合到一起,拿到当下 data-free 合并方法里最强的聚合表现。

核心摘要

论文来自 UT Austin(Hanqing Zhu、Zhangyang "Atlas" Wang 等)+ Meta AI(Yuandong Tian)+ 普渡大学,由 11 位作者于 2026 年 7 月 21 日挂在 arXiv 上。完整作者列表:Hanqing Zhu、Wenyan Cong、Zhizhou Sha、Sagnik Mukherjee、Xinyuan Song、David González-Martínez、Xiaoxia Wu、Yuandong Tian、Shiwei Liu、David Z. Pan、Zhangyang "Atlas" Wang。

痛点:RLVR 把奖励信号翻译成权重更新的那层"优化器 + 参数化",基本是预训练直接搬过来的,AdamW 统治一切。但预训练是稠密 token 级监督,RLVR 是稀疏 outcome 级奖励——这个 inheritance 到底合不合理,没人系统研究过。

核心方案:把每个权重矩阵做 SVD \(W = U\Sigma V^\top\),定义"固定谱族" \(\mathcal{F}(W_0)\)。通过三个层次实验证明:RLVR 训练中 \(\Sigma\) 几乎不动(近等谱性 near-isospectrality)、恢复 \(\Sigma_0\) 性能不掉、训练时全程固定 \(\Sigma_0\) 也能学好——但只优化 \(\Sigma\) 冻住两侧方向,性能就涨不动。结论:\(\Sigma\) 是"继承",\((U, V)\) 才是"学习"。ISO 把这条经验规律变成设计原则,落地两个版本:ISO-Merger(offline,组合多专家)和 ISO-Optimizer(online,把 AdamW/Muon 的更新规则套到 frame 变量上)。

关键效果: - Qwen3-8B-Base 数学:AdamW 270 步 0.495,ISO-AdamW 100 步就 0.495,210 步 0.509。 - Qwen3-4B-Base 数学:ISO-AdamW 比最强 AdamW 少 2.2× 步达到同等精度,且最终精度更高。 - ISO-Merger 在 Qwen2.5-7B 三个专家上聚合分 63.80(最强 baseline 62.88),在 DS-R1-1.5B 两个专家上 44.38(最强 baseline 43.52)。 - SVD 引入的 retraction 开销只占端到端 RL 步的 7%

一针见血的评价:这是一个漂亮的"现象 → 设计"工作。Spectral inheritance 的经验观察扎实(多层校验 + 维度校准),ISO 的实现也很工程友好(不用新优化器,只换参数化)。但它不是底层突破——它其实是把 Muon/POET 这类正交化/谱保持优化的思想,从"为什么能 work"的理论角度做了一次"先看 RLVR 的 SVD,再决定怎么约束"的反向工程。如果你在做 RLVR 训练,这份工作值得细看方法论;如果只是关心 AdamW/Muon 本身,意义有限。


论文信息

  • 标题:ISO: An RLVR-Native Optimization Stack
  • 作者:Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
  • 机构:UT Austin(主)、Meta AI(Yuandong Tian)、Purdue
  • 链接arXiv:2607.19331
  • 日期:2026-07-21

为什么要重新设计 RLVR 的优化器?

在聊 ISO 之前,得先问一个朴素的问题:为什么 AdamW 统治了 RLVR 这么久?

答案很现实——因为没人仔细看过 RLVR 训练时权重"长什么样"。预训练时代我们有个直觉:dense token-level cross-entropy + AdamW 是经过大规模验证的"默认配方"。到 RLVR 这里,大家觉得既然基模型已经训好了、只是在 policy 上做 sparse reward 调整,那优化器沿用就行。Muon、Apollo 这些新优化器号称是为 LLM 训练设计的,但也都是面向预训练验证的。

但这真的合理吗?

  • 预训练:稠密 token 级监督,梯度信号稳定且噪声小。
  • RLVR:sparse outcome-level 奖励,梯度信号往往很"尖"——一个 roll-out 全对或全错。

直觉上,这两种学习范式对参数化空间的需求应该不同。作者从一个极其朴素的实验入手:把 RLVR 训练前后的权重矩阵做 SVD,对比 \(\Sigma\) 变化。

Figure 2:SFT 和 RLVR 的奇异值谱动态

图 1:SFT(蓝→红实线)和 RLVR(红实线→红虚线)的奇异值谱对比。RLVR 训练前后谱几乎完全重合,红色虚线(RL end)贴在红色实线(RL base = SFT end)上。而 SFT(蓝→红)虽然变化幅度小但谱发生了肉眼可见的形变。下方 (b)–(e) 的量化指标显示 RLVR 的 \(\rho_\Sigma\)(相对谱残差)几乎贴在 0%,而 SFT 在 25–40% 区间。(f) 的几何示意把这点画成箭头:RLVR 的更新"几乎垂直于谱方向"(stays near \(\mathcal{F}(W_0^{RL})\)),SFT 则有显著残差。

这就是核心观察:RLVR 训练时,权重矩阵的奇异值几乎不动,动的只是输入和输出两个方向的子空间。 论文把这叫 near-isospectrality(近等谱性),并通过 Proposition 2.1 给出精确距离公式:

\[\operatorname{dist}_F(W, \mathcal{F}(W_0)) = \|\sigma(W) - \sigma(W_0)\|_2\]

也就是说,到固定谱族 \(\mathcal{F}(W_0)\) 的距离,就是奇异值向量的 L2 距离。RLVR 训练全程这个距离几乎为 0(量级 \(10^{-5}\)\(10^{-4}\)),而 SFT 同一指标在 \(10^{-1}\) 量级。差了两个数量级。

但作者没有停在"谱不变"这个表象。他们做了个更扎实的校准:维度归一化谱变化能量 \(\kappa_{\mathrm{spec}}\)(各向同性参考值 = 1)。结果 RLVR 的 \(\kappa_{\mathrm{spec}}\) 在 1.02–1.35 之间——也就是说,仅靠高维空间的"自然倾向"就足以解释 RLVR 的近等谱性了,并不是优化器有什么特殊偏好

那这个现象到底有没有用?问题变成:那些"几乎为 0 的谱变化"功能上是不是必要的?


Spectral inheritance:谱在功能上可以继承

作者做了两个互补的实验,把"谱不变"从观察升格为功能性质。

实验 1:恢复基础谱,看性能掉不掉。

\(W_{\mathrm{RL}} = U_{\mathrm{RL}}\Sigma_{\mathrm{RL}}V_{\mathrm{RL}}^\top\),定义谱插值

\[\widetilde{W}(\alpha) = U_{\mathrm{RL}}\left[(1-\alpha)\Sigma_0 + \alpha\Sigma_{\mathrm{RL}}\right]V_{\mathrm{RL}}^\top\]

\(\alpha = 0\) 时谱恢复到 \(\Sigma_0\),但 frame 仍是 RL 训练出来的。结果在数学/代码/工具调用一系列任务上,性能曲线在 \(\alpha\) 从 0 到 1 几乎是一条平线——把谱改回基础值,性能基本不掉。

实验 2:训练时全程冻住谱,只更新 frame。

这个才是关键设计上的测试——从第一个 RL step 起就用 ISO 的固定谱参数化 \(W(U, V) = U\Sigma_0 V^\top\),AdamW 同样能跑起来。

但作者也没少做"反向控制":如果冻住两侧 frame、只更新 \(\Sigma\)(spectrum-only control),性能提升非常有限。谱可以继承,但 frame 必须能更新。

到这里,"spectral inheritance"就从一个观察变成了设计原则:继承谱,优化帧。(Inherit the spectrum, optimize the frames.)


Both frames must remain adaptable:两边都不能省

到这里还没完。下一个问题更尖锐:是不是"两边都更新"是必要的,还是只更新某一侧就行?

作者定义了"unexplained-update ratio"\(u_h\)——用某种受限结构重建 \(\widehat{W}_h\) 后,更新无法被解释的比例。对四种结构(proposition 3.1):

重建方式 含义 累积转换 \(W_0 \to W_2\) 的中位未解释率
\(\widehat{W}_{\mathrm{mix}}\) 在传入的两个子空间内 remix 87%
\(\widehat{W}_L\) 保留输入输出子空间 45%
\(\widehat{W}_R\) 保留输入子空间 42%
\(\widehat{W}_{\mathrm{iso}}\) 保留谱、适应两侧 frame 1.8%

Figure 5:unexplained-update ratio

图 2:语言模块和视觉模块上 \(u_h\) 的层分布。红色 \(u_{\mathrm{iso}}\)(保留谱、适应两侧 frame)整层都贴在 \(10^{-2}\) 附近,意味着 98% 以上的检查点更新都能用 ISO 结构解释。其余三色(\(u_{\mathrm{mix}}\), \(u_L\), \(u_R\))都在 0.3–1.0 区间。

这个数字很关键:在 \(W_0 \to W_2\) 这种累积转换上,"两边都 remix"留下了 87% 残差——这意味着 RLVR 的权重更新远不是简单的子空间旋转,必须两边 frame 都能动。"只冻住一侧、放开另一侧"也不行(残差 42–45%)。只有"两边都动 + 谱不动"才能 98% 解释更新。

这个结论在视觉-语言-动作(VLA)两阶段 RL 流程上同样成立——spectral inheritance 不是某个数据集的特殊现象,是 RLVR 训练的结构性特征。


ISO 框架:把观察变成优化器

有了"spectrum 继承、frame 学习"这条设计原则,剩下的问题就是怎么落地。ISO 给出两个互补版本,覆盖 RLVR 训练全流程。

ISO 的统一参数化

无论离线还是在线,核心参数化是同一个:

\[W(U, V) = U\Sigma_0 V^\top, \quad U \in \mathrm{St}(d_{\mathrm{out}}, q), \; V \in \mathrm{St}(d_{\mathrm{in}}, q)\]

\(\Sigma_0\) 从基模型继承,全程不动。\((U, V)\) 是要优化的变量。Proposition 4.1 证明:任何可行(Stiefel 切空间)的 frame 更新都满足 \(\operatorname{diag}(U^\top \dot{W} V) = 0\)——一阶谱不变。

离线版:ISO-Merger

场景:已经从共享基模型训了 K 个领域专家(coding、tool use、memory 等),现在想合并到一个模型,不跑 rollout、不算梯度、不做 on-policy distillation。

传统方法(Task Arithmetic、TIES、TSV、RAM、OrthoMerge-G-TIES 等)都在欧几里得空间里做"task vector"组合。ISO-Merger 思路完全不同:

  1. 把每个专家的奇异方向对齐到基的 sign canonical
  2. 计算 frame 位移 \(\Delta U_i = U_i - U_0\),投影到 Stiefel 切空间 \(\xi_{U,i}\)(保留 top \(\rho_{\mathrm{keep}} = 0.9\) 的奇异模式,屏蔽尾部不稳定模式)
  3. 用 ridge-stabilized 系数 \(\bar{c}\) 组合:\(\xi_{U,\star} = \Pi_{U_0}\left(\sum_i c_i^\star \widetilde{\xi}_{U,i}\right)\)
  4. Polar retraction\(U_\star = \mathrm{polar}(U_0 + \xi_{U,\star})\),恢复 Stiefel 可行性
  5. 重构 \(W_\star = U_\star \Sigma_0 V_\star^\top\)

第 4 步的 polar retraction 是关键工程细节——polar(X) = P_X Q_X^\top 取 SVD 后两端的正交因子。整个流程不需要任何梯度、rollout、post-merge data。

在线版:ISO-Optimizer

更直接:把 AdamW(或 Muon)"搬"到 frame 空间。

  1. 原始 AdamW 在 weight \(W\) 上做更新:\((W^+, s_W^+) = \mathrm{Opt}(W, G_W, s_W)\)
  2. ISO-AdamW 在 \((U, V)\) 上做更新:
  3. 链式法则得到 frame 梯度:\(G_U = G_W V \Sigma_0\)\(G_V = G_W^\top U \Sigma_0\)
  4. AdamW 独立更新两侧:\((\bar{U}, s_U^+) = \mathrm{Opt}(U, G_U, s_U)\)
  5. Polar retraction 恢复可行性:\(U^+ = \mathrm{polar}(\bar{U})\)\(W^+ = U^+ \Sigma_0 (V^+)^\top\)

整个流程等价于把"基优化器状态"(AdamW 的 m/v 或 Muon 的正交化)实例化在 frame 坐标上。它不是在 weight 空间做更新再投影——这一点很重要,否则就退化成普通的 projection 方法了。

与 Muon/Pion 的关系

论文 Related Work 里点了一个关键问题:Muon、POET、POET-X、Spectral Adapter、StelLA 都是"谱保持/正交化"类优化器,并发的 Pion 也是两侧正交等价重参数化。和 ISO 的区别?

ISO 从 RLVR 特定的经验观察出发,先看 SVD 诊断结果,再设计约束参数化;Muon/POET 是从矩阵几何理论出发,反向适配到 LLM 训练。Pion 是通用 LLM 训练设计,ISO 是 RLVR-specific 的、包含 online + offline 两个实例的优化栈。

直白地说,ISO 不是第一个"重参数化保谱"的优化器,但它是第一个"为 RLVR 量身做诊断 → 设计"的工作。


实验结果

ISO-Merger:离线合并多个专家

Table 1(Qwen2.5-7B-Instruct + 3 experts: Coder, Tool, Memory)

Method LB ACC LB UT LCB v2 ACC LCB v2 UT Live ACC Non-Live ACC HotpotQA 32K HotpotQA 64K SQuAD 32K SQuAD 64K Avg
Base 36.25 48.27 28.31 43.08 62.96 69.26 49.87 45.54 58.90 56.77 49.92
RLVR-Coder 37.42 49.42 30.17 44.24 63.37 68.07 50.21 45.61 60.51 56.84 50.59
RLVR-Tool 36.87 48.08 28.20 42.43 71.83 81.82 50.39 45.33 59.73 57.86 52.25
RLVR-Memory 37.32 50.05 27.41 41.70 63.82 72.61 78.60 77.95 79.98 78.52 60.80
Task Arithmetic 38.85 52.18 31.55 47.06 73.73 82.86 72.22 70.49 75.03 74.95 61.89
TIES 40.30 52.04 31.46 47.33 68.24 76.54 76.42 75.24 78.27 77.86 62.37
TSV 36.96 49.23 28.92 43.37 73.64 82.69 75.37 74.10 78.30 77.26 61.98
RAM 38.59 50.38 31.31 46.33 72.56 81.89 76.17 75.29 78.42 77.83 62.88
OrthoMerge-G-TIES 40.74 53.22 31.98 47.48 66.98 78.17 74.79 74.20 77.75 76.32 62.16
ISO-Merger 41.81 52.73 31.06 45.69 72.32 81.07 79.46 76.77 79.10 78.01 63.80

ISO-Merger 平均分 63.80,比最强 baseline RAM(62.88)高 0.92 个点,最关键的是在 Memory 任务上几乎恢复到专家水平(79.46 vs 专家 78.60),同时保住 Coding 和 Tool 能力。Best@4 / Worst@4 见附录:ISO-Merger 基本匹配 best@4 聚合分(说明上限没掉),同时 worst@4 提升 1.36–1.62 个点(说明更稳定)。

Table 2(DeepSeek-R1-Distill-Qwen-1.5B + 2 experts: Archer2.0, JustRL)

Method LB ACC LB UT LCB v5 ACC LCB v5 UT AIME24 AIME25 AMC23 Minerva OlympiadBench Avg
Base 17.99 26.24 16.82 20.85 30.90 23.40 63.15 27.33 43.11 29.98
Archer2.0 26.66 37.26 26.90 38.99 42.05 28.02 73.44 30.09 49.99 39.27
JustRL 22.23 31.85 23.05 30.18 53.16 36.84 82.78 34.71 55.67 41.16
TIES 26.37 36.75 27.62 39.45 54.51 35.76 82.13 33.76 55.36 43.52
ISO-Merger 25.52 36.42 27.84 41.84 55.00 37.81 83.53 34.77 56.64 44.38

1.5B 模型上 ISO-Merger 比最强 baseline TIES(43.52)高 0.86 个点。在数学任务上几乎全面超越所有 baseline——AIME24 55.00、AIME25 37.81、AMC23 83.53。值得一提的是 ISO-Merger 的 coding 指标(LCB v5 ACC)也最强,说明跨任务能力恢复没冲突。

ISO-Optimizer:在线 RLVR 训练

Table 3:数学 RLVR(avg@16)

Model Method AIME24 AIME25 AMC23 Minerva Olympiad Avg
Qwen3-1.7B-Base Base 3.75 1.25 23.04 18.49 18.43 12.99
AdamW 13.96 12.92 43.45 32.17 39.25 28.35
Muon 16.25 8.33 43.60 32.24 38.06 27.70
ISO-AdamW 16.04 11.04 44.50 33.11 39.01 28.74
Qwen3-4B-Base Base 6.88 5.00 25.45 20.97 22.43 16.15
AdamW 25.21 20.42 63.55 45.40 53.87 41.69
Muon 25.42 19.58 63.63 46.51 56.02 42.23
ISO-AdamW 27.29 23.13 65.74 45.15 55.99 43.46

1.7B 上 ISO-AdamW 拿到 28.74(vs AdamW 28.35、Muon 27.70),提升不大但稳定。4B 上 ISO-AdamW 比 AdamW 高 1.77 个点、比 Muon 高 1.23 个点,AIME24 涨 2 个点、AIME25 涨近 3 个点。

Table 4:DS-1.5B Coding(LCB avg@8, 220 步)

Method LCB v5 LCB v6 Avg
DS-1.5B Base 17.43 18.41 17.92
AdamW 24.01 26.24 25.13
ISO-AdamW 25.49 26.91 26.20

220 步时 ISO-AdamW 比 AdamW 高 1.07 个点。关键是步数:延伸 AdamW 实验显示,5e-6 学习率 AdamW 在 330 步峰值为 0.265 后下降,3e-6 在 330 步结束为 0.256,ISO-AdamW 在 130 步就达到 0.256 水平——少 2.5× 步数。

主秀数据:Qwen3-8B-Base

Figure 9:Qwen3-8B-Base 数学精度曲线

图 3:Qwen3-8B-Base 数学训练,ISO-AdamW(绿)vs AdamW(橙红)。阴影部分标记 8K 和 16K 最大响应长度阶段。绿色曲线始终在橙色上方,AdamW 270 步才到 0.495,ISO-AdamW 100 步就到这里,210 步进一步涨到 0.509,右下方红色虚线标出 ≈2.7× 更少训练步数。论文额外跑了 60 步延伸 AdamW 排除"没训够"的可能。

这个 2.7× 步数减少是论文最硬的数字。不是同一终点比较的边际改进,是用更少训练步数达到(且超出)对照组的最终精度。再加上 ISO-AdamW 在训练全程都领先,没有任何一段 AdamW 跑出来能反超——这是个很干净的对比。

ISO-Muon 变体

Figure 8:ISO-Muon vs Muon on Qwen3-4B-Base

图 4:把同一思路套到 Muon 优化器上。ISO-Muon(深绿)在 Qwen3-4B-Base 上 220 步达到 Muon 300 步的最终精度 0.42,并继续涨到 0.428。底部虚线标出 ≈1.4× 更少训练步数。说明 ISO 不是 AdamW-specific 的优化技巧,是套在任意基优化器上的"重参数化"层。

Coding 1.5B 完整曲线

Figure 7:DS-1.5B LiveCodeBench 训练曲线

图 5:DS-1.5B 上 LiveCodeBench 训练曲线。ISO-AdamW(绿)从 100 步开始就稳定在 AdamW 几种学习率配置之上,220 步峰值 0.268,延伸实验显示 AdamW 即使跑到 330 步也未能匹配这个数字。

工程开销:SVD 不便宜,但只占 7%

Figure 10:ISO vs AdamW 训练时间

图 6:Qwen3-4B-Base 上 ISO 和 AdamW 的 optimizer-update 和端到端 step 时间。绿色(ISO step)比橙色(AdamW step)多出约 86 秒的 SVD retraction 开销,但只占端到端 RL 步时间的 ≈7%。Rollout generation 是大头,retraction 可以与之异步 overlap。

86 秒看着吓人,但 RLVR 一步本来就 1000+ 秒(rollout + policy update + reference compute)。7% 的额外开销换 2.7× 训练步数减少,工程账完全算得过来。论文还提到 factor tensor 可以全分片 + optimizer state offload,进一步压显存。


我的判断

最值钱的地方:诊断方法论本身。

这篇论文最让我欣赏的不是"提速 2.7×"这个数字(说实话这个数字在 RLVR 训练里很容易刷——换个 learning rate、warmup 步数都能差 20%),而是它把 RLVR 优化器从"默认继承 AdamW"的工程惯性里拉出来,用 SVD 这个线性代数基本工具做了一个扎实的"现象 → 设计"反推。

具体来说三个证据链很漂亮:

  1. 近等谱性的精确测量(Proposition 2.1 给 Frobenius 距离的解析式)
  2. 维度归一化校准\(\kappa_{\mathrm{spec}}\) 对比 isotropic reference,排除"只是高维空间自然倾向"的可能)
  3. 两端 frame 必要性的残差分解\(u_{\mathrm{mix}}\) 87% vs \(u_{\mathrm{iso}}\) 1.8%,数量级差异)

这种"先看 SVD、再决定怎么约束"的 reverse engineering 思路,在 RL 后训练研究里值得借鉴。很多优化器 trick 之所以被发明,是因为它们的"发明者"猜对了约束结构;ISO 提供了"先看清楚约束结构再设计"的样本。

可能的问题 / 我没完全看明白的地方

  • 理论解释缺位:为什么 RLVR 不需要重写谱?这个观察很扎实,但"为什么"层面只给了一组经验证据(\(\kappa_{\mathrm{spec}}\) 接近 1,说明不算"超常偏好")。那到底是什么机制让 RLVR 的有效学习天然落在 frame 子空间上? 是 reward signal 的 sparse 性质、policy 的 KL 约束、还是别的?论文没给答案。
  • 与 Muon 的对比不够直接:Muon 已经是正交化优化器,理论上也应该保持谱附近。论文在 Qwen3-4B-Base 上同时跑了 Muon 和 ISO-Muon,但没看到 ISO-AdamW vs Muon 的直接 head-to-head 在所有模型规模上的对比。1.7B 上 Muon 27.70 vs ISO-AdamW 28.74 是 ISO 赢,但 4B 上 ISO-AdamW 43.46 vs Muon 42.23 也赢——这个优势是否一致? 需要更多模型和任务验证。
  • SVD 在更大模型上的可扩展性:8B 模型 100 步 SVD retraction 已经 86 秒/步,70B 模型这一步可能就 1000 秒。论文说"和 rollout 可以 overlap",但实际系统里这会增加显存峰值和通信复杂度。ISO 在超大规模 RLVR 训练上能不能落地,是个工程开放问题。
  • 不是底层突破:说到底,ISO 是"在 Muon/POET 这类正交化/谱保持优化器上做了一次 RLVR 特定的重参数化"。如果你已经在用 Muon 或 POET,ISO 给你的是一个对 RLVR 友好的、现象学上更清晰的版本,而不是数量级跃迁。

如果我在做 RLVR,我会怎么用这篇论文

  1. 第一件事:跑一下自己 RLVR 训练前后的 SVD,看 \(\rho_\Sigma\) 是不是真的这么小。如果不是,spectral inheritance 可能在你的设置下不成立,ISO 也不一定 work。
  2. 如果谱确实不动:试试 ISO-AdamW,至少 4B 以下规模应该稳定。
  3. 如果是多专家合并场景:ISO-Merger 几乎是无脑收益——不需要数据、不需要 rollout、不需要算梯度,只用 checkpoint。
  4. 不建议:在 70B+ 规模上直接上 ISO,SVD overhead 的边际成本要先 profile。

结语

ISO 这类工作最有意思的地方是它提醒了我们一件事——RL 后训练现在进入了"优化器也要重新设计"的阶段。预训练时代优化器是个被默认接受的基础设施(AdamW + lr schedule 配好就行),但 RL 训练范式(dense → sparse、token-level → outcome-level)的转变意味着这个基础设施也得跟着变。

spectral inheritance 这条经验规律能不能推广到更多 RL 后训练范式(DPO、PRM、process reward、agentic RL),目前还不知道。但 ISO 提供了一个非常清晰的"先诊断、再设计"的方法论样板——比起拍脑袋想优化器 trick,这套思路靠谱得多。

如果非要用一句话总结:RLVR 训练不需要新的优化器,只需要正确的参数化


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。