资讯动态

Revisiting On-Policy Distillation:Empirical Failure Modes and Simple Fixes——重新审视同策略蒸馏:经验性失效模式与简单修复方法

发布时间:2026/9/28 11:23:40 来源:尧图企业网站定制
《Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes》对同策略蒸馏On-Policy Distillation, OPD进行了系统性的重新审视从理论、实证到方法改进三个层面展开研究。以下是对其主要研究内容的全面总结一、研究背景与问题同策略蒸馏OPD在LLM后训练中日益流行因为它能利用教师模型对学生生成的轨迹rollout提供密集的token级监督。然而当前主流的OPD实现采用采样token级估计器——即在每个训练步骤仅用采样token上的教师-学生对数概率差来驱动更新。论文指出这种简单实现存在严重脆弱性具体表现为理论上有偏token级OPD相对于序列级反向KL最小化是有偏的实践中不稳定在长rollout上学习信号脆弱容易出现重复、熵坍缩等退化现象。二、理论分析偏差-方差权衡论文从理论上澄清了token级OPD与序列级OPD之间的权衡关系序列级估计器将每个token更新与所有未来奖励耦合更接近精确的轨迹级目标但最坏情况方差上界为O(T⁴)token级估计器移除未来奖励耦合因此有偏但最坏情况方差上界仅为O(T²)显著更优。论文通过一个双任务玩具实验验证了这一权衡引入折扣因子γ在两者之间插值发现γ越大未来耦合越强梯度方差越高优化越不稳定甚至导致策略在状态空间中漂移。这支持了一个实用设计原则长时域训练应保持token级监督以控制方差。三、实证分析采样Token OPD的三种失效模式论文通过数学推理实验学生Qwen2.5-7B-Instruct教师OpenThinker3-7B识别出采样token OPD的三个反复出现的失效模式1. Token级监督高度不平衡大多数采样token获得负奖励优化被一小部分局部正token主导训练对高频填充词和短续写敏感这些内容可能获得有利局部分数但对轨迹级质量贡献甚微。2. 教师指导在学生生成前缀上不可靠在学生对常见但教师不常见的前缀上高教师概率的token仍可能获得奖励即使轨迹已漂移到重复、自重置推理或无意义续写两个放大因素教师分布尖锐适度不匹配产生大对数比率和长rollout上教师-学生分歧增长。3. Tokenizer或特殊token不匹配不同tokenization下相同原始文本被不同分割学生生成的token在教师下可能不对应自然token单token比较将语义分歧与tokenizer不匹配混淆扭曲奖励信号。四、方法教师Top-K局部支持匹配针对上述失效模式论文提出教师Top-K局部支持匹配Local Support Matching, LSM核心思想不再仅比较单个采样token而是在每个前缀上比较教师和学生在教师Top-K支持的token集合上的下一token分布实现方式截断反向KL目标——在教师Top-K支持集内重新归一化教师和学生分布计算局部反向KL配套稳定化措施支持集重归一化防止梯度传播到支持集外避免优化不稳定Top-p rollout采样使轨迹更接近典型续写提高教师信号可靠性特殊token掩码减少tokenizer不匹配导致的假阴性。该方法保留了token级更新的效率与方差优势同时将单token点估计替换为分布级比较使更新不再由单个采样token的对数比率符号和幅度决定。五、实验结果论文在三种设置中评估了局部支持匹配1. 单任务数学推理采样token OPD将学生从28.2提升至36.4平均分加特殊token掩码后提升至40.7本文方法无掩码达到41.7有掩码41.5优于采样token OPD及其掩码变体。2. 多任务智能体推理训练ALFWorld 数学交替未掩码版本将平均匹配分数从34.8提升至41.719.8%同时保持有竞争力的ALFWorld性能掩码版本取得最佳ALFWorld分数97.7但放弃部分数学提升局部支持匹配对推理侧特别有帮助因为采样token信号更易受前缀漂移影响。3. 单任务WebShop较小学生模型成功率从50.0提升至57.8表明方法可迁移到主要数学/智能体设置之外。4. 消融实验仅教师Top-K比较不足需配合Top-p采样重归一化至关重要移除会导致快速坍缩性能对支持大小不太敏感K足够大时但支持太小或rollout无约束时训练不稳定替代支持变体学生Top-K、教师Top-K采样token、EMA-PG校正在多任务设置中表现较差教师Top-K最为稳健。5. 训练动态更小的梯度范数和裁剪边界比例保持足够策略熵教师-学生对数概率差距更接近零对齐更好。六、讨论与局限性论文坦诚指出支持集KL是截断目标仅在教师Top-K支持内计算引入偏差改变期望取值位置训练-推理不匹配rollout策略与训练引擎更新之间可能存在不匹配教师匹配仍是任务成功的非完美代理局部教师偏好的续写即使整体轨迹已无帮助仍可能获得奖励与教师仍有明显差距更好的局部监督只是蒸馏问题的一部分。七、主要贡献理论澄清token级OPD有偏但方差缩放更优适合长时域训练实证分析识别采样token OPD的三种失效模式方法提出教师Top-K局部支持匹配 Top-p rollout 特殊token掩码实验验证在单任务数学、多任务智能体推理、单任务WebShop上均优于基线多任务平均提升19.8%。论文的核心观点是token级OPD的方差优势值得保留但标准采样token实现过于脆弱。通过将单token监督替换为教师Top-K支持集上的截断分布级比较可以在保持局部更新效率的同时显著提升优化稳定性和下游性能。这一简单修改为更稳定的同策略蒸馏提供了实用方案同时也明确了教师匹配作为任务成功代理的局限性。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要同策略蒸馏On-policy distillation, OPD在大型语言模型LLM后训练中日益广泛应用因为它能够利用教师模型对学生 rollout 提供密集监督。然而标准实现通常将分布匹配简化为采样 token 的对数比率这会导致学习信号在长 rollout 上变得脆弱因为其前缀会偏离教师的典型支持域。我们从理论和实现两个角度重新审视这一形式。理论上token 级 OPD 相对于序列级反向 KL 最小化是有偏的但其最坏情况方差上界显著更紧一项受控合成研究进一步表明更强的未来奖励耦合会增加梯度方差并破坏训练稳定性。经验上我们识别出采样 token OPD 的三种失效模式token 级监督不平衡、教师指导在学生生成前缀上不可靠以及 tokenizer 或特殊 token 不匹配。这些发现促使我们提出教师 top-K 局部支持匹配一种截断反向 KL 目标在每个前缀上比较教师和学生分布在教师支持的 token 集合上的分布并结合 top-p rollout 采样和特殊 token 掩码。在涵盖智能体和推理设置的单任务推理与多任务基准上该目标提升了优化稳定性并相较于标准采样 token OPD 基线取得 19.8% 的性能提升为更稳定的同策略蒸馏提供了实用方案。1 引言同策略蒸馏OPD正日益成为 LLM 后训练的常见组成部分尤其是在推理和智能体模型中。Thinking Machines LabLu Lab, 2025、Qwen3Yang et al., 2025、MiMo-V2-FlashXiao et al., 2026和 GLM-5Zeng et al., 2026近期的公开报告表明更广泛的趋势是转向对模型生成轨迹的监督或密切相关的同策略变体与离策略蒸馏和强化学习并列。通过在学生 rollout 上训练同时用更强的教师模型评估它们OPD 以相对较低的成本结合了同策略数据收集与密集 token 级反馈Agarwal et al., 2024; Gu et al., 2024。这一特性在实际后训练流程中颇具吸引力因为训练效率至关重要且模型通常需要跨领域和训练阶段组合或恢复能力Xiao et al., 2026; Zeng et al., 2026; Wang et al., 2026a; DeepSeek-AI, 2026。当前 LLM 流程中的大多数 OPD 实现使用 token 级估计器尽管它相对于序列级反向 KL 是有偏的Lu Lab, 2025。一个基本原因是序列级目标将每个 token 更新与许多未来奖励耦合这在长时域设置中会使优化显著更嘈杂。我们将这一权衡明确化token 级 OPD 移除了未来奖励耦合因此是有偏的但它具有更有利的最坏情况方差缩放。我们的玩具实验在经验上展示了相同模式更强的未来耦合导致更高的梯度方差和更不稳定的优化。这表明长时域训练的实用设计原则保持 token 级监督以控制方差。在当前 LLM 流程中这一 token 级目标通常通过采样 token 比较来实现在每个训练步骤更新由采样 token 上的教师-学生对数概率差驱动Lu Lab, 2025; Xiao et al., 2026。这种实现简单高效但一旦 rollout 变长其学习信号就会变得脆弱。Gu et al. (2024) 报告了重复等退化输出这与我们的观察一致。近期工作还报告了在某些情况下采样 token OPD 下的熵坍缩Ko et al., 2026; Jin et al., 2026b。更近期有报告称全词表蒸馏在某些设置中优于采样 token 变体Zhao et al., 2026; DeepSeek-AI, 2026表明单 token 形式可能未充分利用有用的教师信息。我们的经验分析表明这种脆弱性源于若干反复出现的失效模式。特别地我们识别出两个目标级问题单 token 信号通常高度不平衡且教师指导在学生生成前缀上可能变得不可靠。我们还观察到 tokenizer 或特殊 token 不匹配带来的额外实现级问题这可能进一步扭曲单 token 比较。综合来看这些结果指向一个实际问题我们如何在保留 token 级 OPD 方差优势的同时使其监督信号在实践中不那么脆弱上述分析表明对标准采样 token 目标进行有针对性的修改。我们将单 token 监督替换为教师 top-K 局部支持匹配即在每个前缀上在教师支持的 token 子集上比较教师和学生而非仅在采样 token 上。我们将该目标实现为截断反向 KL并结合 top-p rollout 采样和特殊 token 掩码。由此产生的更新保持局部且低成本同时提供不那么脆弱的训练信号。总体而言我们的主要贡献如下我们阐明了 OPD 中的理论权衡token 级 OPD 相对于序列级 OPD 是有偏的但在序列长度上具有显著更好的最坏情况方差缩放使其对长时域 LLM 后训练具有吸引力。我们提供了经验分析说明采样 token OPD 在实践中为何不稳定强调两个反复出现的目标级问题——单 token 监督不平衡和学生生成前缀上教师指导不可靠——以及 tokenizer 或特殊 token 不匹配带来的额外实现问题。我们提出教师 top-K 局部支持匹配作为采样 token OPD 的分析驱动修订使用截断反向 KL、top-p rollout 和特殊 token 掩码实现并表明在单任务数学推理和多任务智能体加推理训练中它比采样 token OPD 产生更稳定的优化和更强的经验性能。2 理解采样 Token OPD权衡与失效模式2.1 从反向 KL 到 token 级 OPDγ0 的情况恢复 token 级 OPD而 γ1 恢复因果序列级估计器。我们在双任务玩具实验中进一步验证这一权衡图 1更强的未来耦合导致显著更高的梯度方差和更不稳定的优化。这促使我们在本文剩余部分关注 token 级监督其中主要问题变为如何在实际 LLM 设置中改进其局部训练信号。额外实验细节见附录 E。2.2 采样 token OPD 在实践中为何脆弱尽管 token 级 OPD 从偏差-方差角度看颇具吸引力但标准采样 token 形式在实践中可能脆弱。我们分离出三种失效模式(1) 高度不平衡的 token 级蒸馏信号(2) 学生生成前缀上教师指导不可靠以及 (3) tokenizer 或特殊 token 不匹配引入的扭曲。这些观察来自数学推理上的采样 token OPD 实验使用 Qwen2.5-7B-InstructQwen et al., 2024作为学生OpenThinker3-7BGuha et al., 2025基于 Qwen2.5-7B-Instruct 构建的 SFT 模型作为教师。高度不平衡的采样 token 信号。在采样 token OPD 中步骤 t 的更新由单个采样 token 上的对数比率驱动logq(yt​∣ct​)−logπθ​(yt​∣ct​).当学生比教师对采样 token 赋予更高概率时会产生负奖励。如图 2 所示大多数采样 token 获得负奖励。这使得优化被一小部分局部正 token 主导因此训练对高频填充词和短续写敏感这些内容可能获得有利的局部分数但对轨迹级质量贡献甚微。教师信号在学生生成前缀上可能变得不可靠。采样 token OPD 假设学生生成 token 上的教师概率是轨迹质量的有用代理。在学生对常见但教师不常见的前缀上该代理变得不可靠。在这些区域即使轨迹已漂移到重复、自重置推理或其他无意义续写高教师概率的 token 仍可能获得奖励图 3附录 H。这在 token 级教师一致性与轨迹级质量之间产生了目标不匹配。我们假设两个因素放大了这一问题尖锐的教师分布其中适度的教师-学生不匹配可能产生大的对数比率值以及长 rollout 上不断增长的教师-学生分歧。与这一观点一致图 4 显示教师-学生差距的分布在序列后期变得更宽。Tokenizer 和特殊 token 不匹配。采样 token OPD 使用教师分布比较学生生成的确切 token。当两个模型使用不同 tokenization 时相同的原始文本可能被不同分割因此学生生成的 token 在教师下可能不对应自然 tokenBoizard et al., 2025; Patino et al., 2025; Minixhofer et al., 2025。例如学生可能将 think 生成为 think, 而教师期望 th, ink, 。那么 token 从教师获得低概率即使两个模型产生相同的语义内容。特殊 token 如序列结束标记也会出现类似不匹配。在这种情况下单 token 比较将语义分歧与 tokenizer 不匹配混淆。由于监督应用于单个 token这种不匹配会扭曲奖励信号。这些观察促使我们超越单 token 监督不是仅比较采样 token而是在每个前缀上比较教师和学生在教师支持的下一 token 续写集合上的分布同时保留 token 级更新以保持稳定性。3 方法我们的方法是对上述失效模式的直接回应保留 token 级 OPD但将单 token 监督替换为在每个前缀上教师选择的支持集上的分布级比较。这产生截断反向 KL 目标保持局部更新的效率同时减少对任何单个采样 token 的依赖。第 3.1 节介绍目标第 3.2 节描述确保稳定训练的实际选择。3.1 教师 top-K 局部支持匹配3.2 实际稳定化选择支持集重归一化。重归一化是必要的因为目标在截断支持集而非全词表上评估。具体而言我们在支持集内的 logits 上应用单独的 softmax因此梯度不会直接传播到该集合外的 token。没有这一步优化可能变得不稳定因为支持集内的教师和学生概率质量无法直接比较。Top-p rollout 采样。我们使用 top-p 采样生成 rollout。无约束采样偶尔会产生极低概率 token造成教师信号信息量较低且优化不稳定的前缀。Top-p 采样使轨迹更接近典型续写并使教师信号更可靠。特殊 token 掩码。我们掩码有问题的特殊 token以减少不兼容 tokenization 约定导致的假阴性。这是一个正交的实际修复在我们的实验中它显著帮助采样 token OPD而我们的局部支持目标对其敏感度低得多。原则上也可以合并多 token 标记变体或对等价 tokenization 求平均但我们不追求这些 tokenizer 特定补救措施因为掩码是最简单的模型无关校正。4 实验我们在三种设置中评估局部支持匹配单任务数学推理第 4.2 节、数学和智能体任务的交替多任务训练第 4.3 节以及较小学生模型上的额外单任务智能体设置附录 G.1。我们还在第 4.4 节展示消融并在附录 G.2 提供训练动态分析。4.1 设置我们在 ver-agent 框架Feng et al., 2025之上实现局部支持匹配使用 Qwen2.5-Instruct 模型作为学生。我们考虑两种主要设置。第一种是单任务数学推理其中 OpenThinker3-7BGuha et al., 2025作为教师训练使用 DAPO-Math-17KYu et al., 2025的英文部分最大上下文长度为 16K。第二种是多任务设置在数学推理和基于 ALFWorldShridhar et al., 2021的多轮智能体任务之间交替批次。在此设置中数学使用 OpenThinker3-7BGuha et al., 2025作为教师而智能体侧使用发布的 GiGPO-Qwen2.5-7B-Instruct-ALFWorld 检查点Feng et al., 2025。对于数学推理我们报告五个基准上的 pass1Math500Hendrycks et al., 2021、AIME24Zhang Math-AI, 2024、AIME25Zhang Math-AI, 2025、MinervaLewkowycz et al., 2022和 OlympiadBenchHe et al., 2024。对于 ALFWorldShridhar et al., 2021我们默认报告成功率。在少数情况下我们还报告数学基准上的 avg32。更多实验设置细节见附录 F。4.2 单任务数学推理表 1 显示局部支持匹配在单任务数学推理中优于采样 token OPD。采样 token OPD 已将学生从 28.2 提升至 36.4 平均分但仍显著低于教师。对采样 token OPD 应用特殊 token 掩码进一步将平均分提升至 40.7表明 tokenizer 相关不匹配是失效的重要部分。我们方法的两个变体在平均分上均优于采样 token OPD 及其掩码变体。这表明增益并非仅归因于不匹配处理而是支持更强分布级蒸馏信号的作用。此外掩码对我们方法的影响仅适度41.7 对 41.5与局部支持匹配对 tokenizer 不匹配不如单 token 监督敏感的观点一致。WebShopYao et al., 2022上的额外证据见附录 G.1。4.3 多任务智能体加推理训练表 2 显示局部支持匹配在交替多任务训练中对两个任务族的影响不同。未掩码版本将平均匹配分数从 34.8 提升至 41.719.8%同时保持有竞争力的 ALFWorld 性能。掩码版本取得最佳 ALFWorld 分数 97.7但放弃了部分数学提升。这一模式表明局部支持匹配对混合中的推理侧特别有帮助因为采样 token 信号更易受前缀漂移影响相比之下掩码主要在此次运行中将权衡转向智能体任务。除评估性能外我们的目标还产生持续更好的优化动态。我们将完整学习曲线和诊断图推迟到附录 G.2。表 1单任务数学推理结果。方法Math500AIME24AIME25MinervaOlympiadBenchAvg.Qwen2.5-7B-It68.213.30.026.532.928.2OpenThinker3-7B92.253.340.039.055.656.0Sampled-token OPD80.010.016.732.443.136.4Sampled-token OPD w/ mask81.426.716.734.244.740.7Ours w/o mask80.423.326.734.243.941.7Ours w/ mask82.023.323.334.943.941.5表 2ALFWorld 和数学推理批次交替多任务训练结果。方法ALFWorldMATH500AIME24AIME25MinervaOlympiadBenchAvg.Qwen2.5-7B-It21.968.213.30.026.532.928.2GiGPO-Qwen2.5-7B-It-Alfworld95.3------OpenThinker3-7B-92.253.340.039.055.656.0Sampled-token OPD90.674.813.313.332.140.534.8Sampled-token OPD w/ mask93.876.020.013.333.540.436.6Ours w/o mask95.382.033.316.732.744.041.7Ours w/ mask97.779.020.016.734.642.538.64.4 消融表 3 和图 6 表明增益来自若干设计选择而非任何单一修改。仅教师 top-K 比较不足rollout 策略还必须保持在稳定区域添加 top-p 采样将最初较弱的 top-K 变体转变为更强配置。在相同 top-p rollout 条件下教师 top-K 局部支持匹配仍将 AIME24 avg32 从 21.6 提升至 23.6。截断支持集内的重归一化至关重要移除它会导致快速坍缩。一旦 K 足够大性能对确切支持大小不太敏感但当支持太小或 rollout 完全无约束时训练变得不稳定。表 3单任务数学训练下的组件消融。方法AIME24 avg32Qwen2.5-7B-Instruct10.0OpenThinker3-7B63.3Sampled-token OPD20.4Sampled-token OPD top-p21.6Teacher top-K17.7Teacher top-K top-p23.6Top-K 支持变体。我们的主要实验在教师 top-K 支持上定义截断期望。替代目标可以在教师 top-K用于主要结果、学生 top-KK 或教师 top-K 增强学生采样 token 上计算期望。我们在表 4 中提供单任务和多任务设置下的初步比较。表 4单任务和多任务设置下的替代 top-K 支持变体。(a) 单任务设置下的替代 KL 期望支持。方法AIME24 avg32MATH500AIME24AIME25MinervaOlympiadBenchAvg.teacher top-K23.680.423.326.734.243.941.7student top-K w/ sampled22.382.430.016.735.744.941.9teacher top-K w/ sampled22.481.626.723.336.446.742.9(b) 多任务设置下的替代 KL 期望支持。我们报告所有数学推理基准的 pass1。最后一列仅平均 pass1 指标。方法ALFWorldMATH500AIME24AIME25MinervaOlympiadBenchAvg.teacher top-K95.382.033.316.732.744.041.7student top-K w/ sampled95.365.610.010.025.031.628.4teacher top-K w/ sampled94.563.210.010.021.030.126.9在单任务设置中三个变体取得大致相当的结果。教师 top-K 采样 token 变体取得最高平均 pass1 分数而学生 top-K 在若干单个基准上表现有竞争力原始教师 top-K 在三个变体中给出最佳 AIME24 avg32。多任务结果不太一致。在该设置中原始教师 top-K 变体显著优于其他两个替代方案而学生 top-K 和教师 top-K 采样 token 变体在数学基准上大幅退化。因此我们将这些结果视为支持构造重要的证据但不过度解读变体之间的排名。总体而言这些结果表明 KL 期望计算位置的选择可能以非平凡方式产生影响尤其是在多任务设置中。我们将其视为部分消融和初步探索并在附录 A 中讨论可能原因包括支持集构造和剩余离策略效应。5 结论本工作从理论和实现角度重新审视了 LLM 后训练中的同策略蒸馏OPD。我们的理论分析表明 token 级 OPD 为何是长时域训练的有吸引力近似它相对于序列级反向 KL 是有偏的但避免了未来奖励耦合并具有显著更好的最坏情况方差缩放。同时我们的经验研究表明标准采样 token 实现可能提供脆弱监督因为其信号不平衡在学生漂移前缀上可能保持误导且对 tokenizer 或特殊 token 不匹配敏感。教师 top-K 局部支持匹配通过保留局部 token 级更新同时将单 token 监督替换为截断分布级比较解决了这些问题。在单任务数学推理和交替智能体加推理训练中这一简单修改改善了优化稳定性和下游性能优于采样 token OPD同时也阐明了教师匹配在何处仍是任务成功的非完美代理。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑