Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation超越教师的学习:基于奖励外推的
发布时间:2026/9/30 7:09:00来源:尧图企业网站定制
《Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation》超越教师的学习基于奖励外推的广义同策略蒸馏主要围绕同策略蒸馏On-Policy Distillation, OPD展开研究核心贡献在于从理论上重新解释了OPD并提出了一个更通用的框架最终发现了一种能让学生超越教师性能的方法。以下是其主要研究内容的全面总结1. 理论贡献揭示OPD与强化学习RL的内在联系OPD是密集KL约束RL的特例作者首先从理论上证明标准的OPD目标等价于一种密集KL约束的强化学习其中奖励函数和KL正则化项被等权加权权重比为1:1且参考模型可以任意选择。OPD的优势与局限OPD相比传统RL具有两大优势——密集的token级奖励信号和灵活的参考模型选择但其局限在于奖励项与KL正则化的相对权重被固定无法调整。2. 方法创新提出广义同策略蒸馏G-OPD框架引入两个关键组件奖励缩放因子 λ控制奖励项相对于KL正则化的权重打破了OPD中1:1的固定比例。灵活的参考模型 π_ref允许根据具体任务选择不同的参考模型。统一框架G-OPD将OPD和RL统一到一个更通用的目标函数中为后续分析不同设置下的蒸馏行为提供了理论基础。3. 核心发现奖励外推ExOPD让学生超越教师奖励插值0 λ 1学生行为介于参考模型和教师之间性能和响应长度随λ增大而单调增加可用于预算控制的推理。奖励外推λ 1作者将λ 1的情况称为ExOPD。实验表明适当的奖励外推如λ 1.25能持续优于标准OPD甚至使学生超越领域教师的能力边界。单教师蒸馏ExOPD在数学推理和代码生成任务上均优于OPD和教师。多教师蒸馏ExOPD是唯一能产生一个统一学生并超越所有领域教师的方法而SFT、ExPO等方法均无法稳定超越教师。过度外推的风险λ过大如1.5可能导致训练不稳定和性能下降原因是学生可能“黑客”隐式奖励。4. 强到弱蒸馏中的奖励校正问题背景在从大教师蒸馏到小学生的强到弱蒸馏设置中参考模型的选择会影响奖励信号的准确性。奖励校正方法作者提出将参考模型从学生的基座模型替换为教师的RL前基座模型以获得更准确的隐式奖励信号。效果与代价奖励校正能进一步提升ExOPD的蒸馏性能但代价是需要访问额外的模型并增加计算开销。实验结果在强到弱蒸馏中ExOPD和带奖励校正的ExOPD均显著优于标准OPD和SFT。5. 实验验证任务领域数学推理AIME24/25、HMMT25等和代码生成HumanEval、MBPP、LiveCodeBench。主要结论标准OPD能完全恢复教师的后训练行为。奖励插值可实现行为插值奖励外推可超越教师。ExOPD在多教师合并和强到弱蒸馏中均表现优异。奖励校正可进一步提升强到弱蒸馏性能。6. 研究意义与展望理论意义建立了OPD与RL的理论联系为理解OPD提供了新视角。实践意义ExOPD为多任务后训练和强到弱蒸馏提供了更有效的解决方案尤其是在需要超越教师性能的场景中。局限性奖励校正需要额外模型和计算成本过度外推可能导致不稳定。未来方向进一步探索G-OPD框架在其他任务和模型规模上的应用优化奖励校正的效率。本文通过理论推导将OPD推广为G-OPD框架并发现奖励外推ExOPD能让学生超越教师在多教师蒸馏和强到弱蒸馏中均取得显著效果为LLM后训练提供了新思路。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要同策略蒸馏On-Policy DistillationOPD通过在学生生成的轨迹上将学生与教师的logit分布对齐在提升学生性能方面展现出强大的实证收益并且通常优于离策略蒸馏和强化学习RL范式。在本工作中我们首先从理论上证明OPD是密集KL约束强化学习的一个特例其中奖励函数和KL正则化始终被等权加权且参考模型可以是任意模型。然后我们提出了广义同策略蒸馏Generalized On-Policy DistillationG-OPD框架该框架通过引入灵活的参考模型和奖励缩放因子用于控制奖励项相对于KL正则化的权重来扩展标准OPD目标。通过在数学推理和代码生成任务上进行大量实验我们得出了两个新颖的见解1将奖励缩放因子设置为大于1即奖励外推我们将其称为ExOPD在一系列教师-学生规模配对中始终优于标准OPD。特别地在我们将来自不同领域专家的知识通过对同一学生模型应用领域特定RL获得合并回原始学生的设置中ExOPD使学生甚至能够超越教师的能力边界并优于领域教师。2在ExOPD的基础上我们进一步发现在强到弱蒸馏设置中即从较大的教师蒸馏到较小的学生通过选择参考模型为教师RL之前的基座模型来进行奖励校正可以获得更准确的奖励信号并进一步提高蒸馏性能。然而这种选择假设可以访问教师的RL前变体并会产生更多的计算开销。我们希望我们的工作能为未来OPD研究提供新的见解。图1我们的方法ExOPD与离策略蒸馏SFT、标准OPD以及权重外推方法ExPOZheng et al., 2025在多教师和强到弱蒸馏设置中的实证有效性对比结果在4个数学推理和3个代码生成基准上取平均。(a) 当将通过领域特定RL获得的多个领域专家合并回原始基座模型时ExOPD是唯一能够产生一个统一学生并持续优于所有领域教师的方法。(b) 在从较大教师蒸馏到较小学生时ExOPD也显著优于标准OPD。此外在ExOPD中应用奖励校正可以进一步提升蒸馏性能图6。1 引言近年来同策略蒸馏OPDAgarwal et al., 2024; Yang et al., 2025a; Lu Lab, 2025已成为提升大语言模型LLM能力的有效后训练范式。与先前在教师生成轨迹上训练学生的离策略蒸馏方法Taori et al., 2023; Guha et al., 2025不同OPD允许学生在学生生成的token上从教师的监督即预测的logit中学习。先前的研究表明OPD不仅可以作为一种有前景的多任务后训练范式将不同领域RL变体获得的能力近乎无损地合并回原始基座模型Xiao et al., 2026而且在将较大教师的能力蒸馏到较小学生方面也是有效且高效的Gu et al., 2024; Yang et al., 2025a。尽管OPD在实证上有效但该领域对其机制的理解仍然有限其全部潜力尚未被充分探索。在本工作中我们通过建立OPD与密集强化学习RL之间的理论联系并将标准OPD扩展为广义公式来填补这一空白。首先我们进行推导以表明OPD本质上是标准密集KL约束RL的一个特例其中token级奖励函数始终与KL正则化等权加权且参考模型可以任意选择。基于这一见解我们通过进一步引入奖励缩放因子控制奖励项相对于KL正则化的相对权重以及灵活的参考模型将OPD目标推广为更通用的公式。我们将这一广义公式称为广义同策略蒸馏G-OPD框架。基于G-OPD框架我们从理论上分析了奖励缩放因子和参考模型的选择如何在不同设置下影响蒸馏效果并在数学推理和代码生成领域进行了全面的实验支持。在第一个设置中教师是通过对学生应用领域特定RL获得的参考模型自然地固定为学生的初始状态。我们表明1当奖励缩放因子位于(0,1)即奖励插值时蒸馏后的学生表现出介于参考模型和教师模型之间的行为例如性能和响应长度2当奖励缩放因子大于1即奖励外推时学生可以学习超越教师的能力边界并在领域任务中优于教师。我们将奖励外推变体称为ExOPD。我们进一步表明ExOPD可以很好地扩展到多教师蒸馏设置使一个统一学生能够超越所有领域教师。其次我们研究了强到弱蒸馏设置即从较大的教师蒸馏到较小的学生。在此设置中我们证明在ExOPD中将参考模型从学生的初始策略替换为教师的RL前变体即奖励校正可以产生更准确的奖励信号并进一步提高蒸馏性能。然而这种做法的局限性在于它假设可以访问一个额外的模型教师的RL前变体并且在计算较大参考模型的log概率时会产生更多的计算成本。尽管存在这些局限性ExOPD和带奖励校正的ExOPD在强到弱蒸馏设置中仍显著优于标准OPD。2 相关工作离策略蒸馏。知识蒸馏KDHinton et al., 2015是一种广泛用于将知识从领域专家教师迁移到学生模型的技术。大多数先前研究关注离策略蒸馏其中学生在教师生成的轨迹上进行训练要么通过在token logit上使用Kullback-LeiblerKL散度损失将学生的logit分布与教师的对齐Sanh et al., 2019; Kim Rush, 2016; Guo et al., 2025b要么通过对教师生成的token使用交叉熵损失直接进行监督微调SFTTaori et al., 2023; Zhou et al., 2023; Guha et al., 2025。在LLM时代这种做法已被证明能够有效提升学生模型在广泛能力范围内的表现Ding et al., 2023; Yang et al., 2025e; Ye et al., 2025b。同策略蒸馏。通过从学生采样轨迹并在这些学生生成的轨迹的每个token上将学生与教师的logit分布对齐同策略蒸馏OPDAgarwal et al., 2024; Gu et al., 2024实现了密集的同策略学习。在实证上OPD已被证明比离策略蒸馏实现更快、更有效的蒸馏Yang et al., 2025a; Lu Lab, 2025。最近的OPD研究探索了跨不同模型家族的蒸馏Patiño et al., 2025开发了不需要访问教师logit的黑盒同策略蒸馏方法Ye et al., 2025a并研究了利用LLM上下文能力将文本上下文信息蒸馏到其参数中的自蒸馏范式Yang et al., 2025c; Hübottter et al., 2026; Shenfeld et al., 2026; Zhao et al., 2026; Penaloza et al., 2026。3 方法3.1 预备知识在本节中我们首先简要回顾相关预备知识。3.2 广义同策略蒸馏在本节中我们首先从Eq. (4)出发推导OPD的广义公式。首先我们将OPD目标Xiao et al., 2025重新表述为4 实验与分析在本节中我们在数学推理和代码生成任务上进行了大量实验以分析所提出的G-OPD框架的性质并评估ExOPD的有效性。我们首先在4.1.2节中对同尺寸教师-学生配对进行初步实验研究G-OPD中奖励缩放因子的影响。然后我们在4.1.3节中探索ExOPD在多教师蒸馏设置中的有效性。最后我们在4.2节中给出强到弱蒸馏设置下的实验结果。4.1 同尺寸学生和教师的实验在这里我们考虑领域教师是通过领域特定RL从学生衍生而来的强化模型这一场景。4.1.1 实验设置基座模型。我们主要使用Qwen3-4B-Non-ThinkingYang et al., 2025a模型进行实验。学生模型初始化为Qwen3-4B-Non-Thinking而领域教师是通过在领域特定数据上分别对Qwen3-4B-Non-Thinking应用RL获得的。训练数据集。我们过滤DeepMathHe et al., 2025数据集选择难度级别大于或等于6的57K样本构成数学RL数据并使用Eurus-RL-CodeCui et al., 2025作为代码RL数据包含25K样本。然后我们分别在两个数据集上对基座模型应用RL得到领域教师Qwen3-4B-Non-Thinking-RL-Math和Qwen3-4B-Non-Thinking-RL-Code。蒸馏数据与RL数据相同。训练设置。我们应用组相对策略优化GRPOShao et al., 2024来获得领域教师。在RL中当数学推理的最终答案正确或代码生成的所有单元测试通过时给予1.0的奖励否则奖励为0.0。GRPO的详细训练超参数见附录B。之后我们在原始学生模型即Qwen3-4B-Non-Thinking上以不同的奖励缩放因子λ∈{0.0,0.25,0.5,0.75,1.0,1.25,1.5}实现G-OPD。注意λ0.0对应于初始状态Qwen3-4B-Non-Thinkingλ1.0对应于标准OPD。此处的参考模型自然地固定为Qwen3-4B-Non-Thinking。G-OPD的详细训练超参数见附录B。在GRPO和G-OPD中我们都实现了token级rollout校正Liu et al., 2025b以缓解训练-推理不匹配。我们的实验基于ver1Sheng et al., 2024框架。评估。对于数学推理的评估我们选择四个竞赛级基准AIME24AIMO, 2024、AIME25OpenCompass, 2025、HMMT252月Balunovic et al., 2025和HMMT2511月Balunovic et al., 2025。对于代码生成的评估我们选择三个测试集HumanEval、MBPPLiu et al., 2023和LiveCodeBench仅v62025年2月~2025年5月Jain et al., 2024。在所有评估中我们将温度设置为1.0top-p设置为1.0最大生成长度设置为16,384。在每个数学推理基准上我们为每个问题采样32个解而在每个代码生成基准上我们为每个问题采样4个解。然后我们报告每个模型在每个基准上的平均准确率。我们采用Math-Verify33作为基于规则的验证器来验证数学推理基准的答案正确性。4.1.2 单教师蒸馏结果我们首先在同尺寸单教师蒸馏设置中探索G-OPD中奖励缩放因子λλ的影响作为初步实验即将Qwen3-4B-Non-Thinking-RL-Math或Qwen3-4B-Non-Thinking-RL-Code蒸馏回Qwen3-4B-Non-Thinking。数学推理和代码生成领域的评估结果分别在图2和图3中。我们还在图4中可视化了每个模型的准确率与响应长度之间的关系以进行深入分析。我们可以得出以下结论1标准OPD可以完全恢复后训练行为。正如我们所看到的OPD产生的学生在评估准确率和响应长度上与领域教师密切匹配。2奖励插值(0λ1)产生的学生行为性能和响应长度介于基座模型和教师模型之间。此外随着λ增大性能和响应长度都单调增加接近教师的行为。这一性质可用于实现预算控制的推理Yang et al., 2025c; Liang et al., 2026。3奖励外推(λ1)优于标准OPD并有可能产生超越领域教师的学生。如观察到的具有适当奖励外推即λ1.25的ExOPD在所有设置中始终优于OPD和领域教师另见表2而过度奖励外推即λ1.5可能导致不稳定并降低性能。这可以解释为持续增加λ引入了学生通过积极拟合log比值的峰值来“黑客”Eq. (9)中隐式奖励的风险即使某些token由于偏差而具有过大的log比值。此外我们可以看到ExOPD产生的学生的响应长度继续增加这可能是由于隐式奖励的长度偏差问题Yang et al., 2025d。为了证明ExOPD相对于教师的改进不是由于教师训练不足我们比较了ExOPD和教师额外100步RL训练后的评估性能。表1中的结果表明与ExOPD用更少步数相比经过更多持续RL训练的教师改进较小。我们还展示了当教师模型经过充分RL步骤即1200 RL步训练时ExOPD的泛化性和有效性相应结果见附录C。4.1.3 多教师蒸馏结果基于上述分析我们在多教师蒸馏设置中进行实验目标是通过OPQXiao et al., 2026将通过领域特定RL从同一基座模型获得的不同领域教师的能力合并回原始基座模型。这已被证明是一种有效的多任务后训练新范式。具体来说领域教师是上述RL变体Qwen3-4B-Non-Thinking-RL-Math/Code学生模型是Qwen3-4B-Non-Thinking。从4.1.2节的初步结果可以看出ExOPD中λ1.25始终比OPQ带来更好的性能。因此在所有后续实验中我们将ExOPD的λ固定为1.25不再进行特定调优。除了OPQ我们还比较了两个基线1监督微调SFT通过交叉熵损失在教师生成的轨迹上训练学生。我们确保SFT使用的轨迹数量与OPQ和ExOPD一致。更多细节见附录B。2ExPOZheng et al., 2025一种权重外推方法。我们按照建议从{0.25,0.5}中调整外推因子α先平均所有领域教师的权重然后相对于学生模型外推权重。为了公平比较我们在OPQ和ExOPD中都将数学RL数据的样本量降权以匹配代码RL数据确保每个领域具有相同的样本量。多教师蒸馏的结果如表2所示。正如我们所看到的SFT产生次优学生而OPQ的性能上限通常受限于教师。ExPO虽然无需训练但不能确保权重外推的学生始终超越所有领域教师缺乏良好的可控性。然而我们的方法ExOPD始终优于OPQ并且是唯一能够产生一个统一学生并在所有基准上超越两个领域教师的方法。此外我们分析了ExOPD与OPQ相比的训练动态以更深入地理解ExOPD。我们将比较放在图5中。ExOPD实现了更高的训练奖励但使学生生成更长的响应长度这与图4中显示的评估结果一致。我们还观察到ExOPD训练的学生响应熵高于OPD训练的学生。我们将此归因于前者倾向于生成更长的响应增加了响应多样性。4.2 强到弱蒸馏设置中的实验OPD的另一个实际用途是强到弱蒸馏Yang et al., 2025a即将能力从较大教师蒸馏到较小学生。因此在本节中我们探索ExOPD以及额外的奖励校正实践在强到弱蒸馏设置中的有效性。4.2.1 实验设置我们选择Qwen3-30B-A3B-Instruct-2507作为教师模型并分别在Qwen3-1.7B-Non-Thinking和Qwen3-4B-Non-Thinking上进行蒸馏。我们主要在数学推理领域进行实验训练和评估数据集与4.1节相同。训练细节见附录B。在ExOPD中我们首先在默认设置4.2.2节中进行实验假设仅有两个模型可用学生基座模型和更强的教师模型。因此在此默认设置中我们将ExOPD中的参考模型设置为学生基座模型。我们还在4.2.3节中探索奖励校正技术的有效性假设可以额外访问教师的RL前变体该变体在ExOPD中充当参考模型。我们将ExOPD与标准OPD和离策略蒸馏SFT进行比较。4.2.2 强到弱蒸馏结果默认强到弱蒸馏设置下的结果如表3所示。主要结论是ExOPD可以在强到弱蒸馏中带来显著改进优于离策略蒸馏和标准OPD。表1与数学领域教师继续RL的比较。每个数值下标表示与教师模型相比的绝对改进或退化。方法AIME24AIME25HMMT25 (2月)HMMT25 (11月)平均教师58.054.632.538.946.0 继续RL100步60.92.92.955.60.50.532.80.30.338.4−0.5−0.546.90.90.9ExOPD50步62.74.74.756.11.51.533.91.41.439.30.40.448.02.02.0表2在单教师和多教师同尺寸师生配对设置中与离策略蒸馏SFT和权重外推ExPO方法的比较。“教师”代表领域教师模型的性能数学推理为Qwen3-4B-Non-Thinking-RL-Math代码生成为Qwen3-4B-Non-Thinking-RL-Code“学生”代表学生模型Qwen3-4B-Non-Thinking的初始性能。每个数值下标表示与领域教师模型相比的绝对改进或退化。方法AIME24AIME25HMMT25 (2月)HMMT25 (11月)平均HumanEvalMBPPLCB平均教师58.054.632.538.946.086.070.227.361.2学生21.521.910.08.015.474.764.717.952.4单教师蒸馏ExPO58.70.70.755.20.60.632.40.10.137.01.91.945.80.20.284.81.21.270.20.00.028.00.70.761.00.20.2OPD60.72.72.755.00.40.432.40.10.137.91.01.046.50.50.585.20.80.869.90.30.327.30.00.060.80.30.3ExOPD62.74.74.756.11.51.533.91.41.439.30.40.448.02.02.086.90.90.970.70.50.528.61.31.362.10.90.9多教师蒸馏SFT58.50.50.553.31.31.330.71.81.834.81.11.144.31.71.786.40.40.469.60.60.626.40.90.960.80.40.4ExPO57.50.50.554.50.10.131.70.80.836.32.62.645.01.01.086.70.70.772.01.81.829.01.71.762.61.41.4OPD60.62.62.654.10.50.532.50.00.038.30.60.646.40.40.484.61.41.469.50.70.727.60.30.360.60.60.6ExOPD61.03.03.056.01.41.434.41.91.939.20.30.347.71.71.786.30.30.370.60.40.429.01.71.762.00.80.8表3强到弱蒸馏设置中四个数学推理基准的评估准确率。教师模型为Qwen3-30B-A3B-Instruct-2507。数值下标表示与标准OPD相比的绝对改进或退化。方法AIME24AIME25HMMT25 (2月)HMMT25 (11月)平均教师74.762.844.257.259.7学生Qwen3-1.7B-Non-Thinking基座12.311.46.84.58.8SFT18.120.59.26.313.5OPD33.028.715.714.923.1ExOPD37.34.34.331.52.82.816.20.50.516.51.61.625.42.32.3学生Qwen3-4B-Non-Thinking基座21.521.910.08.015.4SFT45.440.922.431.635.1OPD55.048.029.837.742.6ExOPD58.73.73.750.82.82.833.03.23.238.81.11.145.32.72.7图2在不同奖励缩放因子λλ选择下四个数学推理基准上的同策略蒸馏结果。图3在不同奖励缩放因子λλ选择下三个代码生成基准上的同策略蒸馏结果。图4在不同奖励缩放因子下同策略蒸馏模型在各基准上的平均token数量和平均准确率趋势。数学推理任务的教师为Qwen3-4B-Non-Thinking-RL-Math代码生成任务的教师为Qwen3-4B-Non-Thinking-RL-Code。图5多教师蒸馏实验中OPD和ExOPD的训练动态。我们使用系数为0.5的指数移动平均EMA平滑进行可视化。