Weak-to-Strong Generalization via Direct On-Policy Distillation
arXiv · HuggingFace · ▲131
摘要(原文)
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.
摘要(中译)
强化学习与可验证奖励(reinforcement learning with verifiable rewards, RLVR)是改进语言模型推理能力的有效方法,但由于目标模型在训练期间必须生成大量滚动(rollouts),因此在每个新的强模型上重复该方法成本高昂。随着模型的扩展,训练后(post-training)本身成为瓶颈。我们研究了一种从弱到强的替代方案:在较小的模型上运行强化学习(RL),其中滚动成本更低,然后重用该强化学习运行所学到的内容来改进更强的目标模型。直接蒸馏训练后的弱教师模型是不够的,因为教师的最终策略混合了有用的强化学习收益和较小模型的局限性。我们提出了直接策略蒸馏(Direct On-Policy Distillation, Direct-OPD),它转而转移教师的强化学习诱导的策略偏移。Direct-OPD将训练后的弱教师模型与其自身的预训练(pre-RL)参考进行比较,并将它们的对数比率视为学生的密集隐式奖励。简单来说,检查点对告诉我们强化学习使弱模型更可能或更不可能采取哪些行动,而Direct-OPD将该信号应用于更强的学生模型自身的策略状态。这直接重用了弱模型的强化学习监督信号,而无需在目标模型上运行稀疏奖励的强化学习。实证表明,Direct-OPD始终利用较弱的教师模型来改进更强的目标模型;值得注意的是,它在8个A100 GPU上仅用4小时就将Qwen3-1.7B在AIME 2024上的表现从48.3%提升到58.3%。它优于步骤匹配的直接强化学习,并支持多个策略偏移的顺序组合。我们的结果表明,强化学习的结果可以作为隐式奖励信号跨模型规模重用,而不仅仅是作为最终模型来模仿。
背景剖析
背景剖析
1. 技术背景与需求
近年来,强化学习结合可验证奖励(RLVR)成为提升大语言模型推理能力的主流方法(如DeepSeek-R1、JustRL)。其核心是通过让模型在环境中生成行为(rollouts)、接收反馈并优化策略,从而增强推理表现。然而,这种方法存在显著瓶颈:模型越大,每次训练的成本越高——更大的模型生成行为更慢,且需要更多计算资源。随着模型规模持续扩大,从头开始对每个强模型重复RLVR训练变得不可行,因此亟需一种更高效的后训练方法。
2. 先前方法的局限
传统做法是直接模仿弱模型的最终策略(如“策略蒸馏”),但这一方法存在根本缺陷:弱模型的最终策略混合了RL带来的有用改进和模型自身的能力限制。例如,当目标模型(学生)已经比弱模型更强时,模仿弱模型的策略可能会覆盖学生原有的优势行为(如图1(a)所示,强模型被弱模型的策略拖垮)。此外,直接在强模型上运行RL成本高昂,而现有方法无法复用弱模型RL训练中已学到的监督信号。
3. 本文的解决方案
论文提出“直接策略蒸馏(Direct-OPD)”,其核心思想是转移弱模型RL训练带来的“策略变化”,而非弱模型本身。具体而言,通过对比弱模型在RL训练前后的行为差异(即“策略偏移”),提取RL对其行为的修改信号,并将这一信号作为隐式奖励应用于强模型(学生)的训练中。这种方法避免了在强模型上重新运行RL,同时保留了弱模型RL训练的有效监督信息。实验表明,该方法能显著提升强模型的性能(如Qwen3-1.7B在AIME 2024上的得分从48.3%提升至58.3%),且成本仅为直接RL的几分之一。
4. 与前人工作的关键差异
与传统的策略蒸馏不同,Direct-OPD不依赖弱模型的最终策略,而是聚焦于“策略变化”这一更本质的监督信号。此外,它不需要显式训练奖励模型或依赖弱模型与强模型的高重叠度,因此能跨模型规模和思维模式有效迁移。这一思路将RL的成果从“单一模型优化”转变为“可复用的跨尺度信号”,为大规模模型的高效后训练提供了新方向。













