SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
arXiv · HuggingFace · ▲90
摘要(原文)
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
摘要(中译)
大型语言模型越来越多地被训练为用于涉及多轮交互、工具使用和环境反馈的长周期任务的交互式智能体。基于结果的强化学习(Reinforcement Learning,RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策的指导有限,在剧集级结果和标记级策略学习之间留下了监督空白。我们提出了SEED(Self - Evolving On - Policy Distillation,自进化同策略蒸馏),这是一个自进化框架,它将已完成的同策略轨迹转换为训练时的后见之明技能,并将其行为效果提炼回策略模型。SEED首先微调策略以分析已完成的轨迹,并生成捕捉可重用工作流、关键观察或避免失败规则的自然语言技能。在RL过程中,当前策略既收集轨迹,又作为从轨迹中提取后见之明技能的分析器。因此,策略更新会同时改进后续的决策制定和技能分析,使后见之明的监督能够随着策略的进化而进化。然后,SEED在普通情境和技能增强情境下重新评估采样动作,将技能引起的概率转移转换为密集的标记级同策略蒸馏信号。该信号与基于结果的RL共同优化,使辅助监督与当前轨迹分布保持一致。在基于文本和基于视觉的智能体任务上的大量实验表明,SEED持续提高了性能和样本效率,对未见过的场景表现出稳健的泛化能力。我们的代码可在https://github.com/jinyangwu/SEED获取。
背景剖析
背景剖析
1. 技术背景与真实需求
近年来,大型语言模型(LLM)逐渐从单轮对话转向多轮交互式代理任务,例如工具调用、环境反馈处理和长期规划。这类场景要求模型在多步决策中学习如何收集信息、调用工具、解释反馈并调整策略。强化学习(RL)成为优化这类代理行为的关键方法,因为它能直接根据环境反馈调整策略。然而,真实场景中奖励信号往往稀疏且延迟(例如仅在任务完成时给出成功或失败信号),导致模型难以从中间步骤中学习有效行为,从而限制了其决策能力和样本效率。
2. 先前方法的局限性
传统RL方法依赖轨迹级奖励,但无法指导中间决策(例如,一个失败的轨迹可能包含部分正确行为,而成功的轨迹可能隐藏可复用的策略)。尽管已有研究尝试通过“事后反思”(hindsight learning)提取轨迹中的经验(如总结成功模式或失败原因),但这些方法通常将反思视为静态数据或外部记忆,无法随模型能力的提升而动态调整。此外,现有方法要么依赖固定教师模型提供监督,要么需要额外的推理轨迹或提示,导致监督信号与模型当前行为脱节。
3. 本文的解决方案
论文提出的SEED框架通过“自演进在线策略蒸馏”解决了这一问题。其核心思路是让模型在强化学习过程中同时扮演“决策者”和“分析者”两个角色:
- 分析者角色:模型从已完成的轨迹中提取自然语言描述的可复用技能(如关键观察、决策规则或避错策略)。
- 决策者角色:模型根据这些技能改进后续决策,并通过蒸馏机制将技能中的行为指导转化为细粒度的token级监督信号。
通过这种自演进的循环,模型能够动态优化其行为分析和决策能力,而无需外部记忆或静态数据。
4. 与前人工作的关键差异
SEED的独特之处在于:
- 动态监督:反思信号不是固定的,而是随模型策略的改进而演化。
- 密集监督:将轨迹级的反思转化为token级的蒸馏信号,直接指导中间决策。
- 自洽性:模型在强化学习中同时完成决策和反思,避免了传统方法中教师模型与环境脱节的问题。
这种方法使得SEED在长 horizon 代理任务中表现出更高的样本效率和鲁棒性。
















