EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
arXiv · HuggingFace · ▲43
摘要(原文)
Autonomous agents are increasingly expected to improve executable policies through feedback, yet existing evaluations often collapse this process into a final score or confound it with open-ended software-engineering progress. We introduce Autonomous Policy Evolution, a controlled evaluation setting in which a harness-model agent repeatedly edits an executable policy system under a fixed interaction budget. We instantiate this setting in EvoPolicyGym, a benchmark built from compact interactive RL environments that evaluates how agents iteratively improve explored policies. On the EvoPolicyGym suite, GPT-5.5 achieves the strongest aggregate rank score and top-two performance on all 16 environments. Beyond leaderboard results, EvoPolicyGym also provides trajectory-level diagnostics that distinguish how agents allocate budget, convert feedback into parametric tuning. These analyses show that strong autonomous policy evolution depends not only on isolated task wins, but on discovering task-appropriate mechanisms and refining policies under bounded feedback.
摘要(中译)
自主智能体被越来越多地期望通过反馈来改进可执行策略,然而现有的评估通常将这个过程简化为一个最终分数,或者将其与开放式的软件工程进展相混淆。我们引入了自主策略进化(Autonomous Policy Evolution),这是一个受控的评估环境,在该环境中,一个 harness - model 智能体在固定的交互预算下反复编辑一个可执行策略系统。我们在 EvoPolicyGym 中实例化了这种环境,EvoPolicyGym 是一个从紧凑的交互式强化学习(RL)环境中构建的基准测试,用于评估智能体如何迭代地改进已探索的策略。在 EvoPolicyGym 套件上,GPT - 5.5 获得了最强的综合排名分数,并在所有 16 个环境中取得了前两名的表现。除了排行榜结果之外,EvoPolicyGym 还提供了轨迹级别的诊断,这些诊断可以区分智能体如何分配预算、如何将反馈转化为参数调整。这些分析表明,强大的自主策略进化不仅取决于孤立的任务胜利,还取决于发现适合任务的机制以及在有限的反馈下优化策略。
背景剖析
背景剖析
1. 技术背景与真实需求
自主智能体(如代码生成工具或语言模型)需要通过环境反馈持续优化自身行为,而非仅输出固定结果。例如,编程代理需根据测试失败调整代码,语言模型需通过反思改进回答质量。这类技术的核心需求是:在有限交互次数内,将反馈转化为可执行策略的迭代改进,确保策略在新场景中仍能稳定工作。
2. 之前的问题
现有评估方法存在两大缺陷:
- 结果导向的局限:仅关注最终得分,忽略改进过程中的关键问题(如盲目重试、过拟合可见反馈、忽略验证集泛化能力)。
- 开放工程的混淆:在无约束的工程任务中(如持续迭代的软件项目),评估易被“规格变更”或“维护质量”等无关因素干扰,难以单独衡量策略优化的能力。
3. 本文的解法
论文提出自主策略进化(Autonomous Policy Evolution)框架,通过以下设计解决上述问题:
- 受控基准测试:构建EvoPolicyGym,提供一组紧凑的交互式强化学习环境(如机器人控制、驾驶模拟),要求智能体在固定预算(如128轮交互)内反复编辑策略系统,并基于沙盒环境的反馈进行优化。
- 分离评估对象:将“策略进化过程”本身作为评估目标,而非直接任务执行结果。智能体需提交策略版本并接收训练反馈,但验证和测试结果仅在服务器端计算,确保评估聚焦于策略改进的效率。
- 轨迹级诊断:记录完整的“执行-反馈-修订”轨迹,分析智能体如何分配预算、诊断错误以及平衡探索与利用。
4. 与前人工作的关键差异
- 聚焦过程而非结果:传统基准(如OpenAI Gym)评估最终任务表现,而EvoPolicyGym通过隐藏的验证集衡量策略的泛化能力。
- 严格控制变量:相比开放工程基准(如软件维护任务),EvoPolicyGym限制环境变化,仅考察策略优化能力。
- 诊断性分析:提供细粒度的轨迹数据(如策略修订记录),揭示智能体如何将反馈转化为具体改进(如参数调优或结构修改)。
这一框架使研究者能更深入理解自主智能体的迭代优化机制,而不仅仅是比较最终得分。




