UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
arXiv · HuggingFace · ▲68
摘要(原文)
Recent advances in multimodal foundation models and agent systems have driven GUI agents from single-platform task execution toward cross-platform interaction. However, building multi-platform GUI agents remains challenging. On one hand, high-quality and executable cross-platform interaction trajectories are still scarce, and existing data often suffer from limited platform coverage. On the other hand, different platforms exhibit distinct interaction conventions, making joint or continual training prone to behavioral pattern mixing, platform-specific capability degradation, and catastrophic forgetting. To address these challenges, we construct Uni-GUI, a high-quality cross-platform GUI interaction dataset, and propose UI-MOPD, the first method that incorporates multi-teacher on-policy distillation into continual learning for GUI agents. UI-MOPD dynamically selects a platform-specific teacher according to the current environment and transfers platform-specific behavioral priors to a shared policy through platform-conditioned distillation, enabling adaptation to new platforms while preserving capabilities on existing ones. Experiments on OSWorld and MobileWorld show that UI-MOPD achieves task success rates of 38.2% and 12.0%, respectively, demonstrating its effectiveness in balancing cross-platform capability retention and new-platform adaptation. Project page: https://elispectre.github.io/UI-MOPD/.
摘要(中译)
多模态基础模型和智能体系统的最新进展已推动图形用户界面(GUI)智能体从单平台任务执行向跨平台交互发展。然而,构建多平台GUI智能体仍然具有挑战性。一方面,高质量且可执行的跨平台交互轨迹仍然稀缺,现有数据通常存在平台覆盖范围有限的问题。另一方面,不同平台表现出不同的交互惯例,使得联合或持续训练容易出现行为模式混合、平台特定能力退化和灾难性遗忘。为应对这些挑战,我们构建了Uni - GUI,这是一个高质量的跨平台GUI交互数据集,并提出了UI - MOPD,这是首个将多教师在策略蒸馏纳入GUI智能体持续学习的方法。UI - MOPD根据当前环境动态选择一个平台特定的教师,并通过平台条件蒸馏将平台特定的行为先验转移到共享策略中,从而在适应新平台的同时保留现有平台的能力。在OSWorld和MobileWorld上的实验表明,UI - MOPD分别实现了38.2%和12.0%的任务成功率,这证明了其在平衡跨平台能力保留和新平台适应方面的有效性。 项目页面:https://elispectre.github.io/UI - MOPD/。
背景剖析
背景剖析
1. 技术背景与真实需求
随着多模态基础模型(如Qwen-VL、Claude)和智能体系统的进步,GUI(图形用户界面)代理逐渐成为连接人工智能与现实数字环境的关键工具。这类代理需要理解屏幕内容、规划操作步骤,并通过点击、输入等界面动作完成用户任务(例如自动化办公、跨平台应用操作)。然而,现实工作流常涉及计算机、手机和网页等多异构环境,要求代理在适应新平台的同时保留原有平台的交互习惯(比如电脑上关闭窗口和手机上返回上一页的操作逻辑不同)。因此,如何让一个通用的GUI代理持续适应不同平台,同时不丢失特定平台的行为模式,成为核心挑战。
2. 之前的问题与瓶颈
早期研究主要依赖单平台数据或简单混合多平台信号,但存在两大局限:
- 数据质量不足:现有数据集(如OpenCUA)多为单平台场景,且包含无效动作或状态-动作对齐错误,难以支持跨平台训练。
- 行为模式混淆:直接合并不同平台的行为信号(如电脑和手机的导航逻辑)会导致策略“平均化”,在持续学习中遗忘已学到的平台特定行为(例如手机滑动与电脑滚动的差异被忽略)。
这些瓶颈使得传统方法无法平衡“适应新平台”与“保留旧能力”的需求。
3. 本文的解决方案
论文提出UI-MOPD方法,核心思路是引入多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation):
- 动态教师选择:根据当前环境(如电脑或手机)选择对应的“平台专家”(教师模型),将特定平台的行为模式蒸馏到一个共享策略中。
- 行为锚点机制:每个教师模型作为稳定锚点,确保共享策略在学习新平台时不会混淆不同平台的交互习惯(例如保留电脑的窗口管理逻辑,同时适应手机的触摸手势)。
此外,团队构建了Uni-GUI数据集,通过统一的数据收集框架从电脑和手机环境中获取高质量跨平台轨迹,解决了数据稀缺问题。
4. 与前人工作的关键差异
与以往方法(如混合监督微调或模型合并)不同,UI-MOPD的关键创新在于:
- 环境感知的蒸馏:不是简单聚合数据,而是动态匹配教师模型与环境,避免行为模式混合。
- 持续学习优化:通过保留平台特定行为的“锚点”,缓解灾难性遗忘问题,实现新旧平台能力的平衡提升。
实验表明,UI-MOPD在OSWorld(电脑)和MobileWorld(手机)任务中分别达到38.2%和12.0%的成功率,显著优于基线模型,验证了其在跨平台适应与能力保留上的有效性。




