KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
arXiv · HuggingFace · ▲56
摘要(原文)
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.
摘要(中译)
OpenClaw 已经成为复杂任务自动化的领先智能体框架,但它面临着跨平台图形用户界面(GUI)交互支持不足以及完善的自我进化机制缺失的问题。这些缺陷限制了它对多样化设备生态系统的适应能力,并且阻碍了通过从执行经验中持续学习来提升性能。为了解决这些问题,我们针对个人助理提出了“深度认知,完美行动”(Know Deeply, Act Perfectly)范式,该范式认为积累的用户交互和任务执行经验直接提高执行准确性和效率,将认知理解和操作执行统一起来。基于这一范式,我们引入了 KnowAct - GUIClaw,这是一种新颖的“认知 - 规划 - 行动 - 反思”(Know - Route - Act - Reflect)框架,旨在解决 OpenClaw 的 GUI 操作缺陷,并突破其跨平台和递归自我改进的限制。首先,宿主智能体利用积累的交互经验和与任务相关的知识进行长周期任务分解和分配(认知(Know))。其次,一个具有可归因于经验的记忆系统(认知(Know))和自我进化的技能库(行动(Act))的可插拔 GUI 子智能体,能够实现无缝的跨平台迁移和快速路径集成。特别是,该框架持续存储用户配置文件和反馈,以提高任务分解和工具调用的准确性。在安卓(Android)、苹果操作系统(iOS)、鸿蒙操作系统(HarmonyOS)和Windows 上的大量实验表明,KnowAct - GUIClaw 实现了卓越的效率、准确性和跨平台适应性。特别是,使用开源的金米 - 2.6(Kimi - 2.6)模型的 GUIClaw 在长周期的移动世界(MobileWorld)基准测试中取得了最佳性能(64.1%),击败了所有的智能体框架和闭源智能体模型,例如种子 - 2.0 - 专业版(Seed - 2.0 - Pro)和GPT - 5.5。此外,我们的框架支持的知识型记忆和执行技能可以在不同的基础模型之间转移,使用金米 - 2.6(Kimi - 2.6)时性能提高了8.5%。
背景剖析
背景剖析
1. 技术背景与真实需求
随着大语言模型(LLM)代理从简单对话工具发展为长期运行的个人助手,用户对其能力的需求已超越文本交互,延伸至图形用户界面(GUI)操作。例如,助手需要帮助用户在手机应用间迁移数据、处理权限弹窗、或在登录环境中执行多步骤工作流。这类任务无法通过标准化的API完成,必须依赖对动态GUI的理解与交互。然而,现有GUI代理(如AppAgent、Mobile-Agent等)仅能处理单一模态的视觉输入(如屏幕截图),难以应对跨应用、跨设备的复杂场景,更无法从历史经验中学习以提升效率。
2. 先前方法的局限性
传统GUI代理存在四大缺陷:首先,高阶指令常涉及多个应用,但自由文本描述无法保留跨应用所需的中间数据,导致任务中断;其次,GUI观察数据(如截图、操作轨迹)是碎片化的,主机代理需额外记录历史信息以指导轻量级GUI执行器;第三,任务完成后轨迹数据被丢弃,重复执行时需重新学习已知模式;最后,大多数GUI工作流未整合非视觉快捷方式(如系统意图、深度链接),且这些快捷方式无法安全复用为长期技能。
3. 本文的解决方案
KnowAct-GUIClaw通过“知深行准”(Know Deeply, Act Perfectly)范式解决上述问题。其核心设计是将任务分解为“主机代理-GUI执行器”协作模式:主机负责高层决策(如任务分配、工具调用),GUI执行器专注于视觉交互(如截图解析、动作执行)。具体创新包括:
- 分层协作机制:主机与执行器通过标准化接口交互,支持任务恢复和进度跟踪,避免重复探索;
- 知识驱动的路由与信息传递:根据任务类型(单应用/跨应用)动态分配资源,并通过共享数据板传递结构化信息;
- 技能库与自进化:将成功轨迹提炼为可复用的参数化技能(如点击-输入模式或系统意图),并通过反思机制持续优化;
- 跨平台适应性:通过经验归因记忆和技能验证机制,支持Android、iOS等多设备部署。
4. 与前人工作的关键差异
与传统单一GUI代理不同,KnowAct-GUIClaw强调“认知-执行”协同:主机代理利用全局上下文(如用户画像、历史任务)进行决策,而GUI执行器仅处理视觉层面的细节。此外,它首次将技能库与记忆系统结合,使代理能够从经验中学习并迭代优化,而非每次任务都从头开始。实验表明,该方法在MobileWorld基准测试中超越现有框架(如Seed-2.0-Pro),并支持跨模型迁移(如Kimi-2.6),证明了其通用性和高效性。








