ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
arXiv · HuggingFace · ▲84
摘要(原文)
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.
摘要(中译)
最近的视觉语言模型(VLM)和视觉-语言-动作模型(VLA)系统提升了机器人感知和动作预测能力,但长时程具身智能体仍需要一个通用的运行时层来实现推理、记忆、工具使用、验证和跨具身执行。我们提出了ABot-AgentOS,这是一个通用机器人智能体操作系统,位于低级控制器之上,为场景条件规划、上下文隔离的技能执行、多阶段验证、多模态记忆和边缘-云协作提供了一个慎思智能体层。为了评估此类系统,我们引入了EmbodiedWorldBench,这是一个可执行的基准测试,包含16个室内、室外和混合场景,四个难度级别,以及超过200个涉及导航、物体搜索、非玩家角色(NPC)对话、动态事件和基于轨迹评分的任务。ABot-AgentOS进一步引入了通用多模态图记忆,这是一个持久化的源基础基质,将对话、视觉观察、空间上下文、时间关系和任务轨迹转换为类型化的节点和边。一个由失败驱动的自我进化循环将诊断出的记忆故障转换为门控运行时进化资产,这些资产仅被提升到后续的评估分割中,防止当前分割的真实情况泄露,同时实现持续改进。在一个初始的EmbodiedWorldBench子集上,ABot-AgentOS在任务成功率和目标完成率上都优于单控制器基线。在记忆基准测试中,ABot-AgentOS静态版本在LoCoMo上得分为87.5,在OpenEQA EM-EQA上得分为59.9,在Mem-Gallery上得分为88.6,在NExT-QA上的Acc@All得分为76.5;自我进化进一步将LoCoMo提高到88.7,OpenEQA提高到60.4,Mem-Gallery提高到89.0。这些结果表明,一个通用的智能体操作系统层可以提高长时程具身执行,同时为持续交互提供持久、可审计的记忆。
背景剖析
背景剖析
1. 技术背景与真实需求
随着机器人技术的发展,人们希望AI不仅能处理数字任务(如聊天或图像识别),还能在物理世界中执行复杂、长期的任务——比如家庭服务、工业巡检或动态环境中的协作。这类“具身智能”需要解决三个核心问题:如何让机器人理解复杂指令并转化为可靠动作?如何让同一套系统适应不同形态的机器人(如人形、四足)?以及如何让机器人在长期互动中记住关键信息(比如“上次在这个房间找不到钥匙,这次应该检查抽屉”)?这些需求推动了从“单次任务执行”向“持续自主决策”的转变。
2. 先前方法的局限性
尽管视觉语言模型(VLM)和机器人控制技术取得了进展,现有系统仍存在三大瓶颈:
- 推理与执行的脱节:许多系统直接将AI模型的输出映射为动作,缺乏中间层来分解任务、验证步骤或处理错误(例如,机器人可能按指令拿起杯子,但没考虑杯子是否装满水)。
- 形态泛化能力不足:现有方案通常绑定特定硬件或环境(如只能用于实验室的机械臂),难以适应不同机器人(如从轮式机器人切换到人形机器人)。
- 记忆的局限性:传统记忆系统仅存储文本或短期数据,无法持久化关联多模态信息(如视觉观察、对话历史和空间关系),导致机器人无法从长期经验中学习(例如,忘记之前遇到的障碍物位置)。
3. 本文的解决思路
ABot-AgentOS通过三层创新突破这些限制:
- 通用机器人操作系统架构:在底层控制器(如运动控制)和高层AI模型之间插入一个“代理层”,负责任务规划、工具使用和错误恢复。这一层像一个“管家”,协调不同模块(如语音理解、视觉导航、技能调用),并支持多种机器人形态。
- 动态基准测试:设计了一个名为EmbodiedWorldBench的测试框架,包含室内、室外和混合场景的复杂任务(如与人对话、动态避障),评估机器人的长期自主能力。
- 多模态记忆系统:将机器人的经验(如对话、视觉观察、任务轨迹)存储为结构化的“图记忆”,并能通过失败分析自动优化(例如,如果机器人某次任务失败,系统会记录原因并在未来避免相同错误)。
4. 关键差异与创新点
与先前工作相比,ABot-AgentOS的核心突破在于:
- 分层解耦:将认知推理与物理执行分离,使系统更灵活且易于扩展;
- 跨形态泛化:通过插件式设计支持不同机器人硬件,而非针对单一设备优化;
- 可进化记忆:记忆不仅是存储,还能通过“失败驱动的学习”持续改进,让机器人在长期互动中变得更聪明。
这一系统为具身智能从实验室原型走向实际应用提供了基础,让机器人能够像人类一样“思考、记忆、行动并从中学习”。







