Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
arXiv · HuggingFace · ▲3
摘要(原文)
Embodied AI models now span vision-language-action (VLA) models and world-action models (WAMs), but practical deployment remains fragmented across model-specific Python stacks, backend assumptions, and robot-side glue code, especially on heterogeneous edge devices. Existing inference runtimes are designed mainly for request-response serving and therefore do not satisfy the runtime contract of embodied deployment: multi-rate execution inside closed-loop control, latency-first batch-1 inference on heterogeneous hardware, and extensible embodied interfaces beyond fixed token I/O. We present Embodied.cpp, a portable C++ inference runtime for embodied models. Based on an architectural analysis of representative VLA models and WAMs, Embodied.cpp captures a shared execution path and organizes it into five layers: input adapters, sequence builders, backbone execution, head plugins, and deployment adapters. The runtime provides modular multi-rate execution, latency-first fused inference, and extensible operator and I/O support, enabling deployment across heterogeneous devices, robots, and simulators through one backend abstraction. We evaluate Embodied.cpp on two VLA models, HY-VLA and pi0.5, and on a preliminary WAM benchmark using a LingBot-VA Transformer block. The VLA deployments achieve successful closed-loop execution with 100.0% and 91.0% task success rates, respectively. The WAM benchmark reduces block memory from 312.2 MiB to 88.1 MiB. These results show that Embodied.cpp improves deployment efficiency while preserving high accuracy across diverse embodied model architectures.
摘要(中译)
具身人工智能(Artificial Intelligence, AI)模型现在涵盖了视觉 - 语言 - 动作(Vision - Language - Action, VLA)模型和世界 - 动作模型(World - Action Models, WAMs),但实际部署仍然分散在特定于模型的Python栈、后端假设和机器人端粘合代码中,尤其是在异构边缘设备上。现有的推理运行时主要是为请求 - 响应服务而设计的,因此不满足具身部署的运行时契约:闭环控制内的多速率执行、异构硬件上的延迟优先的单批(batch - 1)推理以及超出固定令牌输入/输出(I/O)的可扩展具身接口。我们提出了Embodied.cpp,这是一个用于具身模型的可移植C++推理运行时。基于对代表性VLA模型和WAMs的架构分析,Embodied.cpp捕获了一个共享的执行路径,并将其组织为五个层:输入适配器、序列构建器、主干执行、头插件和部署适配器。该运行时提供模块化多速率执行、延迟优先的融合推理以及可扩展的操作符和I/O支持,通过一个后端抽象实现跨异构设备、机器人和模拟器的部署。我们在两个VLA模型HY - VLA和pi0.5上,以及使用LingBot - VA Transformer块的初步WAM基准测试中对Embodied.cpp进行了评估。VLA部署分别以100.0%和91.0%的任务成功率实现了成功的闭环执行。WAM基准测试将块内存从312.2 MiB减少到88.1 MiB。这些结果表明,Embodied.cpp在保持不同具身模型架构的高准确性的同时,提高了部署效率。
背景剖析
背景剖析
随着人工智能技术的飞速发展,具身智能(Embodied AI)已成为研究和应用的热点领域。这类技术主要应用于机器人和模拟环境中,使机器能够通过感知、决策和执行来与物理世界互动。然而,尽管学术界和工业界已经开发出大量具身模型,如视觉-语言-动作(VLA)模型和世界-动作模型(WAMs),但在实际部署中仍面临诸多挑战。
首先,具身模型的部署需要满足实时性和稳定性的要求,这要求推理系统能够在闭环控制中以不同的速率执行感知编码器、变换器主干和预测分支等组件。其次,由于硬件资源的限制,推理系统需要在异构边缘设备上实现低延迟、低抖动和小批量执行。最后,具身模型的接口需要更加灵活,以适应多模态输入和多样化输出。
然而,先前的推理运行时主要针对请求-响应服务进行设计,无法满足具身部署的需求。这些系统通常具有相对统一的令牌接口和以吞吐量为导向的优化,而具身推理则需要处理机器人和模拟器侧的依赖关系,以及自定义操作符和异构输出等问题。因此,即使是一个强大的模型也需要与Python研究代码、后端特定的推理路径、手写传感器包装器和平台特定的控制逻辑进行缝合,才能在机器人上发挥作用。
为了解决这些问题,本文提出了Embodied.cpp,一个用于具身模型的便携式C++推理运行时。该运行时通过分析代表性的VLA模型和WAMs,揭示了一个共享的执行路径,并将其组织成五个层次:输入适配器、序列构建器、主干执行、头部插件和部署适配器。这种设计使得Embodied.cpp能够在异构设备、机器人和模拟器上实现高效的部署,同时保持高准确性。
总之,Embodied.cpp的关键差异在于其针对具身部署的特定需求进行了优化,提供了一个模块化的多速率执行环境、以延迟为先的融合推理和可扩展的操作符及I/O支持。这使得具身模型能够在各种异构环境中高效部署,同时保持高准确性。

