Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
arXiv · HuggingFace · ▲25
摘要(原文)
We present Xiaomi-Robotics-1, a foundational vision-language-action (VLA) model capable of (1) following diverse language instructions to perform a wide range of mobile manipulation tasks in unseen environments out-of-the-box, and (2) efficiently adapting to novel downstream tasks with minimal fine-tuning data. We propose a two-stage training recipe consisting of pre-training and post-training. During pre-training, we imbue the model with broad and generalizable action-generation capabilities by training on over 100k hours of real-world manipulation trajectories collected via UMI devices. Crucially, we develop a scalable auto-labeling pipeline that annotates trajectory clips with natural languages describing scene state transitions, providing rich and precise conditioning for action learning. During post-training, we aim to align these capabilities with robot embodiments and imperative instructions that humans naturally use to prompt robots. Extensive experiments demonstrate strong scaling behavior. Xiaomi-Robotics-1 consistently improves with increased data scales and model sizes during pre-training. This scaling behavior directly transfers to post-training, where a stronger pre-training model yields better out-of-the-box real-robot performance in unseen environments. Furthermore, Xiaomi-Robotics-1 serves as a strong robot foundation policy that can be efficiently fine-tuned on complex, dexterous tasks with high data efficiency. Across multiple simulation benchmarks, Xiaomi-Robotics-1 outperforms state-of-the-art methods. Notably, it establishes a new state-of-the-art with a 57.6% success rate on RoboCasa365, surpassing the previous best of 46.6%. Furthermore, it achieves an average score of 20.07 on RoboDojo, significantly outperforming the prior state-of-the-art (13.07). Code and model checkpoints will be released. Project page: https://robotics.xiaomi.com/xiaomi-robotics-1.html
摘要(中译)
我们提出了Xiaomi-Robotics-1,这是一个基础的视觉-语言-动作(vision-language-action,VLA)模型,能够(1)开箱即用地遵循多样化的语言指令,在未见过的环境中执行广泛的移动操作任务,以及(2)通过最少的微调数据高效地适应新的下游任务。我们提出了一个包括预训练和后训练的两阶段训练方案。在预训练阶段,我们通过在超过10万小时的真实世界操作轨迹上进行训练,赋予模型广泛且可推广的动作生成能力,这些轨迹是通过UMI设备收集的。关键的是,我们开发了一个可扩展的自动标记流水线,该流水线使用描述场景状态转换的自然语言对轨迹片段进行标注,为动作学习提供了丰富而精确的条件。在后训练阶段,我们的目标是将这些能力与机器人实体以及人类自然用来提示机器人的命令式指令对齐。大量的实验表明了强大的扩展行为。Xiaomi-Robotics-1在预训练期间随着数据规模和模型大小的增加而持续改进。这种扩展行为直接转移到后训练阶段,其中更强的预训练模型在未见过的环境中开箱即用的真实机器人性能更好。此外,Xiaomi-Robotics-1作为一个强大的机器人基础策略,可以在复杂、灵巧的任务上高效地进行微调,具有高数据效率。在多个模拟基准测试中,Xiaomi-Robotics-1超越了最先进的方法。值得注意的是,它在RoboCasa365上以57.6%的成功率建立了新的最佳水平,超过了之前最好的46.6%。此外,它在RoboDojo上取得了平均20.07的分数,显著优于之前的最佳水平(13.07)。代码和模型检查点将被发布。项目页面:https://robotics.xiaomi.com/xiaomi-robotics-1.html。
背景剖析
要理解这篇论文的背景,我们可以从四个维度展开:
1. 技术背景与真实需求
视觉-语言-动作(VLA)模型是机器人领域的核心技术,目标是让机器人通过理解人类语言指令(如“把水杯放到桌子上”),结合视觉感知环境,自主执行复杂的操作任务。这类技术直接服务于家庭服务、工业自动化等场景,例如让扫地机器人避开障碍物、仓储机器人分拣货物,或家庭助手完成家务。其核心需求是让机器人在未见过的新环境中灵活应对多样化任务,而无需针对每个场景重新编程。
2. 之前的瓶颈
传统方法的局限在于数据获取的高成本和低效率。机器人操作的数据通常依赖人工远程操控(teleoperation)收集,这需要耗费大量时间和硬件资源,且数据往往集中在少数任务和环境中(比如只在实验室里训练开门动作)。这种数据稀缺性导致模型难以泛化到新场景,例如换一个房间或换成不同类型的机械臂时,性能会显著下降。此外,手动标注数据(如给视频片段加上文字说明“拿起红色杯子并移动到右侧”)耗时巨大,无法支撑大规模训练。
3. 本文的解决方案
论文提出了“两阶段训练”策略:
- 第一阶段(预训练):利用小米自主研发的UMI设备(类似机械臂)收集了超过10万小时的真实操作数据,并开发了一套自动化标注工具。该工具通过预训练的视觉-语言模型(如CLIP)自动生成场景变化的文字描述(例如“从混乱的桌面变为整洁状态”),从而高效地为数据打标签。模型通过这些数据学习“如何根据语言指令改变环境状态”。
- 第二阶段(后训练):用额外的1万小时跨机器人数据微调模型,使其适应不同硬件(如从UMI机械臂转到家用机器人),并学会理解人类的直接指令(如“帮我拿杯水”)。实验表明,这种大规模预训练显著提升了模型在新环境中的零样本性能(无需额外训练即可完成任务)。
4. 与前人的关键差异
- 数据规模与自动化:以往研究难以获得如此大规模的真实世界数据,且依赖手动标注;本文通过自动化工具解决了这一难题。
- 训练范式:借鉴大语言模型的“预训练-微调”模式,首次将这一思路系统性地应用于机器人VLA模型,证明了“数据越多、模型越强”的规律同样适用于机器人领域。
- 实用性:模型不仅能在模拟环境中表现优异(如在RoboCasa365基准测试中超越前代40%),还能直接部署到真实机器人上执行复杂任务(如整理行李箱)。
简而言之,这篇论文的核心突破是通过大规模自动化数据训练,让机器人真正具备了“听懂指令、灵活操作、适应新环境”的能力,为通用机器人助手的实现铺平了道路。











