RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
arXiv · HuggingFace · ▲76
摘要(原文)
Scaling robot learning requires massive, diverse trajectory data, yet collection is currently bottlenecked by physical teleoperation, where every demonstration binds operator time to specific hardware and workspaces. We introduce digital teleoperation, a paradigm that decouples data collection from physical constraints by replacing the real robot with a generative world model. In this framework, an operator's hand-pose stream drives a robot-centric generative world model to synthesize high-fidelity egocentric videos from a single reference image. The recorded pose stream serves as an embodiment-agnostic action label transferable to any target robot via standard retargeting, yielding complete state-action trajectories for imitation learning independent of physical hardware. We instantiate this paradigm in RynnWorld-Teleop, a system that integrates depth-aware skeletal conditioning, progressive human-to-robot training on a video Diffusion Transformer, and streaming autoregressive distillation. This pipeline compresses the generative process into a single-pass inference, enabling 40+ FPS, real-time interactive generation on a single H100 GPU. Policies trained exclusively on RynnWorld-Teleop-generated data achieve effective zero-shot Sim2Real transfer across dexterous and diverse bimanual tasks. Moreover, augmenting real-world datasets with our digitally teleoperated data consistently improves success rates, demonstrating that RynnWorld-Teleop serves as a high-fidelity, scalable data engine for the next generation of robotic agents.
摘要(中译)
扩展机器人学习需要大量、多样的轨迹数据,然而目前数据收集受限于物理遥操作(physical teleoperation),在这种方式中,每个演示都将操作员的时间与特定硬件和工作空间绑定。我们引入数字遥操作(digital teleoperation),这是一种通过用生成式世界模型(generative world model)替代真实机器人,将数据收集与物理约束解耦的范式。在这个框架中,操作员的手部姿态流驱动以机器人为中心的生成式世界模型,从单张参考图像合成高保真度的第一人称视角视频。记录的姿态流作为与实体无关的动作标签,可通过标准重定向(retargeting)转移到任何目标机器人,从而生成独立于物理硬件的完整状态 - 动作轨迹,用于模仿学习。我们在RynnWorld - Teleop中实现了这一范式,该系统集成了深度感知的骨骼条件作用、基于视频扩散Transformer(video Diffusion Transformer)的人类到机器人的渐进式训练以及流式自回归蒸馏。这个流程将生成过程压缩为单次推理,使得在单个H100 GPU上能够实现每秒40帧以上的实时交互式生成。仅在RynnWorld - Teleop生成的数据上训练的策略能够在灵巧和多样的双手任务中实现有效的零样本Sim2Real(Sim2Real)迁移。此外,用我们通过数字遥操作生成的数据增强真实世界数据集,成功率持续提高,这表明RynnWorld - Teleop是下一代机器人智能体的高保真度、可扩展的数据引擎。
背景剖析
背景剖析
1. 技术背景与需求
机器人学习需要大量多样化的数据来提升性能,但物理世界中的数据收集效率极低——传统遥操作(如用机械臂或VR设备控制真实机器人)受限于硬件成本、环境重置时间和物体多样性不足等问题。例如,训练一个能灵活操作日常物品的机器人,需要反复手动摆放物体并记录操作轨迹,这既耗时又难以覆盖复杂场景。数字遥操作的目标是通过生成式模型替代真实机器人,让操作员仅通过手势或动作就能“虚拟”控制机器人,从而突破物理限制,快速生成大规模训练数据。
2. 先前方法的局限
现有研究存在三个核心问题:
- 被动观察而非主动控制:早期方法(如将人类视频转换为机器人视角)仅生成图像,但无法记录真实的动作序列(如关节运动),导致数据无法直接用于模仿学习。
- 人形而非机器人视角:部分模型生成的视频仍以人类手部为中心,而非机器人的感知视角,导致“外观像机器人但行为不匹配”的矛盾。
- 非实时性:复杂的生成模型(如Diffusion Transformer)无法实时响应操作员的动作,破坏了遥操作的交互性。
3. 本文的解决方案
RynnWorld-Teleop通过三个创新设计解决了这些问题:
- 机器人中心化的动作捕捉:将操作员的手势映射到机器人的关节空间,并通过深度感知渲染生成高保真视频,确保动作与视觉观测严格对齐。
- 渐进式跨域训练:先在人类视频上学习通用操作知识,再通过人机配对数据调整到机器人视角,消除“外观-行为”差距。
- 实时流式生成:采用因果推理和滚动一致性策略,让模型在单次推理中完成长时程任务生成,支持40帧/秒的实时交互。
4. 与前人工作的关键差异
与现有方法相比,RynnWorld-Teleop是首个同时满足以下三点的技术:
- 动作可解释性:生成的视频直接对应可迁移的关节级动作标签,而非仅图像。
- 机器人视角:所有生成内容均从机器人的感知角度出发,确保数据可直接用于训练。
- 实时交互性:操作员能即时看到动作结果并调整策略,支持复杂任务的连续执行。
这一框架将数据收集从“依赖物理硬件”转变为“依赖操作员想象力”,为机器人学习提供了可扩展的高保真数据引擎。




