Orca: The World is in Your Mind
arXiv · HuggingFace · ▲234
摘要(原文)
We introduce Orca, an initial instantiation of a general world foundation model. Orca learns a unified world latent space from multimodal world signals and exposes it through multimodal readout interfaces. Rather than optimizing isolated next-token, next-frame, or next-action prediction, we are centered on Next-State-Prediction modeling, offering a unified state-transition modeling route toward understanding, predicting, and acting upon the world. Orca learns through two complementary paradigms: unconscious learning captures dense natural state transitions from continuous videos, and conscious learning models sparse meaningful state transitions by language-described events and VQA supervision. For pre-training, we construct a large-scale world-learning inventory data, including 125K hours of video data and 160M event annotations. After pre-training, Orca learns a unified world latent space. To examine whether the learned latent supports downstream, we evaluate it by three representative downstream readouts: text generation, image prediction, and embodied action generation. Orca's backbone is frozen, and only the lightweight modality-specific decoders are trainable. Experiments show the scalability of the proposed paradigm and verify that stronger world latent enables stronger downstream readouts. Orca outperforms similar-sized specialized baselines. These results show that Orca, as a general world foundation model, presents a promising approach to understanding, predicting, and acting upon the world. Finally, we discuss the current limitations, aiming to provide useful insights and inspiration for the community.
摘要(中译)
我们介绍了Orca,这是一个通用世界基础模型的初步实例化。Orca从多模态世界信号中学习统一的世界潜在空间,并通过多模态读出接口将其暴露出来。我们没有优化孤立的下一token、下一帧或下一动作预测,而是专注于Next-State-Prediction建模,提供了一种统一的状态转换建模路径,以理解、预测和对世界采取行动。Orca通过两种互补的范式学习:无意识学习从连续视频中捕获密集的自然状态转换,而有意识学习通过语言描述的事件和VQA监督来建模稀疏的有意义的状态转换。对于预训练,我们构建了一个大规模的世界学习库存数据,包括125K小时的视频数据和160M的事件注释。预训练后,Orca学习了一个统一的世界潜在空间。为了检查学习到的潜在空间是否支持下游任务,我们通过三个代表性的下游读出进行评估:文本生成、图像预测和具身动作生成。Orca的骨干网络被冻结,只有轻量级的特定于模态的解码器是可训练的。实验证明了所提范式的可扩展性,并验证了更强的世界潜在空间能够实现更强的下游读出。Orca优于类似大小的专门基线。这些结果表明,作为通用世界基础模型的Orca,为理解、预测和对世界采取行动提供了一种有前景的方法。最后,我们讨论了当前的局限性,旨在为社区提供有用的见解和灵感。
背景剖析
背景剖析
1. 技术背景
通用人工智能(AGI)的核心挑战之一是让模型像人类一样持续学习并理解世界。现实中,我们需要一种系统能从视觉、语言、动作等多模态信号中构建对世界的统一认知,并基于这种认知进行预测和决策。例如,机器人需要理解物理规律(如物体运动)、因果关系(如“开灯会导致房间变亮”),甚至跨领域知识(如科学原理或社会规则)。这类技术旨在打造一个能自主进化、适应复杂环境的智能体,最终超越人类在特定任务上的认知局限。
2. 之前的问题
传统方法(如仅优化“下一个词预测”“下一帧生成”或“下一步动作预测”)存在明显不足:它们孤立地处理单一任务,缺乏对世界动态的统一建模。例如,语言模型擅长生成文本,但难以理解图像中的物理交互;视频预测模型能生成画面,却无法关联语义意图。此外,这些方法依赖大量标注数据,而真实世界中许多关键信号(如无监督的视频流或稀疏的事件描述)未被充分利用。因此,现有模型无法泛化到未见过的新场景或跨领域任务。
3. 本文的解法
Orca 提出通过“状态转移建模”解决这一问题。它从两类信号中学习世界的潜在状态:
- 无监督学习:从连续视频中捕捉自然、密集的状态变化(如物体移动或场景转换),无需人工标注。
- 有监督学习:通过语言描述的事件(如“人打开门”)和视觉问答(VQA)监督,学习与决策相关的稀疏但有意义的状态转移。
这种方法让 Orca 构建一个统一的潜在空间,支持文本生成、图像预测和机器人动作生成等下游任务。实验表明,随着模型规模和数据量增加,其性能持续提升,且优于同类专用模型。
4. 切入角度
与以往工作不同,Orca 不追求单一任务的“最优性能”,而是聚焦于“世界建模的通用性”。其关键创新在于:
- 双学习范式:结合无监督的自然动态学习和有监督的任务导向学习,平衡数据效率与认知深度。
- 冻结主干网络:仅训练轻量级的模态特定解码器,避免过拟合,确保潜在空间的泛化能力。
- 大规模多模态数据:构建包含 125K 小时视频和 1.6 亿事件标注的数据集,覆盖多样化场景。
这种设计使 Orca 成为迈向通用世界基础模型的第一步,为未来 AGI 的发展提供了新方向。




