Orca: The World is in Your Mind
arXiv · HuggingFace · ▲230
摘要(原文)
We introduce Orca, an initial instantiation of a general world foundation model. Orca learns a unified world latent space from multimodal world signals and exposes it through multimodal readout interfaces. Rather than optimizing isolated next-token, next-frame, or next-action prediction, we are centered on Next-State-Prediction modeling, offering a unified state-transition modeling route toward understanding, predicting, and acting upon the world. Orca learns through two complementary paradigms: unconscious learning captures dense natural state transitions from continuous videos, and conscious learning models sparse meaningful state transitions by language-described events and VQA supervision. For pre-training, we construct a large-scale world-learning inventory data, including 125K hours of video data and 160M event annotations. After pre-training, Orca learns a unified world latent space. To examine whether the learned latent supports downstream, we evaluate it by three representative downstream readouts: text generation, image prediction, and embodied action generation. Orca's backbone is frozen, and only the lightweight modality-specific decoders are trainable. Experiments show the scalability of the proposed paradigm and verify that stronger world latent enables stronger downstream readouts. Orca outperforms similar-sized specialized baselines. These results show that Orca, as a general world foundation model, presents a promising approach to understanding, predicting, and acting upon the world. Finally, we discuss the current limitations, aiming to provide useful insights and inspiration for the community.
摘要(中译)
我们介绍了Orca,这是一个通用世界基础模型的初步实例化。Orca从多模态世界信号中学习统一的世界潜在空间,并通过多模态读出接口将其暴露出来。我们没有优化孤立的下一token、下一帧或下一动作预测,而是专注于Next-State-Prediction建模,提供了一种统一的状态转换建模路径,以理解、预测和对世界采取行动。Orca通过两种互补的范式学习:无意识学习从连续视频中捕获密集的自然状态转换,而有意识学习通过语言描述的事件和VQA监督来建模稀疏的有意义的状态转换。对于预训练,我们构建了一个大规模的世界学习库存数据,包括125K小时的视频数据和160M的事件注释。预训练后,Orca学习了一个统一的世界潜在空间。为了检查学习到的潜在空间是否支持下游任务,我们通过三个代表性的下游读出进行评估:文本生成、图像预测和具身动作生成。Orca的骨干网络被冻结,只有轻量级的特定于模态的解码器是可训练的。实验证明了所提范式的可扩展性,并验证了更强的世界潜在空间能够实现更强的下游读出。Orca优于类似大小的专门基线。这些结果表明,作为通用世界基础模型的Orca,为理解、预测和对世界采取行动提供了一种有前景的方法。最后,我们讨论了当前的局限性,旨在为社区提供有用的见解和灵感。
背景剖析
背景剖析
1. 技术背景与真实需求
当前人工智能的应用场景正从单一任务(如文本生成或图像识别)向更复杂的“理解并互动于真实世界”扩展。例如,机器人需要根据视觉观察和语言指令完成操作,自动驾驶系统需整合摄像头、雷达和环境描述来决策,而虚拟助手则需结合用户行为和语义理解提供个性化服务。这些场景的核心需求是:让AI具备像人类一样的世界认知能力——能够从多模态信号(视觉、语言、动作等)中学习世界的运行规律,并基于这些规律预测未来状态、规划行动。然而,现有方法往往局限于特定任务(如下一个词预测、下一帧生成),缺乏对世界本质的统一建模。
2. 之前的问题与局限
传统AI模型(如Next-Token-Prediction或Next-Frame-Prediction)的缺陷在于:
- 碎片化学习:它们针对单一模态或任务优化(如仅处理文本或图像),无法捕捉不同信号间的关联(例如,视频中的动作与语言指令的关系)。
- 缺乏动态建模:多数模型依赖静态数据或人工标注,难以从连续、无标签的真实世界数据(如长时间视频)中学习自然的状态变化规律。
- 任务导向而非世界导向:它们的目标是完成任务(如生成图像)而非理解世界本身,因此无法迁移到未见过的场景或任务。
这些问题导致模型在复杂、开放的环境中表现受限,例如机器人无法应对意外情况,或助手无法理解隐含的用户意图。
3. 本文的解法:Orca的设计思路
Orca通过“世界潜在空间”(World Latent Space)的概念解决上述问题。其核心思想是:
- 统一多模态学习:从视频、图像、语言等多模态数据中学习一个共享的潜在表示,这个表示能编码世界的状态(如物体的位置、动作的后果)。
- 两种互补学习范式:
- 无监督学习:从连续视频中学习“自然状态转移”,例如一个人开门后拿起钥匙的动作序列,模型通过预测下一帧来内化这种动态规律。
- 有监督学习:通过语言描述的稀疏事件(如“机器人捡起杯子”)学习“有意义的状态转移”,将语言逻辑与视觉观察关联。
- 下游任务验证:通过冻结主干模型、仅训练轻量级解码器(如文本生成、图像预测),验证潜在空间的通用性。实验表明,潜在空间越强,下游任务表现越好。
4. 与前人工作的关键差异
Orca的创新在于:
- 从“任务导向”到“世界导向”:不同于专注于单一任务的模型(如GPT-54仅优化文本生成),Orca的目标是建模世界的潜在规律,从而支持多种下游任务。
- 双范式结合:将无监督的自然动态学习与有监督的语言条件学习结合,既捕捉真实世界的连续性,又利用人类的逻辑指导。
- 可扩展性验证:通过大规模数据(125K小时视频+1.6亿事件标注)证明,模型性能随数据量和规模提升而增强,而非依赖任务特定的优化。
总之,Orca的提出标志着向“通用世界基础模型”迈出第一步,其核心是通过统一的状态转移建模,让AI真正理解并互动于复杂世界。



