Video Generation Models are General-Purpose Vision Learners
arXiv · HuggingFace · ▲11
摘要(原文)
Driven by next-token prediction, NLP shifted from task-specific models into powerful generalist foundation models. What, then, is the equivalent catalyst needed to achieve a general-purpose model in computer vision? In this paper, we contend that large-scale text-to-video generation serves as a strong pre-training paradigm for computer vision, providing the necessary spatiotemporal priors, vision-language alignment, and scalability required for general visual intelligence. We introduce GenCeption, which leverages a pre-trained video generative diffusion backbone to define a feed-forward perception model, capable of performing various vision tasks steered by text instructions. Empirical results demonstrate that GenCeption achieves state-of-the-art performance across a diverse suite of tasks, including depth, surface normal, and camera pose estimation, expression-referring segmentation, and 3D keypoint prediction, often matching or surpassing specialized models (e.g. DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo, and Lotus-2). Furthermore, the video generative pretrained backbone outperforms alternative pretraining paradigms (e.g., V-JEPA, and Video MAE) under comparable settings. Importantly, GenCeption exhibits preliminary data and model scaling properties along with exceptional data efficiency, where it achieves comparable performance with leading models like D4RT and VGGT-Omega with 7 to 500 less training data. Finally, GenCeption also exhibits intriguing emergent behaviors: a model trained exclusively on synthetic human videos generalizes to real-world footage and out-of-distribution object categories (e.g., animals and robots). These findings suggest that video generation is not merely a synthesis tool, but a foundational path toward generalist vision intelligence for the physical world. Project page: https://genception.github.io
摘要(中译)
在下一个 token 预测的驱动下,自然语言处理(NLP)从特定任务的模型转向了强大的通用基础模型。那么,实现计算机视觉中的通用模型需要什么样的等效催化剂呢?在本文中,我们认为大规模文本到视频生成是计算机视觉的一种强大预训练范式,它提供了通用视觉智能所需的时空先验知识、视觉 - 语言对齐和可扩展性。我们引入了 GenCeption,它利用预训练的视频生成扩散主干网络来定义一个前馈感知模型,该模型能够通过文本指令执行各种视觉任务。实证结果表明,GenCeption 在一系列不同的任务中取得了最先进的性能,包括深度、表面法线、相机姿态估计、基于表达的分割和 3D 关键点预测,通常能与专业模型(例如 DepthAnything3、SAM3、D4RT、VGGT - Omega、Sapiens、David、Genmo 和 Lotus - 2)相媲美甚至超越它们。此外,在可比的设置下,视频生成预训练主干网络优于其他预训练范式(例如 V - JEPA 和 Video MAE)。重要的是,GenCeption 表现出了初步的数据和模型缩放特性以及出色的数据效率,在使用比 D4RT 和 VGGT - Omega 等领先模型少 7 到 500 倍的训练数据时,它能取得相当的性能。最后,GenCeption 还表现出有趣的涌现行为:一个仅在合成人类视频上训练的模型能够推广到真实世界的视频和分布外的对象类别(例如动物和机器人)。这些发现表明,视频生成不仅仅是一种合成工具,更是实现物理世界通用视觉智能的基础路径。项目页面:https://genception.github.io
背景剖析
背景剖析
1. 技术背景与真实需求
计算机视觉的核心目标是让机器理解物理世界,例如识别物体、估计深度、分割场景或预测运动。这类技术在自动驾驶(感知环境)、机器人(操作物体)、医疗影像(分析病灶)等领域有迫切需求。然而,现有方法通常针对单一任务设计专用模型(如分割模型、深度估计模型),导致开发成本高且难以适应复杂场景。例如,自动驾驶系统需要同时处理目标检测、路径规划和障碍物规避,而传统方法需组合多个模型,效率低下。
2. 之前的问题与局限
过去十年,视觉模型依赖“任务特定”范式:每个任务(如目标检测、语义分割)都有独立架构和训练流程。这种方法的问题在于:
- 缺乏统一性:无法像自然语言处理(NLP)中的大语言模型(LLM)那样,用一个通用模型处理多样任务。
- 忽视时空动态:现有预训练方法(如掩码自编码器、对比学习)主要处理静态图像,未充分学习视频中的时间因果关系和物理规律(如物体运动、光影变化)。
- 数据效率低:专用模型需要大量标注数据,而视频数据的收集和标注成本远高于图像。
3. 本文的解决方案
论文提出“文本到视频生成”作为视觉预训练的新范式,核心思路是:
- 利用生成模型学习通用视觉知识:通过训练模型生成高保真视频,迫使其理解3D几何、物体持久性和物理交互等时空先验。
- 结合视觉-语言对齐:生成过程以文本为条件(如“一个人跑步”),使模型天然具备理解语言指令的能力。
- 高效扩展:视频生成模型可利用大规模无标注视频数据(如互联网内容),降低标注依赖,并通过扩散模型(Diffusion Model)实现高质量生成。
论文提出的GenCeption模型进一步将预训练的视频生成 backbone 转换为通用感知模型,通过微调即可执行分割、深度估计、3D姿态预测等任务,无需修改架构。
4. 与前人工作的关键差异
与传统的“任务特定”方法或单一预训练范式(如VideoMAE、V-JEPA)相比,本文的突破在于:
- 统一性:用一个模型处理多种任务,而非为每个任务设计专用架构。
- 时空建模:通过视频生成显式学习时间动态,而不仅是静态图像特征。
- 数据效率:生成预训练模型仅需少量标注数据即可超越专用模型(如用7倍更少数据达到同等性能)。
- 涌现能力:模型在合成数据上训练后,可直接迁移到真实场景,并泛化到未见过的物体类别(如动物、机器人)。
这一范式将视频生成从“内容合成工具”提升为“通用视觉智能的基础”,为物理世界的多模态理解提供了新方向。




