PanoWorld: Real-World Panoramic Generation
arXiv · HuggingFace · ▲5
摘要(原文)
In this work, we aim to address the challenge of long-range memory in panoramic world models by exploiting the rotation-equivariant property of omnidirectional representations, where rotation can be treated as an implicit geometric transformation.Building on this insight, we propose PanoWorld, which simplifies camera trajectories into translations via fixed headings for both current-action modeling and long-range memory through Dense Panoramic Ray-Conditioning (DPRC) and Geometry-aware Memory Augmentation (GMA).Then, a three-stage training pipeline is introduced to progressively optimize each component. To better evaluate physical consistency under large-scale spatial variations and diverse illumination conditions, where existing datasets are relatively stable, we construct World360, a large-scale dataset consisting of both real-world video clips collected via panoramic unmanned aerial vehicles and high-quality simulated clips generated by AirSim360.Extensive experiments on World360 demonstrate the effectiveness of PanoWorld, outperforming alternative methods by a large margin.Our models, training code, and dataset will be publicly available. More information can be found on our project page: https://lihaoy-ux.github.io/panoworld-page/.
摘要(中译)
在这项工作中,我们旨在通过利用全景表示的旋转等变性(rotation-equivariant)来解决全景世界模型中的长程记忆挑战,其中旋转可以被视为一种隐式几何变换。基于这一见解,我们提出了PanoWorld,它通过固定航向将相机轨迹简化为平移,以通过密集全景射线条件化(Dense Panoramic Ray-Conditioning, DPRC)进行当前动作建模,并通过几何感知记忆增强(Geometry-aware Memory Augmentation, GMA)实现长程记忆。然后,引入了一个三阶段训练管道来逐步优化每个组件。为了更好地评估在大规模空间变化和多样化光照条件下的物理一致性(现有数据集相对稳定),我们构建了World360,这是一个包含通过全景无人机收集的真实世界视频剪辑和由AirSim360生成的高质量模拟剪辑的大型数据集。在World360上进行的广泛实验证明了PanoWorld的有效性,其性能大幅优于其他方法。我们的模型、训练代码和数据集将公开可用。更多信息可以在我们的项目页面上找到:https://lihaoy-ux.github.io/panoworld-page/。
背景剖析
背景剖析
1. 技术背景与真实需求
近年来,全景世界模型(panoramic world models)在机器人领域(如自动驾驶、无人机导航)和动态环境建模中展现出巨大潜力。这类技术通过捕捉全视野(full field of view)的视觉信息,帮助智能体理解周围环境并做出决策。例如,在自动驾驶中,车辆需要实时感知360度范围内的障碍物和道路变化;在无人机巡检中,需生成连续且一致的全景视频以监测环境。然而,现有方法在处理大规模空间变化(如视角旋转、光照差异)时,难以保持物理一致性(如几何结构和光照的真实感),这成为实际应用的关键瓶颈。
2. 先前方法的局限性
传统全景建模依赖记忆机制(如3D点云或KV缓存)来检索历史信息,以维持时空一致性。但这些方法基于透视投影(perspective projection)假设,忽略了全景数据(如等距柱状投影,ERP)的独特性质。例如,当视角发生旋转时,透视投影的记忆检索会因严重畸变而失效,导致生成结果出现不一致。此外,现有数据集多为室内或模拟场景,物理条件稳定,无法有效评估模型在真实复杂环境中的表现。
3. 本文的解决方案
针对上述问题,本文提出PanoWorld框架,其核心思路是利用全景表示的旋转等变性(rotation-equivariant)特性。具体来说,旋转仅改变畸变模式而不破坏场景内容,因此可以将旋转视为隐式几何变换,仅显式建模平移运动。PanoWorld通过两个模块解决关键挑战:
- Dense Panoramic Ray-Conditioning (DPRC):为全景运动建模提供密集的几何条件,确保当前动作的准确性。
- Geometry-aware Memory Augmentation (GMA):增强记忆检索的鲁棒性,提升全景空间中的时空一致性。
此外,论文设计了一个三阶段训练流程,逐步优化各组件,并构建了World360数据集,包含真实世界无人机视频和高质量模拟数据,以支持模型训练与评估。
4. 与前人工作的关键差异
与依赖透视投影假设的传统方法不同,PanoWorld直接利用全景数据的旋转等变性,简化了相机运动的建模过程。此外,World360数据集的多样性(覆盖真实世界物理变化)弥补了现有数据集的不足,使模型能在更复杂的场景中表现出色。这种从数据特性出发的设计思路,是PanoWorld区别于其他方法的核心创新。




