🌊 Tide

资讯如潮汐。我们挑出值得研究的浪,并认真讲解它。

English

← 今日潮汐

发表于 2026-07-10 · Insta360 · Haoyuan Li, Dizhe Zhang, Yuemei Zhou 等

PanoWorld: Real-World Panoramic Generation

arXiv · HuggingFace · ▲5

摘要(原文)

In this work, we aim to address the challenge of long-range memory in panoramic world models by exploiting the rotation-equivariant property of omnidirectional representations, where rotation can be treated as an implicit geometric transformation.Building on this insight, we propose PanoWorld, which simplifies camera trajectories into translations via fixed headings for both current-action modeling and long-range memory through Dense Panoramic Ray-Conditioning (DPRC) and Geometry-aware Memory Augmentation (GMA).Then, a three-stage training pipeline is introduced to progressively optimize each component. To better evaluate physical consistency under large-scale spatial variations and diverse illumination conditions, where existing datasets are relatively stable, we construct World360, a large-scale dataset consisting of both real-world video clips collected via panoramic unmanned aerial vehicles and high-quality simulated clips generated by AirSim360.Extensive experiments on World360 demonstrate the effectiveness of PanoWorld, outperforming alternative methods by a large margin.Our models, training code, and dataset will be publicly available. More information can be found on our project page: https://lihaoy-ux.github.io/panoworld-page/.

摘要(中译)

在这项工作中,我们旨在通过利用全景表示的旋转等变性(rotation-equivariant)来解决全景世界模型中的长程记忆挑战,其中旋转可以被视为一种隐式几何变换。基于这一见解,我们提出了PanoWorld,它通过固定航向将相机轨迹简化为平移,以通过密集全景射线条件化(Dense Panoramic Ray-Conditioning, DPRC)进行当前动作建模,并通过几何感知记忆增强(Geometry-aware Memory Augmentation, GMA)实现长程记忆。然后,引入了一个三阶段训练管道来逐步优化每个组件。为了更好地评估在大规模空间变化和多样化光照条件下的物理一致性(现有数据集相对稳定),我们构建了World360,这是一个包含通过全景无人机收集的真实世界视频剪辑和由AirSim360生成的高质量模拟剪辑的大型数据集。在World360上进行的广泛实验证明了PanoWorld的有效性,其性能大幅优于其他方法。我们的模型、训练代码和数据集将公开可用。更多信息可以在我们的项目页面上找到:https://lihaoy-ux.github.io/panoworld-page/。

背景剖析

背景剖析

1. 技术背景与真实需求
近年来,全景世界模型(panoramic world models)在机器人领域(如自动驾驶、无人机导航)和动态环境建模中展现出巨大潜力。这类技术通过捕捉全视野(full field of view)的视觉信息,帮助智能体理解周围环境并做出决策。例如,在自动驾驶中,车辆需要实时感知360度范围内的障碍物和道路变化;在无人机巡检中,需生成连续且一致的全景视频以监测环境。然而,现有方法在处理大规模空间变化(如视角旋转、光照差异)时,难以保持物理一致性(如几何结构和光照的真实感),这成为实际应用的关键瓶颈。

2. 先前方法的局限性
传统全景建模依赖记忆机制(如3D点云或KV缓存)来检索历史信息,以维持时空一致性。但这些方法基于透视投影(perspective projection)假设,忽略了全景数据(如等距柱状投影,ERP)的独特性质。例如,当视角发生旋转时,透视投影的记忆检索会因严重畸变而失效,导致生成结果出现不一致。此外,现有数据集多为室内或模拟场景,物理条件稳定,无法有效评估模型在真实复杂环境中的表现。

3. 本文的解决方案
针对上述问题,本文提出PanoWorld框架,其核心思路是利用全景表示的旋转等变性(rotation-equivariant)特性。具体来说,旋转仅改变畸变模式而不破坏场景内容,因此可以将旋转视为隐式几何变换,仅显式建模平移运动。PanoWorld通过两个模块解决关键挑战:
- Dense Panoramic Ray-Conditioning (DPRC):为全景运动建模提供密集的几何条件,确保当前动作的准确性。
- Geometry-aware Memory Augmentation (GMA):增强记忆检索的鲁棒性,提升全景空间中的时空一致性。
此外,论文设计了一个三阶段训练流程,逐步优化各组件,并构建了World360数据集,包含真实世界无人机视频和高质量模拟数据,以支持模型训练与评估。

4. 与前人工作的关键差异
与依赖透视投影假设的传统方法不同,PanoWorld直接利用全景数据的旋转等变性,简化了相机运动的建模过程。此外,World360数据集的多样性(覆盖真实世界物理变化)弥补了现有数据集的不足,使模型能在更复杂的场景中表现出色。这种从数据特性出发的设计思路,是PanoWorld区别于其他方法的核心创新。

方法图解

方 法 图 解1 / 5

Figure 1: PanoWorld is a novel framework for high-fidelity and controllable panoramic video generation. Our approach achieves precise trajectory control across complex movements while maintaining high-fidelity visual synthesis with physical consistency in diverse real-world environments.

这张图是论文《PanoWorld: Real-World Panoramic Generation》中的图1,它全面展示了PanoWorld框架的核心概念、关键特性以及其在全景视频生成任务中的优势。我们可以将这张图分为左右两个主要部分来理解:左侧是PanoWorld框架的概览和核心特性,右侧是其数据集World360的介绍以及在可控全景视频生成任务上的结果对比。

首先看左侧部分: * 中心区域:展示了一个三维城市模型,周围环绕着一系列全景图像。这代表了PanoWorld的目标是生成或处理围绕一个场景的连续全景视图。这些全景图像似乎是沿着一个圆形轨迹排列的,暗示了相机在围绕中心场景移动。 * 环绕的全景图像:这些小图展示了不同的环境场景,如城市景观、自然风光(树木、草地)、水体等。每个小图上都有一个播放按钮,可能表示这些是视频帧或可以动态浏览的全景。这表明PanoWorld能够处理多样化的真实世界环境。 * 下方三个核心特性: * Trajectory Control (轨迹控制):图标是一个带有箭头的曲线,表示PanoWorld能够实现对相机轨迹的精确控制。结合摘要,这指的是通过固定朝向将复杂的相机运动简化为平移。 * High Fidelity (高保真度):图标是一个电影胶片,表示PanoWorld生成的视觉内容具有高度的真实感和细节。 * Physically Consistent (物理一致性):图标是一个眼睛或透镜,表示PanoWorld在生成视频时能够保持物理规律的一致性,例如光照、阴影等在不同帧之间的一致性。 * 信息流动:整体来看,左侧图示传达了PanoWorld框架的核心思想:通过对围绕中心场景的全景图像进行处理或生成,实现精确的轨迹控制,同时保证生成内容的高保真度和物理一致性。

接下来看右侧部分: 这部分分为上下两个子图,分别介绍了数据集和结果对比。

上半部分:World360数据集介绍 * 顶部大图:标题为“World360”,副标题说明该数据集包含“120k panorama sequences: 70k real + 50k synthetic”(12万张全景序列:7万张真实 + 5万张合成)。这表明World360是一个大规模的数据集,结合了真实世界采集和高质量模拟的数据。图片内容是由许多小的全景图像缩略图拼接而成,展示了数据集的多样性和规模。 * 下方文字:“A large-scale benchmark for panoramic world modeling”(一个用于全景世界建模的大规模基准)。这说明World360不仅是一个数据集,也是一个评估全景建模方法的基准。 * 数据来源:论文摘要中提到,World360由通过全景无人机收集的真实世界视频片段和通过AirSim360生成的高质量模拟片段组成。

下半部分:可控全景视频生成结果对比 * 标题:“Comparison on controllable panoramic video generation”(可控全景视频生成对比)。 * 对比对象:图表比较了三种方法:Matrix3D、OmniRoam 和 “Ours”(即PanoWorld)。 * 展示内容:图表分为两行,每行展示了三种方法生成的全景视频帧。这些帧似乎是在一个类似街道的场景中拍摄的,可能涉及相机的平移或旋转。 * 分析: * 在第一行(可能是某个特定场景或时间点),三种方法生成的结果看起来都比较相似,都展示了街道、建筑物和天空。 * 在第二行(可能是另一个场景或时间点,或者对同一场景的不同处理),可以看到明显的差异。例如,在“Matrix3D”和“OmniRoam”的结果中,某些物体(如树木、建筑物)的位置或外观可能与“Ours”不同。图中用黄色虚线框标出了这些差异区域,红色和绿色的标记可能指示了具体的不同点或关注点。 * 结论:从图示的对比来看,“Ours”(PanoWorld)生成的结果在视觉上可能更优或更符合预期,这支持了论文摘要中提到的“outperforming alternative methods by a large margin”(大幅优于其他方法)的结论。这种对比旨在展示PanoWorld在可控全景视频生成任务上的优越性,特别是在处理大规模空间变化和多样化光照条件下的物理一致性方面。

总结来说,这张图清晰地传达了PanoWorld框架的核心功能:它是一个用于高保真度和可控全景视频生成的框架。它通过利用全景表示的旋转等变性质,简化相机轨迹,并通过Dense Panoramic Ray-Conditioning (DPRC)和Geometry-aware Memory Augmentation (GMA)来处理长距离记忆问题。该方法在名为World360的大规模数据集上进行了评估,实验结果表明其在可控全景视频生成任务上显著优于现有方法,如Matrix3D和OmniRoam。图中的各个组件共同展示了方法的概念、所用数据集的规模和多样性,以及其在实际任务中的优异性能。

Figure 2: The Data Curation Pipeline. The pipeline converts raw panoramic clips into high-quality sequences by: (1) Rotation Decoupling to isolate pure translation; (2) Uniform Spatial Resampling to standardize motion scales; and (3) Illumination Filtering to ensure exposure consistency.

这张图展示了《PanoWorld: Real-World Panoramic Generation》论文中的“数据整理流程”(Data Curation Pipeline)。该流程的目的是将原始的全景视频片段(panoramic clips)处理成高质量的序列数据,以便后续的模型训练或分析。数据的流动顺序是从左到右,依次经过三个主要处理步骤。

首先,最左边的部分是“原始轨迹”(Original Trajectory)和“原始片段”(Original Clip)。这里展示了一个全景相机拍摄的原始视频片段,由多帧图像组成。相机的运动轨迹(红色曲线)包含了旋转和平移的复杂组合。这个阶段代表了未经处理的输入数据。

接下来是第一个处理步骤:“旋转解耦”(Rotation Decoupling)。这一步的目标是将原始的复杂运动(旋转和平移的结合)分解,以分离出“纯平移”(pure translation)。在图中,我们可以看到原始的相机轨迹(红色曲线)和表示相机姿态的图标(白色多面体)在经过此步骤后,相机的旋转部分被消除或固定,只剩下平移运动。新的相机轨迹(蓝色虚线)和相机图标(蓝色多面体)显示了更简单的、主要是直线或平滑曲线的平移路径。这一步的输出是中间的“旋转解耦后”的片段,其中相机的运动被简化为主要是平移,从而隔离了旋转带来的复杂性。

然后是第二个处理步骤:“均匀空间重采样”(Uniform Spatial Resampling)。这一步旨在标准化运动尺度(standardize motion scales)。在图中,经过旋转解耦后的相机轨迹(蓝色虚线)和相机图标(蓝色多面体)作为输入。经过重采样后,输出的相机轨迹(棕色实线)和相机图标(棕色多面体)显示出更均匀分布的采样点。这意味着在空间上对数据进行重新采样,使得不同片段之间的运动速度或尺度更加一致,便于后续处理。

最后是第三个处理步骤:“光照过滤”(Illumination Filtering)。这一步的目标是确保曝光一致性(ensure exposure consistency)。在图中,经过均匀空间重采样后的片段作为输入。这一步会识别并处理光照条件不稳定的帧,例如过曝(overexposure)、欠曝(underexposure)或光照变化剧烈(illumination inconsistency)的帧(如图右侧示例所示,这些帧上标有红色的“X”)。经过此步骤后,输出的序列数据具有更一致的光照条件,从而提高了数据质量。

总结来说,这张图揭示了PanoWorld方法中数据预处理的具体运作方式:它首先通过旋转解耦来简化相机的复杂运动,将其转化为主要是平移的运动;然后通过均匀空间重采样来标准化这些运动的尺度;最后通过光照过滤来确保数据在光照条件上的一致性。这样处理后的数据更适合用于训练需要处理长距离记忆和物理一致性的全景世界模型。

Figure 3: PanoWorld Network Architecture. Built on the Wan2.2 backbone, PanoWorld employs a triple-stream DiT that fuses visual self-attention, DPRC-based action modeling, and a GMA module for memory-anchored synthesis via a shared geometric manifold.

这张图展示了PanoWorld的网络架构,它基于Wan2.2骨干网络构建,并采用了一个三流DiT(Diffusion Transformer)来融合视觉自注意力、基于DPRC的动作建模和GMA记忆模块,通过共享的几何流形进行记忆锚定的合成。

首先,我们来看输入部分。左侧的“Inputs”板块显示,模型接收三个主要输入:一个表示相机轨迹的示意图(Trajectory)、相机的旋转参数(Camera Rotation r)和相机的平移参数(Camera Translation t),以及一张输入图像(Input Image)。这些输入共同定义了当前要生成或预测的场景的视角和内容。

接下来,数据流向几个关键模块:

  1. 基础潜在自注意力(Base Latent Self-Attention):输入图像首先被处理成潜在表示(Latent),这个潜在表示与相机参数一起输入到“Base Latent Self-Attention”模块。这个模块负责处理图像的基本视觉特征和空间关系,是DiT的基础部分。

  2. 动作建模:DPRC(Action Modeling: DPRC):这个模块是PanoWorld的核心创新之一,用于处理当前动作(即相机视角的变化)。

    • 它接收潜在表示(Latent)和相机参数。
    • “Spherical Ray Unprojection”(球面光线反投影)将图像的平面像素映射到球面上的光线,这利用了全景图像的旋转等变性质。
    • “Motion Manifold Construction”(运动流形构建)则根据相机的平移和旋转参数,在这个球面流形上构建当前动作的运动模型。
    • 最终,通过“Ray Encoding”(光线编码)和“Attention”(注意力)机制,将动作信息整合到潜在表示中,生成“Latent Motion Integration”的结果。
  3. 记忆建模:GMA(Memory Modeling: GMA):这个模块用于处理长程记忆,以实现一致的场景生成。

    • 它从一个“Memory Bank”(记忆库)中检索相关的记忆。记忆库存储了之前生成的图像潜在表示(Image Latent)和对应的光线信息(Ray Pose)。
    • “Memory Retrieval”(记忆检索)根据当前的潜在表示和光线信息从记忆库中提取相关的记忆条目。
    • “GMA”模块内部,检索到的记忆(memory key, rays 和 memory value)与当前的潜在表示一起通过注意力机制进行处理。一个“Gate”(门控)机制和“MAX SCORE”(最大分数)计算用于筛选最相关的记忆特征(Retrieved Feature)。
    • 最后,“Confidence-Guided Blending and Fusion”(置信度引导的融合)模块将这些检索到的记忆特征与当前的特征进行融合,以提高生成的连贯性和一致性。
  4. DiT BLOCK * 30:上述三个模块(基础潜在自注意力、DPRC动作建模、GMA记忆建模)的输出被整合到一个由30个DiT块组成的序列中。这些DiT块进一步处理和融合这些特征,逐步生成最终的潜在表示。

  5. Unpatchify & Post process(解补丁化与后处理):经过所有DiT块处理后,得到的最终潜在表示被转换回图像空间(解补丁化),并通过后处理步骤生成最终的“Generated Video”(生成视频)。

整个流程展示了PanoWorld如何通过融合视觉自注意力、基于DPRC的动作建模和GMA记忆模块,利用全景表示的旋转等变性质来处理长程记忆挑战,并生成具有物理一致性的全景视频。数据从输入开始,经过多个特征处理和融合模块,最终输出生成的视频。

总结来说,PanoWorld的运作方式是: * 将相机轨迹简化为固定朝向下的平移,利用全景表示的旋转等变性质。 * 使用DPRC模块显式建模当前相机动作(平移和旋转)对视角的影响。 * 使用GMA模块从记忆库中检索并融合相关的长程记忆,以保持场景的一致性。 * 通过一个包含30个DiT块的骨干网络,将这些特征进行迭代处理和融合,最终生成高质量的全景视频。

Figure 4: Overview of the progressive three-stage pipeline. Stage 1 focuses on geometric adaptation for panoramic video generation; Stage 2 targets view-dependent motion learning ; and Stage 3 enables memory-anchored coherence to enforce long-term temporal consistency.

这张图展示了论文《PanoWorld: Real-World Panoramic Generation》中提出的三阶段渐进式训练流程的概述,旨在解决全景世界模型中的长程记忆挑战。

第一阶段:全景视频微调 (Step 1: Panoramic Video Fine-tuning) 这个阶段的输入是“真实世界数据”(Real-World Data),如图左侧所示的全景图像序列。这些数据被送入一个“视频生成模型”(Video Generation Model)。在这个模型中,使用了一种名为“LORA”的技术(图中用火焰图标表示,通常代表某种优化或微调方法)对模型进行微调。此阶段的目标是为全景视频生成进行几何适应,即让模型能够处理和生成符合特定几何特性的全景内容。处理后的数据或模型输出流向第二阶段。

第二阶段:视点依赖运动学习 (Step 2: View-Dependent Motion Learning) 这个阶段接收来自第一阶段微调后的“视频模型”(Video Model)。此阶段被进一步细分为三个子阶段: * 子阶段 2.1:学习原子能力 (Sub-Stage 2.1: Learn Atomic Capabilities):这个子阶段的目标是让模型学习基本的、独立的运动能力。它使用“过滤后的线性运动数据”(Filtered Linear Motion Data)作为输入,并可能涉及到一些基础的变换(如图中ABCD的示意)。 * 子阶段 2.2:泛化 (Sub-Stage 2.2: Generalization):在这个子阶段,模型利用“所有真实世界数据”(All Real-World Data)进行泛化学习,以提高其对不同场景和运动的适应能力。图中显示了一个“动作模型”(Action Model,火焰图标)与这个子阶段相关联,表明此阶段可能涉及学习具体的动作或行为模式。 * 子阶段 2.3:提升性能 (Sub-Stage 2.3: Improve Performance):此子阶段的目标是提升模型的性能,特别是针对需要精确控制标签的任务。它使用“带有精确控制标签的合成数据”(Synthetic Data with Precise Control Labels)作为输入(如图中AirSim360的示意,表明可能使用了模拟数据)。经过这三个子阶段的处理,模型输出“所有真实世界数据”(All Real-World Data),这可能意味着模型已经能够很好地处理和生成真实的、复杂的全景视频序列,并准备进入第三阶段。

第三阶段:记忆锚定的连贯性 (Step 3: Memory-Anchored Coherence) 这个阶段的输入是“所有真实世界数据”(All Real-World Data),以及两个模型:“视频生成模型”(Video Generation Model)和“动作模型”(Action Model)。这两个模型共同作用,以实现“记忆锚定的连贯性”,即确保生成的视频在长时间内保持时间上的一致性。最终,这些模型和数据的交互会形成一个“记忆模型”(Memory Model,火焰图标),这个模型负责存储和利用长期记忆信息,以维持视频内容的连贯性和一致性。

总的来说,这张图揭示了PanoWorld方法的具体运作方式: 1. 首先,使用真实世界数据对视频生成模型进行微调,使其适应全景生成任务。 2. 然后,通过三个子阶段来学习视点依赖的运动:首先学习基本的运动能力,然后在真实世界数据上进行泛化,最后使用带有精确标签的合成数据提升性能。 3. 最后,结合视频生成模型、动作模型和所有真实世界数据,构建一个具有长期记忆能力的模型,以确保生成的视频在时间和空间上都具有高度的一致性。

这个三阶段流程是逐步优化每个组件,从而实现高质量、连贯的全景视频生成。

Figure 5: Qualitative comparison on real-world outdoor sequences.

这张图(图5)是论文《PanoWorld: Real-World Panoramic Generation》中的定性比较结果,展示了在不同相机运动场景下,该方法(Ours)与现有方法(Imagine360, Matrix-3D, OmniRoom)生成的全景图像的质量对比。图的标题是“Figure 5: Qualitative comparison on real-world outdoor sequences.”,意即在真实世界户外序列上的定性比较。

图的总体结构和信息流动:

该图被组织成一个网格,分为三个主要部分(行组),每个部分对应一种不同的相机运动类型:Arc(弧形运动)、Upward(向上运动)和Backward(向后运动)。这些运动类型在图的最左侧用三维坐标系和箭头进行了可视化表示,帮助理解每种运动的几何特性。

  1. 左侧运动类型标签:

    • Arc (弧形运动): 表示相机沿一个圆弧路径移动,保持大致相同的海拔高度和方向变化。对应的三维图示显示了一个在水平面上的弧形轨迹。
    • Upward (向上运动): 表示相机垂直向上移动,通常用于模拟上升或俯视角度的变化。对应的三维图示显示了一个向上的箭头。
    • Backward (向后运动): 表示相机沿直线向后移动,方向相对固定。对应的三维图示显示了一个向后的箭头。
  2. 顶部方法标签: 每个运动类型部分内,列出了不同的方法,从上到下依次是:

    • Imagine360: 一种基线方法。
    • Matrix-3D: 另一种基线方法。
    • OmniRoom: 第三种基线方法。
    • Ours: 论文中提出的方法(PanoWorld)。
  3. 底部帧标签: 每一列代表视频序列中的不同帧,从左到右依次是:

    • First Frame (第一帧): 视频序列的起始帧,作为参考。
    • Sample Frame 1 (样本帧1): 序列中的一个中间帧。
    • Sample Frame 2 (样本帧2): 序列中的另一个中间帧。
    • Sample Frame 3 (样本帧3): 序列中的后续帧。

方法运作原理的揭示:

这张图通过视觉对比展示了PanoWorld方法如何处理不同类型的相机运动,并生成高质量的全景图像。具体来说:

  • 针对不同运动类型的适应性: 图中将结果按Arc、Upward和Backward三种运动类型分类,表明PanoWorld能够处理多样化的相机轨迹。通过观察每种运动类型下不同方法的生成结果,可以评估方法对特定运动的适应性。
  • 与基线方法的对比: 对于每种运动类型和每一个样本帧,都将PanoWorld(Ours)的结果与Imagine360、Matrix-3D和OmniRoom的结果并列展示。这种并排对比使得观察者可以直观地看到PanoWorld在图像质量、细节保留、光照一致性等方面的优势。
  • 红色框的标注: 在许多生成的全景图中,红色框突出显示了特定的感兴趣区域。这些区域通常是用来强调PanoWorld相比其他方法在细节还原、结构完整性或视觉真实性方面的改进。例如,在Arc运动的“Sample Frame 1”中,红色框可能突出了远处建筑物的清晰度或道路的连续性。
  • 图像质量的评估: 通过观察生成的图像,可以评估以下几点:
    • 细节清晰度: PanoWorld生成的区域(如红色框内)是否比基线方法更清晰、更少模糊?
    • 结构完整性: 生成的场景结构(如建筑物、道路、树木)是否更符合现实,更少出现扭曲或断裂?
    • 光照一致性: 在不同帧之间,光照条件是否保持一致,或者变化是否自然?
    • 整体视觉真实性: 生成的图像是否看起来更逼真,更接近真实世界的观测?

结论:

这张定性比较图清晰地展示了论文提出的PanoWorld方法在处理真实世界户外全景生成任务时的优越性。通过将结果按不同相机运动类型(Arc, Upward, Backward)分类,并与现有方法(Imagine360, Matrix-3D, OmniRoom)进行逐帧对比,图中揭示了PanoWorld能够生成更清晰、细节更丰富、结构更完整且光照更一致的全景图像。红色框的标注进一步强调了PanoWorld在关键区域的改进,从而有力地支持了论文的论点,即利用旋转等变性质和提出的Dense Panoramic Ray-Conditioning (DPRC)及Geometry-aware Memory Augmentation (GMA)技术,可以有效解决全景世界模型中的长距离记忆挑战,并在物理一致性方面取得优异表现。

← → 翻页 · ↑ ↓ 滚动讲解 · Esc 退出