4D Human-Scene Reconstruction from Low-Overlap Captures
arXiv · HuggingFace · ▲53
摘要(原文)
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.
摘要(中译)
现有的动态人体表演体积捕捉通过密集相机阵列实现了高保真度。然而,在现实世界场景中,只有少数低重叠相机可用,这降低了输出质量并留下了大片未观测区域。最近的4D重建方法集中在低重叠设置上,但它们在观测不足的区域仍然产生明显的伪影。视频扩散模型已成为另一种选择,但它们对人类的几何结果不一致。为了解决这些局限性,我们提出了StudioRecon,这是一种通过解耦背景和人类来从稀疏、低重叠相机重建4D人体场景的流程。我们通过使用视频扩散模型合成数百个相机控制的新视图来加强背景监督。我们还通过跨视图身份关联和三角测量多视图关键点拟合来稳健地初始化可变形高斯人体。最后,我们的递归增强模块带有运动自适应一致性注入,协调了合成输出,从而进一步避免了剩余的伪影。我们在四个真实世界数据集上实现了最先进的新型视图合成,并展示了诸如新型轨迹渲染和人体替换等应用。
背景剖析
背景剖析
1. 技术背景与真实需求
高精度4D人体场景重建在娱乐(如虚拟制片)、体育广播和元宇宙应用中至关重要。专业级系统通过密集相机阵列实现高质量动态捕捉,但需要数十至数百台相机且依赖受控环境。然而,现实场景(如健身房、家庭)通常只有少量未校准、低重叠的相机,且存在多人交互和频繁遮挡。这种“野外工作室”场景需要技术能在有限相机条件下,仍能生成连贯、无伪影的动态重建结果,同时支持新视角合成、轨迹渲染或人物替换等实用功能。
2. 先前方法的局限性
现有方法主要面临两个核心问题:
- 背景与人体表示纠缠:传统联合重建方法(如4D高斯溅射)在低重叠场景下,背景和人体的错误会相互影响,导致未观测区域出现明显伪影。
- 几何一致性与覆盖不足:视频扩散模型虽能合成合理背景,但在多人动态场景中无法保证人体运动的一致性;而基于参数化人体模型(如SMPL)的方法依赖多视图匹配,但稀疏相机下的遮挡和视差会导致初始化失败。
3. 本文的解决思路
论文提出解耦重建框架(StudioRecon),通过分离背景与人体重建来解决上述问题:
- 背景重建:利用相机控制的视频扩散模型,从稀疏输入合成数百个新视角,为背景提供密集监督,避免因视野不足导致的退化。
- 人体重建:结合SMPL等参数化模型的几何先验,通过跨视图身份关联和多视图关键点三角化,鲁棒地初始化动态人体。
- 时序一致性增强:通过单步扩散模型和运动自适应一致性注入,消除静态伪影并确保帧间连贯性,避免传统方法中的闪烁问题。
4. 与前人工作的关键差异
- 解耦策略:不同于以往联合优化背景与人体,本文利用扩散模型(背景)和参数化模型(人体)的互补优势,避免表示纠缠。
- 多视图人体估计:通过空间和姿态亲和力结合的关键点三角化,提升稀疏视图下的人体初始化鲁棒性。
- 时序一致性:首次将单步扩散与运动自适应注入结合,实现动态场景的长期连贯渲染。
这一方法在真实世界数据集(如EgoHumans、Harmony4D)上实现了SOTA性能,并支持新视角合成和人物替换等应用,填补了低重叠场景下高保真4D重建的技术空白。



















