LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
arXiv · HuggingFace · ▲28
摘要(原文)
Recovering high-quality video from sparse event streams is a challenging task. Regression methods often blur textures, while existing generative models struggle with long-term stability. We propose LongE2V, a novel approach that leverages pre-trained video diffusion priors to jointly handle event-based video reconstruction, prediction, and frame interpolation. By fine-tuning a foundational video model, our approach achieves high data efficiency and superior perceptual quality. We introduce Autoregressive Unrolling and Adaptive Context Switching to mitigate temporal drift in extremely long sequences. We also propose Reencoding Alignment with Cross Residual Correction to ensure precise bidirectional consistency during frame interpolation. Furthermore, Event Voxel Density Augmentation ensures robustness across varying sensor resolutions. Extensive experiments on real-world benchmarks demonstrate that LongE2V outperforms state-of-the-art methods across all three tasks, exhibiting exceptional temporal coherence and zero-shot generalization. Project page: https://cdfan0627.github.io/LongE2V-page/
摘要(中译)
从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法通常会使纹理模糊,而现有的生成模型在长期稳定性方面存在困难。我们提出了LongE2V,这是一种新颖的方法,它利用预训练的视频扩散先验来共同处理基于事件的视频重建、预测和帧插值。通过微调一个基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入了自回归展开(Autoregressive Unrolling)和自适应上下文切换(Adaptive Context Switching)来减轻极长序列中的时间漂移。我们还提出了带交叉残差校正的重新编码对齐(Reencoding Alignment with Cross Residual Correction),以确保帧插值期间的精确双向一致性。此外,事件体素密度增强(Event Voxel Density Augmentation)确保了在不同传感器分辨率下的鲁棒性。在真实世界基准上的广泛实验表明,LongE2V在所有三个任务上都优于最先进的方法,表现出卓越的时间一致性和零样本泛化能力。项目页面:https://cdfan0627.github.io/LongE2V-page/
背景剖析
事件相机技术源于对生物视觉系统的模仿,能在微秒级分辨率和宽动态范围下捕捉亮度变化,特别适用于高速运动场景(如工业检测、自动驾驶)。这类技术的核心需求是将稀疏的异步事件流还原为人类可理解的高清视频,但传统方法面临多重挑战:回归模型(如E2VID)会因“平均化”导致纹理模糊,而直接应用扩散模型又容易在长序列预测中出现误差累积和时序漂移,帧插值任务则常产生鬼影伪影。
此前的研究主要依赖CNN/RNN或早期Transformer架构,虽能处理时序信息,但任务特异性强——重建、预测和插值往往需要独立模型,缺乏统一框架。更关键的是,现有方法在真实场景中表现不稳定:回归模型丢失细节,扩散模型长期预测失效,插值方法难以应对复杂动态。这些问题的根源在于事件数据的稀疏性和异步性,使得传统算法难以建立稳定的时序关联。
本文提出的LongE2V通过视频扩散模型(VDM)的预训练先验来解决这些矛盾。其核心思路是将重建、预测和插值统一为“基于事件体素的条件生成任务”,并通过两个创新机制突破瓶颈:一是“自回归展开+自适应上下文切换”,动态调整时序依赖以缓解长序列漂移;二是“重编码对齐+交叉残差校正”,确保帧插值时的双向时序一致性。此外,针对传感器分辨率差异,设计了“事件体素密度增强”提升泛化能力。
与前人工作相比,LongE2V的关键差异在于:1)首次将预训练VDM用于多任务统一框架,而非单独优化;2)通过动态时序调整机制解决长期稳定性问题;3)采用条件生成范式替代传统的回归或端到端映射。实验表明,该方法在真实基准测试中显著优于现有方法,同时实现了零样本泛化和更高的感知质量。




