LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
arXiv · HuggingFace · ▲82
摘要(原文)
Streaming video editing has made rapid progress, yet practical deployment is still limited by two core issues: maintaining stable backgrounds and non-edited regions over time, and achieving the low latency required for real-time interactive scenarios. Meanwhile, recent streaming video generation methods are mostly developed for synthesis and cannot be directly applied to editing due to the strict preservation requirement and region-specific control. In this work, we present a novel streaming video editing framework that performs causal, frame-by-frame editing with strong content preservation and real-time responsiveness. Our key design is a three-stage distillation pipeline that progressively transfers editing capability from a powerful bidirectional foundation model to an efficient unidirectional streaming editor, enabling stable long-horizon edits without sacrificing visual fidelity. To further support real-time deployment, we introduce an AR-oriented mask cache that reuses region-related computation across frames, substantially reducing redundant processing and accelerating inference. Finally, we establish a dedicated benchmark for streaming video editing. Extensive evaluations demonstrate that our method achieves state-of-the-art visual quality among streaming baselines while drastically boosting inference speed to 12.66 FPS, making it suitable for interactive and augmented reality applications.
摘要(中译)
流媒体视频编辑取得了快速进展,但实际部署仍受两个核心问题的限制:随着时间的推移保持稳定的背景和未编辑区域,以及实现实时交互场景所需的低延迟。与此同时,最近的流媒体视频生成方法主要是为合成而开发的,由于严格的保留要求和特定区域的控制,不能直接应用于编辑。在这项工作中,我们提出了一个新的流媒体视频编辑框架,该框架执行因果、逐帧编辑,具有强大的内容保留和实时响应能力。我们的关键设计是一个三阶段蒸馏管道,逐步将编辑能力从强大的双向基础模型转移到高效的单向流媒体编辑器,使得稳定的长距离编辑不会牺牲视觉保真度。为了进一步支持实时部署,我们引入了一个面向增强现实(AR)的掩码缓存,它在帧之间重用区域相关的计算,大大减少了冗余处理并加速了推理。最后,我们为流媒体视频编辑建立了一个专门的基准。广泛的评估表明,我们的方法在流媒体基线中实现了最先进的视觉质量,同时将推理速度大幅提高到12.66帧每秒(FPS),使其适用于交互式和增强现实(AR)应用。
背景剖析
背景剖析
1. 技术背景与真实需求
随着增强现实(AR)、直播和实时交互应用的普及,视频编辑正从传统的离线批量处理转向实时流式编辑。例如,在AR场景中,用户需要即时修改视频中的特定对象(如更换虚拟背景或调整物体颜色),同时保持背景稳定;在直播中,编辑需低延迟以支持互动操作(如实时添加特效)。这类技术的核心需求是:在无未来帧信息的情况下,实现稳定、高质量且低延迟的逐帧编辑。
2. 之前的问题与瓶颈
现有方法存在两大核心挑战:
- 时间一致性不足:传统视频扩散模型依赖双向或全局注意力来维持时序一致性,但直接应用于流式场景(仅能访问当前及历史帧)时,会因缺乏全局上下文导致“遗忘效应”或画面闪烁。
- 计算冗余:标准扩散流程将每帧视为独立生成任务,但对静态或线性运动的背景重复执行密集计算(如注意力机制),导致边缘设备无法实时处理。
3. 本文的解决思路
论文提出分阶段蒸馏框架和AR导向掩码缓存:
- 三阶段蒸馏:从强大的双向扩散模型(Bidirectional DiT)逐步蒸馏编辑能力到单向流式模型(Causal DiT)。第一阶段训练双向模型的编辑能力;第二阶段通过“教师强制”策略转为单向因果模型;第三阶段用分布匹配蒸馏(DMD)压缩推理步骤至4步,实现实时性(12.66 FPS)。
- 掩码缓存:通过计算编辑输出与源帧的距离动态提取掩码,复用静态区域的计算,减少冗余处理。
4. 与前人工作的关键差异
- 因果性与效率平衡:不同于传统非因果模型,本文通过蒸馏保留编辑能力的同时适应流式约束。
- 针对性优化:聚焦流式场景的特定问题(如背景冗余),而非通用视频生成。
- 基准测试:首次建立流式视频编辑专用基准,验证方法在视觉质量、时序一致性和吞吐量上的优势。
这一工作为实时交互和AR应用提供了实用化方案,填补了流式视频编辑从理论到部署的鸿沟。




