论文标题:
Vera: A Layered Diffusion Model for Content-Preserving Video Editing
发表日期:
2026年06月
发表单位:
California Institute of Technology, Netflix, Inc.
原文链接:
https://arxiv.org/pdf/2606.23610v1.pdf
项目链接:
https://vera-layered-diffusion.github.io/
在相同训练数据和训练步数下,Vera(分层)与标准的视频到视频(V2V)方法对比。表2显示:分层编辑的PSNR比V2V高出2.8~5.0 dB,LPIPS降低一半以上。而且,即使去掉合成分支(Vera-no-comp),分层方案依然大幅领先。表2:分层编辑 vs V2V。内容保留指标差距明显,Vera-NC(无合成分支)也在LPIPS上远低于V2V。这充分说明:只要把“需要生成的”和“需要保留的”从表征层面分开,内容保留难度就瞬间下降。
功臣二:MoT架构 vs 密集DiT
表3对比了不同的架构选择:单独一个DiT将所有层token拼在一起 vs MoT(三个独立DiT+联合自注意力)。结果显示,MoT在所有指标上都优于单DiT,尤其是在内容保留上PSNR高1.5 dB以上,LPIPS低0.02。另外,输入视频的嵌入方式也很重要:序列拼接(Sequence Concat)比通道拼接(Channel Concat)更好。表3:MoT架构在内容保留和合成质量上均优于单DiT,且序列拼接优于通道拼接。
功臣三:高质量训练数据
表4展示了累加不同数据源的效果:只用合成数据(VideoMatte240K)就能达到不错的基线,加入真实单对象视频后PSNR提升约4 dB,LPIPS降低0.04,再加入多对象带特效数据,LPIPS进一步降低0.02。尤其在对象添加任务中,多对象数据带来的交互特效(阴影、反射)显著提升了合成质量(CS从3.24→3.49)。表4:每种数据源的累积贡献。真实场景的数据对泛化能力和合成质量提升显著。另外,Vera还发现alpha分支和合成分支需要更高的学习率(10倍于基础学习率)才能收敛好,这也很合理——alpha和合成视频分布差异大,需要更快的适应。消融实验的定性结果如图8所示,直观展示了不同设计选择对输出的影响。图8:消融实验定性对比。(a)分层编辑 vs V2V:V2V导致人物面部扭曲;(b)MoT vs 密集DiT:MoT锐度更好;(c)数据累积:加入真实数据后边缘更清晰。
[1] Wan et al. Wan2.1: Open and advanced video generation. 2025.[2] Jiang et al. VACE: All-in-one video creation and editing. 2025.[3] Zhang et al. ReCo: Region-constrained video editing. 2025.[4] Liang et al. Mixture-of-Transformers: A scalable framework for multi-modal learning. 2025.[5] Lee et al. Generative Omnimatte: Video decomposition for editing. 2025.[6] Lin et al. VideoMatte240K: A high-quality video matting dataset. 2021.[7] Ji et al. LayerFlow: Layered video generation from per-layer prompts. 2025.论文原文:https://arxiv.org/pdf/2606.23610v1.pdf项目主页:https://vera-layered-diffusion.github.io/