← 返回 PaperDaily 视觉与图像

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!

还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!
🐉 龙哥读论文知识星球来了!
给视频加个特效,背景就莫名“崩了”?想把主角变帅,结果配角也跟着“整容”?星球内每日更新AI视频编辑、图像生成等前沿论文拆解,还有开源代码速递,帮你避开“改哪坏哪”的坑,一站式掌握前沿干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。


原论文信息如下:
论文标题:
Vera: A Layered Diffusion Model for Content-Preserving Video Editing
发表日期:
2026年06月
发表单位:
California Institute of Technology, Netflix, Inc.
原文链接:
https://arxiv.org/pdf/2606.23610v1.pdf
项目链接:
https://vera-layered-diffusion.github.io/

💡 为什么视频编辑总是“改哪哪坏”? Vera给你一个“分层”答案

做视频编辑的朋友,有没有遇到过这种崩溃瞬间:想给主角换个时髦背景,结果背景是换了,主角的脸也跟着“整容”了——眼睛歪了、头发糊了、衣服颜色也变了。或者想往画面里加只海龟,结果海龟的“绿意”直接染遍整个沙滩,连旁边的人脸都蒙上一层绿光。
传统视频编辑模型为什么总翻车?根本原因在于它们走的是一条“全图重绘”的路线——把整段视频每一帧都重新生成一遍,然后指望模型凭“道德感”只改你想改的区域,不改其他地方。这就像让一个油漆工把整个房间重新刷一遍,但要求他不能碰到你的古董花瓶——不出意外的话,花瓶一定会被泼上漆。
项目整体效果展示:为海滩视频添加一只巨大的海龟,下方展示了输入源视频、编辑层、阿尔法遮罩和最终合成视频。
图:Vera为海滩视频添加一只巨大的海龟——输入源视频(左上)、编辑层(右上)、阿尔法遮罩(左下)和最终合成视频(右下)。可以看出,编辑层只包含新添加的海龟及其阴影,原视频的人物和背景完全不受影响。
Netflix联手加州理工学院(Caltech)的最新力作 Vera(拉丁语意为“真实的”),直接给出了一个“分层”解法:要改的内容单独画在一个“透明图层”上(编辑层+阿尔法遮罩),再盖回原视频。不改的地方一根汗毛都不动,从源头上杜绝了“改哪坏哪”的尴尬。这就像Photoshop里分层P图,要改的放一层,原有底图完全保留。
下面这张图(图1)更清楚地展示了Vera的能力:背景更换任务中,女孩的头发丝都被完美保留;对象添加任务中,新增的海龟带着阴影自然融入画面,但原本的冲浪者和海水完全不变。
图1:给定输入视频和文本指令,Vera生成编辑层和阿尔法遮罩,可直接与输入视频合成得到编辑结果。对象添加时,alpha包含阴影等效果;背景替换时,Vera学习包含与保留区域互补的效果(如汽车后的烟雾)。编辑层和遮罩的联合生成使得原始内容在编辑中得到保留,甚至包括非常精细的细节(如背景更换时女孩的头发)。
图1:Vera的分层编辑效果示例。左侧为背景更换,右侧为对象添加。可以看到,无论多精细的细节(头发、阴影)都被精准保留或生成。

🤖 三步拆解Vera:从问题定义到MoT架构设计

Vera的核心思想可以用一句话概括:把“生成”和“保留”分离。具体怎么做到?咱们分三步拆解。

第一步:问题建模——视频编辑就是“图层合成”

假设源视频V_src由两部分组成:要保留的内容V_preserved和要编辑的内容A_edit(阿尔法遮罩)。编辑的目标就是生成一个编辑层V_edit和对应的遮罩A_edit,然后通过合成公式得到输出:
V_output = A_edit * V_edit + (1 - A_edit) * V_preserved。
Vera不直接生成V_preserved,而是生成三个东西:编辑层V_edit、阿尔法遮罩A_edit、以及合成后的视频V_composite。然后通过V_preserved = (V_output - A_edit * V_edit) / (1 - A_edit) 来恢复保留内容。在实践中,Vera近似使用V_preserved ≈ V_src,因为大多数编辑场景下半透明区域很小(比如背景更换、物体添加),这个近似非常有效。
问题建模的关键创新:Vera不是直接预测遮罩和编辑层,而是联合生成编辑层、alpha遮罩和合成视频。这是因为合成视频V_composite服从自然视频的分布,与预训练的视频生成模型分布更对齐,有助于利用强大的生成先验。

第二步:架构设计——三个DiT的“群聊”机制

Vera使用了混合Transformer(Mixture-of-Transformers,MoT)架构。与标准的一个DiT(Diffusion Transformer)处理所有不同,Vera让三个独立的DiT分别负责编辑层、alpha遮罩和合成视频,每个DiT有自己的QKV投影和前馈网络权重,但是它们通过联合自注意力(Joint Self-Attention)进行交互。这就像三个专家在“群聊”里各抒己见,但又互相参考,最终达成一致。
为什么不能用单个共享DiT?因为编辑层(充满创意内容)、alpha遮罩(灰度图,依赖场景交互)和合成视频(自然视频)的分布差异太大,强行塞进一个模型会导致训练数据效率低下。MoT让每个分支专精学习自己的分布,同时通过交互保持一致性。
图3:Vera与其他视频编辑方法的架构对比。VAE编码/解码和分块化已省略。(a) 标准微调预训练T2V模型用于视频编辑。(b) VACE风格微调,带额外上下文适配器。(c) Vera由三个DiT组成,每个负责建模一个图层,通过联合自注意力实现跨层交互。
图3:Vera的MoT架构(c)与标准微调(a)和VACE风格(b)的对比。三个DiT分别处理编辑层、alpha和合成视频,通过联合自注意力交互。
Vera的整体推理流程如图2所示:输入源视频和文本指令,MoT架构联合生成编辑层、alpha遮罩和合成视频,然后编辑层和alpha遮罩与源视频合成得到最终编辑结果。
图2:Vera推理流程概览。给定输入视频和文本编辑指令,Vera的MoT架构联合生成编辑层、阿尔法遮罩和合成视频。然后编辑层和阿尔法遮罩与源视频合成得到最终编辑输出。
图2:Vera推理流程。三路DiT协同工作,输出编辑层、alpha和合成视频,最后用alpha将编辑层合成到源视频上。
三个DiT都从预训练的文本到视频模型(Wan2.1)初始化,额外加入了输入视频和可选遮罩的嵌入层。通过一个零初始化的可学习嵌入让各层互相区分。

第三步:数据构建——没有现成数据就自己造

训练分层模型最大的障碍是缺少高质量的分层视频数据。Vera团队干脆自己造了一个包含约6000个样本(共486K帧,分辨率832×480)的数据集,分为三个互补的子集:
合成数据:基于VideoMatte240K的精确alpha遮罩,搭配补全模型生成的各种背景,提供精细的头发等结构的alpha监督。
真实单对象视频:从Pexels和Mixkit收集真实视频,通过分割、抠图、补全等流水线生成高质量分层数据,场景和运动更加多样。
真实多对象视频(带特效):进一步加入Omnimatte优化步骤,提取多个对象及其关联的视觉效果(阴影、反射等),用于对象添加任务。
图4:分层训练数据概览。每个样本包含输入视频、编辑层、阿尔法遮罩和合成目标视频。编辑层中的白色区域表示透明度。
图4:Vera的分层训练数据示例,包含背景更换和对象添加两类任务,以及带阴影、反射等交互效果的样本。
图5:数据构建流水线概览。(a)对象添加;(b)背景更换。每种颜色代表一个阶段,虚线框内为阶段内操作,虚线框外为阶段输出。
图5:数据构建流水线,分别对应对象添加和背景更换。

📊 效果炸裂:Vera在“内容保留”上碾压所有开源模型

Vera在背景更换和对象添加两个任务上与7个最新的开源视频编辑模型进行了全面对比,包括Ditto、Lucy-Edit、ICVE、VideoPainter、VACE、ReCo以及LayerFlow。下表(Table 1)是定量结果:
表1:与现有视频编辑方法的比较。基于VLM的指标(CS, CT, IS)取三个VLM的平均值。OC和TF在许多模型上几乎相同,不进行加粗。其他列中最佳结果加粗。
表1:Vera与现有方法的定量对比。Vera在内容保留(PSNR, SSIM, LPIPS)上全面领先,尤其在对象添加任务上,Vera-1.3B的PSNR达到25.3 dB,比最强的VACE-14B(10.1 dB)高出15.2 dB!背景更换任务上,Vera-1.3B也以35.2 dB PSNR大幅领先VACE-14B的31.7 dB。
注意PSNR值越高越好,SSIM越接近1越好,LPIPS越低越好。Vera在对象添加的LPIPS仅0.078,是第二名(ICVE的0.265)的1/3,意味着感知质量差距巨大。背景更换的LPIPS更是低至0.010,几乎完美。
在指令遵从(IS)和合成质量(CS, CT)上,Vera在对象添加任务上也是第一或第二,背景更换上仅次于VACE,但差距很小。

用户研究:人眼投票也选Vera

除了客观指标,Vera还做了标准的两两对比用户研究(2AFC)。17名标注者进行了513次有效比对,从内容保留、视频质量、指令遵从三个维度选择更好的结果。结果如图6所示:
图6:2AFC用户研究结果,比较Vera-1.3B与五个基线。柱状图显示Vera在三个评估维度上的胜率。加粗数值表示统计显著(p < 0.05,二项检验)。
图6:Vera-1.3B在内容保留和指令遵从维度上全面胜出所有基线,视频质量基本持平。例如对VACE-14B,内容保留胜率高达83.9%。

定性对比:一眼可见的差距

下面的图7直观展示了Vera与其他方法的差异。背景更换时,其他方法会出现人脸变形、身体扭曲;对象添加时,其他方法会将添加物体与前景主体错误融合(比如海龟和游泳者合体),或者把物体颜色扩散到背景。Vera则干净利落,通过alpha遮罩严格限定编辑区域。
图7:与现有视频编辑方法的定性对比。背景更换(上)和对象添加(下)。对于背景更换示例,每个方法包含子面板:放大视图(左)和保留内容区域的差异热力图(右)。
图7:定性对比。上排:背景更换,Vera完美保留人脸和头发,其他方法均有修复痕迹。下排:对象添加,Vera让海龟独立出现在画面中,其他方法出现融合或颜色污染。
这里再放一段骑士添加的对比GIF,你就知道Vera有多稳了:
对象添加效果对比:在海滩视频中添加一名身着银色板甲的骑士,并展示Vera(14B和1.3B版本)与VACE、ReCo等其他方法的对比结果。
Vera(14B/1.3B)与VACE、ReCo的对比:左侧输入视频,右侧依次为各方法结果。注意VACE和ReCo中骑士周围出现了奇怪的纹理、背景颜色变化,而Vera的版本干净自然。

🔬 层层拆解:消融实验揭示Vera成功的三大“功臣”

Vera团队做了一堆消融实验,把成功原因拆得明明白白。主要功臣有三个:分层范式MoT架构高质量训练数据

功臣一:分层范式(Layered Editing)

在相同训练数据和训练步数下,Vera(分层)与标准的视频到视频(V2V)方法对比。表2显示:分层编辑的PSNR比V2V高出2.8~5.0 dB,LPIPS降低一半以上。而且,即使去掉合成分支(Vera-no-comp),分层方案依然大幅领先。
表2:分层编辑相比标准视频到视频(V2V)在内容保留上大幅提升;完整Vera在合成质量和指令遵从(CS, CT, IS)上保持竞争力。所有模型在相同数据上训练相同步数。模型名称后缀表示基础模型大小,#Params为实际总参数量。
表2:分层编辑 vs V2V。内容保留指标差距明显,Vera-NC(无合成分支)也在LPIPS上远低于V2V。
这充分说明:只要把“需要生成的”和“需要保留的”从表征层面分开,内容保留难度就瞬间下降。

功臣二:MoT架构 vs 密集DiT

表3对比了不同的架构选择:单独一个DiT将所有层token拼在一起 vs MoT(三个独立DiT+联合自注意力)。结果显示,MoT在所有指标上都优于单DiT,尤其是在内容保留上PSNR高1.5 dB以上,LPIPS低0.02。另外,输入视频的嵌入方式也很重要:序列拼接(Sequence Concat)比通道拼接(Channel Concat)更好。
表3:分层生成架构选择的消融。两个变量:(1) DiT设计——单DiT(所有层token拼接到一个序列) vs MoT架构(每个层单独的DiT+联合自注意力);(2) 输入视频条件化——通道拼接(零初始化或复制初始化输入视频patch嵌入) vs 序列拼接。
表3:MoT架构在内容保留和合成质量上均优于单DiT,且序列拼接优于通道拼接。

功臣三:高质量训练数据

表4展示了累加不同数据源的效果:只用合成数据(VideoMatte240K)就能达到不错的基线,加入真实单对象视频后PSNR提升约4 dB,LPIPS降低0.04,再加入多对象带特效数据,LPIPS进一步降低0.02。尤其在对象添加任务中,多对象数据带来的交互特效(阴影、反射)显著提升了合成质量(CS从3.24→3.49)。
表4:数据消融:每个训练数据源的累积效应。Synthetic表示VideoMatte240K合成数据;+Single-obj增加真实单对象视频;+Multi-obj进一步增加真实多对象视频。
表4:每种数据源的累积贡献。真实场景的数据对泛化能力和合成质量提升显著。
另外,Vera还发现alpha分支和合成分支需要更高的学习率(10倍于基础学习率)才能收敛好,这也很合理——alpha和合成视频分布差异大,需要更快的适应。消融实验的定性结果如图8所示,直观展示了不同设计选择对输出的影响。
图8:消融研究的定性示例。每行展示单个设计选择或训练数据变化的影响,其他变量固定。(a)分层编辑范式与标准V2V;(b)分层框架内的架构选择(密集DiT vs MoT)和输入视频条件化;(c)每种训练数据源的累积效应。
图8:消融实验定性对比。(a)分层编辑 vs V2V:V2V导致人物面部扭曲;(b)MoT vs 密集DiT:MoT锐度更好;(c)数据累积:加入真实数据后边缘更清晰。

🚀 未来展望:Vera的局限与通往通用视频编辑之路

Vera虽然惊艳,但也不是万能。龙哥客观说几个局限:
速度问题:Vera需要运行三个DiT(即使共享部分计算),生成速度比VACE慢约3倍(表7显示Vera-14B每步需22.7 TFLOPs,VACE-14B仅7.3 TFLOPs)。好在单模型生成时间仍在实用范围内(约1分钟/视频)。未来可以通过蒸馏或MoE加速。
编辑类型覆盖:当前Vera主要支持背景更换和对象添加,对于更复杂的编辑(如风格迁移、光效调整、移除物体)还需要扩展。不过框架本身具有通用性,理论上通过训练数据可以覆盖。
半透明区域近似:Vera假设保留区域V_preserved ≈ V_src,这在大多数场景下成立,但遇到大面积的半透明物体(如玻璃窗上的贴纸),这个近似会引入轻微误差。论文也提到可以扩展到全通用形式,但需要更复杂的数据。
尽管有这些限制,Vera开创的“分层编辑”范式给视频编辑领域带来了一个非常扎实的新方向。未来如果结合更快的生成模型、更丰富的数据,完全有可能成为视频编辑的标准流程——就像Photoshop的图层功能一样普及。

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

这篇论文解决什么问题?解决视频编辑中“内容保留”的难题。传统方法重绘整个视频,导致未被编辑的区域也被意外修改。Vera通过分层生成(编辑层+alpha遮罩+合成视频),将生成内容与原始内容分离,从根源上避免了篡改保留区域。

Vera中的MoT代表什么?MoT是Mixture-of-Transformers(混合Transformer)的缩写。这是一种架构设计,使用多个独立的Transformer(DiT)分别处理不同的模态或任务,并通过联合自注意力进行交互。在Vera中,三个DiT分别处理编辑层、alpha遮罩和合成视频。这个概念受自多模态学习的启发,Vera首次将其用于视频编辑。

Vera的训练数据为什么这么重要?因为分层视频编辑需要“输入视频-编辑层-遮罩-合成视频”这种四元组数据,而公开数据集基本没有。Vera团队从零搭建了一套数据生产线,利用精确的alpha遮罩(来自VideoMatte240K)、分割和抠图工具,以及Omnimatte优化,创造出高质量的训练数据。实验表明,每加入一个数据子集,模型效果都有显著提升。可以说,数据是Vera成功的基石之一。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

Vera提出了分层视频编辑的新范式,将“生成编辑层+alpha遮罩+合成视频”作为输出,从表征层面解耦了内容保留和创意生成。MoT架构的应用也很有新意。整体创新度很高。

实验合理度:★★★★☆

实验非常全面,包含定量指标、用户研究、多种消融,对比方法覆盖了当前所有主流开源模型。但主要对比对象都是开源模型,未与闭源商业模型(如Runway Gen-3、Pika)比较,虽然这可以理解。另外VLM-based指标(CS, CT)的可靠性虽经设计但仍有争议。

学术研究价值:★★★★★

分层编辑的思路为视频编辑领域的“内容保留”难题提供了全新视角,很可能引发后续一系列相关研究。数据构建方法和MoT架构分析也有很强的参考价值。

稳定性:★★★★☆

由于分层机制,保留区域的稳定性非常高(不受生成过程干扰)。但编辑层的质量依赖模型,可能在某些复杂场景(如多对象遮挡)出现不稳定的alpha预测。整体稳定性在现有方法中属于上乘。

适应性以及泛化能力:★★★★☆

目前主要针对背景更换和对象添加,但框架设计可扩展到其他编辑类型。数据多样性方面,训练集包含多种场景和运动,测试集也覆盖了不同难度。但半透明区域近似假设限制了其在某些场景的应用。整体泛化能力良好。

硬件需求及成本:★★★☆☆

Vera-1.3B(3.9B参数)需要约20GB显存(估算),Vera-14B(42B参数)需要约80GB显存。生成速度比VACE慢3倍。训练成本较高,但推理时使用1.3B版本已足够,对高端GPU玩家友好,个人创作者可能需云服务。

复现难度:★★★★☆

论文提供了详细的架构描述和数据构建流程,但训练数据需要从多个来源整合并经过复杂流水线处理,复现有一定门槛。代码和模型权重尚未开源(论文发布时),若开源则复现难度会降低。

产品化成熟度:★★★☆☆

Vera在内容保留上表现出色,但速度较慢,且当前只支持两种编辑模式。要成为像Runway那样的通用产品,还需要扩展功能、优化速度。不过作为Netflix的成果,可能已在内部制作流程中使用,有一定产品化基础。

可能的问题:1. MoT架构参数量是单DiT的三倍,但性能提升与参数量增长不太成比例(参数量3倍,PSNR提升约1.5dB),效率优化空间大。2. 论文未对生成编辑层的多样性进行讨论,可能存在模式坍塌风险。3. 半透明区域近似虽合理,但在极端情况(如烟、雾特效)下可能不够鲁棒。



主要参考文献

[1] Wan et al. Wan2.1: Open and advanced video generation. 2025.
[2] Jiang et al. VACE: All-in-one video creation and editing. 2025.
[3] Zhang et al. ReCo: Region-constrained video editing. 2025.
[4] Liang et al. Mixture-of-Transformers: A scalable framework for multi-modal learning. 2025.
[5] Lee et al. Generative Omnimatte: Video decomposition for editing. 2025.
[6] Lin et al. VideoMatte240K: A high-quality video matting dataset. 2021.
[7] Ji et al. LayerFlow: Layered video generation from per-layer prompts. 2025.
论文原文:https://arxiv.org/pdf/2606.23610v1.pdf
项目主页:https://vera-layered-diffusion.github.io/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。