← 返回 PaperDaily 视觉与图像

ICCV 2026风格D2DF:视频移物一步搞定,还能不要草稿

这篇工作最狠的地方,不是“能修视频”,而是把“多步扩散修复”硬生生压成了一步,还顺手把对外部草稿的依赖也掐掉了。对于视频对象移除这种既要像真、又要够快的任务,D2DF给出了一条很工程化的路子。

ICCV 2026风格D2DF:视频移物一步搞定,还能不要草稿
原论文信息如下:
论文标题:
From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
发表日期:
2026年07月
发表单位:
西安交通大学、国家电网公司SGIT AI Lab、浙江工业大学、百度
原文链接:
https://arxiv.org/pdf/2607.14976v1.pdf
开源代码链接:
https://github.com/bigD233/D2DF
项目链接:
https://github.com/bigD233/D2DF/raw/main/docs/assets/teaser.png

从草图依赖到一步自主:揭秘D2DF的视频对象移除革命

视频对象移除这件事,表面上像“把人抠掉”,实际上更像“把被遮住的背景重新编出来”。难点不在于擦掉前景,而在于擦掉之后,背景要连续、纹理要自然、时间上还不能穿帮。这篇论文最有意思的地方,就是没有继续在“多步扩散慢慢磨”这条路上死磕,而是直接把任务改造成一个更工程化的问题:先有草稿,再把草稿炼成高质量结果;最后连草稿都不要了,直接一步生成。
封面
图1:D2DF整体框架示意图。论文把传统方法和扩散模型的优点拆开再拼起来,先得到草稿引导的一步精炼器,再进一步蒸馏成完全无草稿的一步生成器。
这类工作之所以值得看,不只是因为“快”,而是因为它试图解决一个非常现实的矛盾:扩散模型画得更真,但慢;传统传播方法跑得快,但容易糊。D2DF的思路很像先找一个靠谱的打底师傅,再把打底师傅的经验压缩成一个“一锤定音”的学生模型。听起来简单,真正难的是:怎么让学生学到“正确轨迹”,而不是学到一条歪歪扭扭的捷径。

瓶颈何在?传统方法与扩散模型的双重重负

先把背景讲清楚。视频对象移除(Video Object Removal,VOR)指的是把视频里不想要的目标删掉,然后把被遮住的区域补出来。它和视频修补(video inpainting)很像,但更强调“指定对象”的去除,往往还伴随着更复杂的遮挡、更大的空洞和更严格的时序一致性要求。
传统方法通常依赖光流传播或注意力机制。这里的光流可以理解成“像素在相邻帧之间怎么挪动”的估计,能把背景纹理从可见区域搬到遮挡区域。问题在于,搬得快,不代表搬得像。一旦遮挡面积大、运动复杂或者背景结构本身不规则,传播出来的内容就容易糊、容易断、容易出现结构变形。说白了,就是“草稿感”太重。
扩散模型则走了另一条路:它不靠传播“现成像素”,而是通过多步去噪逐渐生成结果,视觉真实感更强,补洞能力也更好。可惜代价同样明显——步数一多,速度就下来了。论文里点得很直接:多步扩散的推理本质上慢,往往要几十步采样,实际部署时很难让人满意。于是问题就变成了一个老生常谈但又绕不开的矛盾:想要真,就慢;想要快,就容易假
D2DF给出的答案很务实:既然传统方法能给出一个“还算靠谱的草稿”,那就不要让扩散模型从零开始瞎猜;既然有了强条件,扩散模型的多步过程其实可以被压缩;再进一步,既然学生模型已经学会“怎么修草稿”,那就想办法把草稿也在模型内部自己造出来。这个思路看着朴素,实际上非常工程化,甚至有点“把复杂问题拆成两个更容易的问题”的味道。🤨

三阶段渐进:从教师模型到一步生成

D2DF不是一个“单点改进”,而是一个三阶段递进框架。它的核心逻辑可以概括成一句人话:先训练会修草稿的老师,再让学生学会一步修,再让学生学会自己造草稿
图3:D2DF整体流程与PPCD蒸馏管线
图3:D2DF的整体流程。左边是三阶段框架,右边是论文提出的PPCD蒸馏过程。这个图基本把全文主线讲明白了:教师负责提供稳定轨迹,学生负责把多步过程压成一步,最后再通过SGFP去掉外部草稿依赖。
第一阶段是草稿引导的扩散教师。这里的“草稿”不是随便画两笔,而是来自现有视频对象移除方法的粗修结果,比如 ProPainter 这类方法输出的初稿。教师模型 D-LDM(Draft-Guided Latent Diffusion Model,草稿引导潜空间扩散模型)在草稿条件下做多步去噪,目标不是一步到位,而是先学会“把糟糕草稿修成高质量视频”。这一步的意义很大,因为它把原本非常难的生成任务,变成了一个更容易学习的“修复任务”。
第二阶段是草稿引导的一步精炼器,也就是 D2DF-DG。论文这里没有直接照搬常规一致性蒸馏,而是提出了 PPCD(Prior-Privileged Consistency Distillation,先验特权一致性蒸馏)。这个名字看着拗口,意思其实很直白:蒸馏的时候,教师模型不再拿“有瑕疵的草稿”当条件,而是临时享受一下“特权”——直接看真值视频。这样教师生成的轨迹更稳定,学生学到的目标也更干净。
图2:不同条件下教师模型的去噪轨迹对比
图2:不同条件下教师模型 D-LDM 的输出轨迹对比。红色实线是真值去噪轨迹,虚线是教师在草稿条件下走出来的轨迹,短实线则是教师在当前时刻给出的目标。论文借这个图说明:如果教师自己都在“歪路”上走,学生很难学出稳定的一步映射。
第三阶段是无草稿的一步生成器 D2DF-DF。虽然 D2DF-DG 已经很快,但它仍然依赖外部草稿,前面那一步粗修还是要别人来做。论文在这里继续往前推了一步:设计 SGFP(Self-Guided Fast Planting,自引导快速种植)模块,直接在潜空间里生成“伪草稿”,让模型自己给自己搭一个可用的先验。这样一来,最终模型就不再需要外部草稿输入,真正实现端到端的一步视频对象移除。

PPCD:黄金轨迹的蒸馏魔法

PPCD是这篇论文最关键的技术点。它解决的不是“能不能蒸馏”,而是“蒸馏时老师给出的路线是不是靠谱”。在常规一致性蒸馏里,教师模型如果本身就是在有缺陷的条件下生成轨迹,那么学生学到的目标就会很飘,像跟着一个自己也不认路的导航走,最后大概率越走越偏。
PPCD的做法很聪明:蒸馏阶段把教师输入里的草稿换成真值视频,也就是论文里说的“privileged prior”。这里的“特权”不是玄学,而是训练时临时把答案给老师看。这样做的结果是,教师的去噪轨迹更接近真值路径,学生从中学到的是一条稳定、干净、可收敛的黄金轨迹。学生在推理时虽然还是吃草稿输入,但学到的是更可靠的映射关系。
从方法论上看,PPCD本质上是在解决“监督信号不稳”的问题。很多蒸馏方法失败,不是因为模型不够大,而是因为老师给出的中间目标太脏。D2DF这里没有去硬改网络结构,而是先改训练条件,让老师先走正道,再让学生学正道。这个思路很像做题时先把标准答案摆正,再去训练解题步骤,少了很多“自我感动式优化”。
表4:PPCD消融实验
表4:PPCD消融实验。这里比较了直接训练扩散模型、常规一致性蒸馏和加入特权先验后的效果。结果说明,单纯蒸馏已经能带来提升,但把真值作为教师条件后,效果还能进一步变好,说明“黄金轨迹”确实更稳。

SGFP:无中生有的潜在先验

如果说 PPCD 解决的是“怎么让老师教得准”,那 SGFP 解决的就是“怎么让学生不用再找外部草稿”。SGFP 的全称是 Self-Guided Fast Planting,中文可以理解为自引导快速种植。这个名字挺形象:不是从外面搬一张草稿进来,而是在模型内部的潜空间里先种出一个可用的伪草稿,再继续完成生成。
图4:SGFP模块在潜空间中重建伪草稿
图4:SGFP管线。整个重建过程都在潜空间完成,并通过基于有效补丁和空间窗口的注意力掩码来约束信息流动。这个设计的核心是:只让模型依赖“看得见的区域”,避免它在被遮挡区域里胡乱脑补。
SGFP不是简单地把缺失区域补一补,而是把视频潜变量切成补丁序列,用 Temporal Masked Transformer(TMT,时间掩码 transformer)去建模时空信息。这里的关键是两个约束。第一,只有未被遮挡的补丁可以作为 Key 和 Value,被遮挡的区域不能反过来污染注意力;第二,再加一个空间窗口限制,只在局部邻域里做注意力交互,减少复杂度,也让重建更贴近局部结构。说白了,这就是“别让脑补跑太远”。
SGFP生成的伪草稿并不追求像素级精细,它更像一个“够用的背景先验”。论文还专门做了可视化诊断:伪草稿看起来有块状感,但已经能保住大致的颜色分布和结构轮廓。对后续一步生成来说,这已经足够了。毕竟这里不是让伪草稿当最终成品,而是让它当一个靠谱的起点。
图9:草稿与伪草稿可视化对比
图9:草稿与伪草稿对比。(a)是真值,(b)是带瑕疵的草稿,(c)是由解码器可视化出的伪草稿。可以看到,伪草稿虽然粗糙,但已经保留了足够的背景结构信息,能作为后续生成的有效先验。

效率与精度的双重胜利:实验对比与深度分析

这部分最值得看的,不只是“分数高”,而是它把“质量、速度、鲁棒性”三件本来很难同时兼顾的事,尽量揉到了一起。实验设置上,论文使用了 RORD、ROVI 和 VPLM 三个数据集做评估,这三个数据集都提供原视频、对象掩码和真值移除结果,比较适合做客观指标分析。评价指标则包括 PSNR、SSIM、VFID 和 LPIPS:前两个偏像素级,后两个更看感知质量和时序真实感。
实验设计本身是合理的。因为 VOR 的核心痛点就是大遮挡和时序一致性,所以只看单帧指标不够,必须同时看视频层面的质量和效率。论文还额外做了不同遮挡比例下的对比,以及零样本泛化和草稿来源鲁棒性分析,这些都不是“摆摆样子”,而是直接对应真实部署里最容易翻车的地方。
表1:RORD、ROVI和VPLM上的定量结果
表1:在 RORD、ROVI 和 VPLM 三个数据集上的定量对比。D2DF-DG 在大多数指标上拿到最好或接近最好的结果,D2DF-DF 虽然比 DG 略低,但依然在多个数据集上保持领先,说明去掉外部草稿后性能没有塌得太厉害。
从结果上看,D2DF-DG 的优势很明确,尤其在 RORD 和 VPLM 上,说明“先验特权蒸馏”确实把一步模型的上限抬起来了。更有意思的是,D2DF-DF 去掉外部草稿后,虽然略有回落,但并没有掉出第一梯队,这说明 SGFP 不是纯粹的“凑数模块”,而是真的在提供可用先验。换句话说,论文不是在拿一个更重的系统换更高分,而是努力把性能压缩到更轻的推理路径里。
表2:扩散类方法效率对比
表2:扩散类方法的效率对比。这里最扎眼的是总耗时,D2DF-DF 只需要约 1.05 秒,而一些多步扩散方法动辄几十秒。论文还指出,完整流程包含潜空间编码和解码后,总处理时间仍然能控制在 10 秒以内,这对视频编辑场景非常关键。
效率这块,D2DF 的确很有说服力。传统扩散方法最大的问题就是“效果不错,但等得人心累”,而 D2DF 直接把推理压成一步,差距是数量级级别的。更关键的是,D2DF-DF 不仅快,还把外部草稿的前处理时间也砍掉了,这意味着真正部署时,系统复杂度和推理链路都更短。对于工程侧来说,这种优化比单纯涨 0.5 个点更有价值。
图5:不同遮挡比例下的性能比较
图5:不同遮挡比例下的模型表现。论文发现,在遮挡比例较低时,D2DF 与传统方法差距不算特别夸张;但随着遮挡面积增大,D2DF 的优势明显扩大。这其实很符合直觉:遮挡越大,越不能只靠局部传播硬补,越需要真正强的生成能力。
图6:视频对象移除的定性对比
图6:视频对象移除定性对比。可以看到,D2DF-DF 在背景重建上更稳,尤其在大面积遮挡时,纹理连续性和结构完整性都更好。相比之下,其他方法容易出现模糊、纹理断裂或者局部伪影。
图7:极端遮挡条件下的对比
图7:极端遮挡条件下的对比。这里最能看出 D2DF 的价值:当背景信息根本无法靠帧间传播拿到时,传统方法就容易直接露怯,而 D2DF 还能靠一步生成把结构撑起来。对真实视频编辑来说,这种“遮得越狠越能扛”的能力,比平时小修小补更重要。
图8:草稿来源鲁棒性与泛化验证
图8:草稿来源鲁棒性验证。虽然 D2DF-DG 是用 ProPainter 草稿训练的,但面对 DiffuEraser、ProPainter、FuseFormer 等不同来源的草稿时,依然能保持不错的修复效果。这说明它学到的不是某个特定草稿分布,而是更通用的“如何修草稿”。
表5:SGFP消融实验
表5:SGFP 消融实验。结果表明,Transformer 层、有效补丁筛选、空间窗口约束、仅重建遮挡区域,这几个设计是一步一步把效果抬上去的。尤其是空间窗口和只重建遮挡区域这两个限制,说明这个模块不是“越自由越好”,而是“越克制越稳”。
表6:三阶段框架消融实验
表6:三阶段框架消融实验。这里进一步证明了,PPCD 是把 D2DF-DG 做好的关键,而 SGFP 则是把它变成无草稿版本的关键。两者不是互相替代,而是前后接力。
综合看下来,D2DF 的实验结论比较完整:一是质量上能打,二是速度上真快,三是泛化和鲁棒性也有比较扎实的验证。论文还做了失败案例分析,说明当多个物体之间存在复杂互相遮挡时,模型仍然会遇到困难。这个结果很正常,也很诚实。毕竟视频对象移除不是魔法,复杂遮挡下的信息缺失太重,任何方法都不可能凭空还原所有细节。
图10:失败案例分析
图10:失败案例分析。复杂互相遮挡的场景仍然会让模型失手。这个图的价值在于提醒读者:D2DF 强的是“把大多数真实场景做得又快又好”,但不是“所有极端情况都能一把梭”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视频对象移除里“又要真、又要快、还不要外部草稿”的矛盾。先用草稿引导扩散模型提升质量,再把多步过程蒸馏成一步,最后再把草稿依赖也去掉。

PPCD里的“特权先验”是什么意思?就是蒸馏教师时,不再让教师看有瑕疵的草稿,而是直接给它真值视频当条件。这样教师轨迹更稳定,学生学到的目标也更干净。

SGFP为什么不直接在像素空间做,而要在潜空间里做?因为潜空间更省算力,也更适合做快速重建。SGFP先在潜空间里种出一个伪草稿,再交给一步生成器完成最终修复,这样既快又能保留足够的背景先验。

如果还有哪些想继续深挖的地方,欢迎留言继续聊。

龙哥点评

论文创新性分数:★★★★☆。PPCD + SGFP 这套组合拳不算“从天而降”的新范式,但把草稿引导、特权蒸馏、潜空间伪草稿串成完整链路,思路是连贯且有针对性的。

实验合理度:★★★★☆。数据集、指标、遮挡比例、零样本、草稿来源鲁棒性和消融都覆盖到了,验证比较完整;唯一要警惕的是,系统里前置草稿来源仍然会影响最终链路。

学术研究价值:★★★★☆。这篇工作把“先验条件如何帮助扩散模型做视频修复”讲得很清楚,对后续高效视频生成和任务蒸馏都有参考意义。

稳定性:★★★☆☆。D2DF-DF 已经比多步扩散稳得多,但在复杂互遮挡场景下仍会失败,说明它还不是可以闭眼上线的万能方案。

适应性以及泛化能力:★★★★☆。草稿来源切换后还能工作,零样本也能保持竞争力,说明泛化不错;但它仍然更适合“对象移除”这一类相对明确的编辑任务。

硬件需求及成本:★★★★☆。推理已经压到一步,速度很友好,D2DF-DF 的总耗时也很亮眼;训练阶段依然要依赖较重的扩散教师和大模型底座。

复现难度:★★★☆☆。框架思路清楚,代码也开源了,但涉及多阶段训练、草稿来源、潜空间蒸馏和大模型权重,完整复现并不算轻松。

产品化成熟度:★★★★☆。如果目标是视频编辑或内容清理,这类方法已经很接近实用;但在高遮挡、复杂交互和严格一致性要求下,仍需要额外验证。

可能的问题:核心问题不是“能不能跑”,而是复杂场景下是否会出现结构漂移和局部伪影;另外,外部草稿依赖虽然被 D2DF-DF 去掉了,但训练链路仍然不轻。


主要参考文献

[1] Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang. From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting. arXiv:2607.14976v1, 2026.
[2] D2DF 开源代码:https://github.com/bigD233/D2DF
[3] 项目演示图:https://github.com/bigD233/D2DF/raw/main/docs/assets/teaser.png

视频对象移除最怕两件事:一是修得假,二是跑得慢。D2DF把这两件事一起收拾了,适合想看“扩散模型怎么从多步卷到一步”的读者。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,一起聊视频修复、生成加速和工程落地。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。