← 返回 PaperDaily 视觉与图像

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成

又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References
发表日期:
2026年08月
发表单位:
天津大学、Lappeenranta-Lahti University of Technology LUT(芬兰)
原文链接:
https://arxiv.org/pdf/2608.26476v1.pdf

零样本视频恢复的困境:时序闪烁与推理瓶颈

先聊一个让很多视频修复研究者头疼的场景:有一段老视频,画质模糊、细节缺失、亮度昏暗,你想把它修好。如果用传统监督学习方法,得先针对具体退化类型准备成对数据、训练专用模型,换一种退化就得重新训练。于是“零样本”修复成了香饽饽——不训练,拿一个预训练扩散模型直接上手修。PSLD这类方法在图像上确实惊艳,一张糊图扔进去,出来就是清晰的。但问题来了:一旦输入从一张图变成一段视频,画面就开始“闪”。
为什么闪?核心原因在于预训练的文本到图像潜在扩散模型(比如Stable Diffusion)根本没有时序建模能力。它是为单张图片设计的,不认识“帧与帧之间的关系”。直接对每一帧单独修复,每帧的采样噪声、生成细节都会随机漂移,结果就是同一物体在不同帧里纹理忽隐忽现、颜色跳动、边缘闪烁。这种闪烁在PSNR指标上可能看不出大问题,但人眼一看就别扭,完全没法用。
另外一个痛点就是慢。PSLD做零样本图像修复默认要跑1000步扩散采样,处理一张图都要几分钟,处理一段几十帧的视频,时间直接奔着小时级去了。就算有DDIM反演加速,用于视频编辑可以,但用在修复上又会出问题——因为要反演的是退化帧而非干净帧,单纯把退化图反演成噪声再采样,结果会偏向重建出退化帧本身,修复效果大打折扣。
天津大学团队这篇文章,目标就是同时解决这两大问题:让零样本视频修复既快又稳,还顺手把“多模态参考”这扇门给打开了——不仅能无参考修复,还能

多模态参考注入:从文本到图像的引导机制

ZVRM(Zero-shot Video Restoration and enhancement with Multi-modal references,零样本多模态参考视频修复与增强)最大的亮点之一,就是支持多模态参考。什么叫多模态参考?通俗点讲,就是在修复视频时,除了视频本身,还可以额外塞给它一些“提示信息”——要么是一段文字,要么是一张干净的参考图,甚至两者一起给。
文本参考很好理解。比如有一段老视频拍的是城市街景,你想把它修成“黄昏暖色调的电影质感”,直接输入一句描述就好。论文里做了个有趣的实验:给模型提供“莫奈风格”这样的文字,增强结果真的就带上了印象派的笔触和色调。这种玩法在图像修复里已经有人试过,但在零样本视频修复里,ZVRM是第一个系统化支持文本参考的。文本描述可以直接来自用户偏好,也可以从高清参考帧用GPT-4o自动生成——论文实验里就是让GPT-4o看高清GT帧来写描述文本的。
图像参考则更有意思。想象一个场景:你手头有一段模糊的视频,但恰好有一张从另一个角度拍摄的清晰照片(比如手机连拍或监控多机位)。这张参考图可以在修复时给模型“打样”——告诉它真实的纹理长什么样。为此,论文提出了两个配套模块:参考自注意力(Referenced Self-Attention)参考令牌合并(Referenced Token Merging)
参考自注意力的原理并不复杂。原本U-Net里的自注意力层,让每个位置的token只跟同帧其他位置的token做交互,参考自注意力则把参考图的key和value也一起拼接进来,让当前帧的token既能关注自身,也能“抄”参考图的纹理特征。这个过程可以理解为:模型在生成某帧细节时,随时可以瞄一眼参考图,看真实纹理该长什么样。
(a) 不同类型的参考图用于RealMCVSR数据集上的零样本视频超分 (b) 图3:RealMCVSR数据集上不同类型的参考图用于零样本视频超分
图3:RealMCVSR数据集上不同类型的参考图像用于零样本视频超分。图中对比了无参考、不同来源参考图(Ref. 1为GT帧、Ref. 2为检索图、Ref. 3为其他角度拍摄图)对修复结果的影响。
参考令牌合并则更进一步:参考图作为“关键帧”,当前帧的token在与参考图相似度高的位置上与参考图token进行合并,相当于把参考图的纹理“移植”到当前帧上。这两个模块交替作用于U-Net的Transformer块里,让纹理迁移更充分。实验表明,引入参考图(Ref. 1)在4倍视频超分任务上PSNR比无参考再涨0.45dB,时序一致性WE从0.5003进一步降到0.3871。
值得一提的是,ZVRM不仅支持单一参考,还支持文本+图像混合参考。实验里“text Ref.+image Ref. 1”的组合取得了最好的效果,PSNR达到25.61dB,WE降到0.3871,说明多模态信息确实能互相补充。论文里的消融研究也证明了参考自注意力和参考令牌合并各有贡献,合在一起效果最佳。

参考图哪里来?三种来源揭示泛化潜力

论文还细致地区分了参考图的三种来源:Ref. 1是从GT视频里挑一帧不重叠的干净帧;Ref. 2是从外部检索得到的干净图;Ref. 3是另一个视角拍摄的干净图。这三种来源对应了真实世界中的不同应用场景。从表格可以看出,Ref. 1效果最好(毕竟和GT最接近),但Ref. 2和Ref. 3也都带来了明显提升——尤其是WE指标,三种参考图都远优于无参考。这说明ZVRM对参考图来源不挑剔,泛化能力相当不错。

双提示调优:加速与质量兼得的采样策略

解决了“怎么修”的问题,接下来是“怎么修得快”。扩散模型修复的痛点在于采样步数太多——PSLD在图像修复上默认要跑1000步迭代,这在视频上完全不可接受。ZVRM的解决方案是双提示调优反演与采样(Dual Prompt Tuning Inversion and Sampling),把采样步数从1000步砍到250步,外加60步反演,总推理时间缩短到原来的近三分之一。
在展开细节之前,有必要科普一下扩散模型反演(inversion)。扩散模型的生成过程是把一个高斯噪声慢慢去噪成清晰图像,反演则是反过来,把一张图像慢慢加噪变回噪声图。DDIM反演(DDIM Inversion)是零样本视频编辑的常用加速手段,它把输入帧反演到带噪的潜在空间作为采样起点,减少从纯噪声出发的随机性。但这里有个坑:DDIM反演适合干净图,不适合退化图。当输入是退化帧时,反演得到的噪声序列会偏离标准正态分布,导致后续采样结果被“带偏”,最终修复效果失真。
DDIM采样公式
上式是DDIM采样的核心公式,z_t为t步的带噪潜在表示,ε_θ是U-Net预测的噪声,α_t和σ_t是噪声调度参数。该公式在去噪过程中同时利用当前噪声状态和模型预测的干净图像,实现确定性采样。
ZVRM的巧妙之处在于:反演过程中不仅调整噪声状态,还同步优化文本条件嵌入(conditional embedding)和无条件嵌入(unconditional embedding),让它们更好地编码退化图像的信息,从而在加速的同时避免结果偏向重建退化帧。这就是“双提示调优”的含义——同时对条件提示(文本向量)和无条件提示(空文本向量)做优化。
DA反演公式
ZVRM采用DA反演(Distortion Adaptive Inversion,失真自适应反演)将退化帧的潜在表示z_0转换为稍带噪声的z_T',T'=15,为采样提供更好的初始化。η是控制噪声强度的超参数,ε'_t为高斯噪声。
条件嵌入优化目标
双提示调优反演的第一步:固定无条件嵌入为∅,优化条件嵌入C_t,使其能将退化帧反演到目标噪声轨迹。第一项保证重构保真度,第二项约束相邻帧的条件嵌入保持一致,从而提升时序一致性。
无条件嵌入优化目标
双提示调优反演的第二步:固定优化后的条件嵌入C,优化无条件嵌入O_t。同样有帧间一致性约束(γ₂控制强度)。
反演阶段优化好的条件/无条件嵌入,在采样阶段还会继续微调。采样过程交替优化条件嵌入、无条件嵌入和扩散结果本身,每一步都对嵌入做帧间一致性约束。这样既保证了采样结果与退化输入的内容一致性,又避免了帧间的随机漂移。论文将这种方式命名为双提示调优采样。由于嵌入在反演阶段已获得了很好的初始化,采样阶段只需在最后的5步(T_dpts=5)内做5次迭代优化(N=5),开销可控。
采样阶段条件嵌入优化
双提示调优采样的条件嵌入优化。第一项是测量一致性约束(y是退化观测,A是退化算子,D是潜在解码器),第二项是帧间一致性约束。
采样阶段无条件嵌入优化
双提示调优采样的无条件嵌入优化,固定条件嵌入C_t*后优化O_t。
很多人会将双提示调优类比为“给模型开了外挂”——因为条件嵌入被优化成最适配当前退化视频的文本向量,无条件嵌入也被调优到能更好地辅助生成。两者协同,才能实现用更少的步数跑出更好的效果。实验数据也证实了这一点:仅用双提示调优反演与采样,PSNR从PSLD的24.85dB提到25.16dB(无参考),WE从2.0854大幅降到0.5003,精度和时序一致性同时提升。

纹理感知令牌合并:时序一致性与细节保持的平衡

如果说双提示调优解决了“快”的问题,那么纹理感知视频令牌合并(Texture-Aware Video Token Merging)解决的是“稳”和“清晰”的平衡问题。
令牌合并(Token Merging)并不是新概念。它最早用于加速ViT(Vision Transformer,视觉Transformer)推理,后来被VidToMe引入视频生成领域:把不同帧之间相似的token合并成一个,自注意力计算完后还原,既减少了计算量,又因为跨帧token共享而增强了时序一致性。但一刀切的合并比例有问题——在视频修复任务中,纹理丰富的区域(比如毛发、布料纹理、树叶)对合并操作非常敏感,合并比率一大就糊成一团;而平滑区域(比如天空、墙面)怎么合并都无所谓。
ZVRM把这个观察落到了具体设计里:用训练好的像素分类器把每一帧划分成平滑区域和纹理丰富区域,对两类区域分开算合并比例。平滑区域的合并比率r_s可以设得很大(省计算),纹理区域的合并比率r_t则保持很小(保细节)。更机智的是,分类器不是在一开始就定死,而是在采样过程的后半段每隔25步(N_c=25)基于当前生成的潜在表示重新分类一次——因为修复过程中图像质量在逐步改善,分类边界也该动态更新。对于低光增强任务,输入帧太暗影响分类,论文先做一次伽马校正(gamma correction)再分类。
在具体实现上,纹理感知令牌合并分为空间和时间两个维度。纹理感知空间令牌合并对单帧内部的token按区域分类后分别进行相似度匹配和合并;纹理感知时间令牌合并则以第一帧为关键帧,把其他帧的token按区域分好再进行跨帧合并。时间维度的合并能在帧间共享信息,空间维度的合并能减少单帧冗余,两者加在一起,才让“既保持时序稳定又保住细节”不再是一句空话。
这里有个值得一提的细节:ZVRM会把U-Net里所有3×3的2D卷积替换成1×3×3的3D卷积,让网络本身具备“看视频”的能力,而不仅仅是“看单帧”。这也是时序一致性的底层保障之一。
从消融实验可以看到,去掉纹理感知空间令牌合并或时间令牌合并,WE指标都会明显反弹,而加上两者则能大幅下探。这直接验证了“不同区域不同合并比率”这个核心假设的有效性。

实验验证:全面超越现有零样本方法

论文在三个任务上验证了ZVRM的效果:4倍视频超分、视频去模糊、低光视频增强。测试数据来自REDS4、UDM10、DAVIS(修复任务)和DID数据集(低光增强,真实世界拍摄)。所有视频先中心裁剪到512×512分辨率,退化设置参照PSLD和DDRM的线性退化模型。对比方法选择PSLD(同为SD v1.5骨干)和VISION-XL(SDXL骨干),为了保证公平,ZVRM分别用SD v1.5和SDXL适配进行对比。
评估指标除了常用的PSNR和SSIM,还加入了Warping Error(WE,扭曲误差)来衡量时序一致性。WE的计算方式是对帧做光流扭曲后与相邻帧比较差异,数值越低代表时序越稳定。值得注意的是,PSNR和SSIM并不能很好地反映闪烁问题,而WE能直接量化这个影响——这也是为什么论文把WE作为核心指标之一。
表1:4倍视频超分任务上与SOTA方法的定量对比
表1展示4倍视频超分的定量对比。ZVRM(无参考)在SD v1.5骨干上全面超越PSLD:PSNR提升0.31dB,WE从2.0854降到0.5003(约1/4)。换用SDXL骨干后ZVRM(无参考)照样超越VISION-XL,PSNR 26.13dB vs 25.91dB,WE几乎是VISION-XL的一半。
表2:低光视频增强任务上与SOTA方法的定量对比
表2是低光视频增强的对比。同样是无参考设置,PSNR提升0.23dB,WE降到PSLD的约1/3。文本参考和图像参考还能继续带来提升。
定量结果确实亮眼,但视觉对比更能直观感受差异。下图是视频超分和低光增强的可视化对比。
(a) 视频超分视觉效果对比 (b) 低光视频增强视觉效果对比 图2:视频超分和低光增强的视觉质量对比
图2:视频超分和低光视频增强的视觉质量对比。视频超分场景中,PSLD结果在巴士顶部区域不同帧呈现出不一致的纹理,而ZVRM恢复了时序一致的结果;低光增强场景中PSLD丢失大量细节,ZVRM保留了更多纹理并维持了时序稳定。
由于ZVRM是一个模块化方法,可以即插即用地迁移到其他扩散骨干上。论文把ZVRM的时序模块迁移到DiffBIR上做盲视频超分,与DiffIR2VR和ZVRD对比,结果如下表。
表4:DAVIS数据集上4倍盲视频超分定量对比
表4是DAVIS数据集上4倍盲视频超分(blind video super-resolution)的对比。ZVRM的引入让DiffBIR的PSNR从24.47dB提升到25.35dB(+0.88dB),WE从2.4785大幅降到1.3057,远超DiffIR2VR和ZVRD。
表5:各模块消融实验
表5是消融实验:DPTI(双提示调优反演)、DPTS(双提示调优采样)、TSTM(纹理感知空间令牌合并)、TTTM(纹理感知时间令牌合并)、RSA(参考自注意力)、RTM(参考令牌合并)逐一移除后对效果的影响。图3展示了不同参考图像来源的定性结果。
从消融实验来看,DPTI和DPTS是加速与性能提升的核心;TSTM和TTTM对时序一致性的贡献显著;RSA和RTM在提供图像参考时作用关键。每一个模块都有明确的功能定位,组合起来才形成完整的ZVRM。论文还展示了一个有趣的现象:当提供“莫奈风格”这样的风格化文本参考时,增强结果真的带上了印象派的笔触;当用户希望做盲修复时,ZVRM也能迁移到DiffBIR这样的专用骨干上,展现出不俗的适应性。
图4:盲视频超分视觉质量对比
图4:盲视频超分的视觉质量对比。在真实的盲退化场景下,ZVRM迁移到DiffBIR骨干后依然能带来更清晰的纹理和更好的时序一致性。
图1(补充材料):SDXL骨干上的视频超分视觉对比
补充材料中,SDXL骨干上的视频超分结果同样显示出ZVRM在纹理恢复上的优势。
图2(补充材料):视频去模糊视觉对比
视频去模糊任务上,ZVRM依然保持了更高的细节还原度和帧间一致性。

局限与展望:迈向实时视频恢复

虽然ZVRM把采样步数从1000步砍到250步+60步反演,但离“实时”还有距离。扩散模型的迭代本质决定了它对算力有较高要求,尤其是额外嵌入优化和令牌分类也会增加计算开销。论文中未给出详细的推理时间对比表,这也是未来值得补充的数据。
另外,文本参考在实验中是通过GPT-4o从GT帧生成的,图像参考则是从GT视频或外部检索得到,在实际应用中这些参考不一定可得。如何处理“用户给出模糊甚至错误的参考描述”也是落地时需要考虑的问题。不过考虑到零样本方法本来是“无训练”的通用方案,ZVRM已经在速度和效果之间找到了不错的平衡点。未来若能引入蒸馏或LCM(Latent Consistency Model,潜在一致性模型)这类快速采样技术,再配合时序一致性约束,真正实时的零样本视频修复并非遥不可及。

关于PaperDaily同基准对比的说明

根据PaperDaily已收录论文范围内的同基准辅助判断,ZVRM在4倍视频超分任务上对PSLD的提升(PSNR +0.31dB,WE降至1/4)属于显著优势;与VISION-XL对比(PSNR +0.22dB,WE约一半)也占优,但需注意VISION-XL使用SDXL骨干、ZVRM在对比时也切换为SDXL,属于同一骨干下的公平对比。这里的领先结论限定在PaperDaily已收录论文范围内,且主要基于论文报告数据,供读者参考。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?天津大学等机构提出ZVRM,基于文本到图像潜在扩散模型的零样本视频恢复框架,通过双提示调优反演与采样将推理步骤从1000降至360,配合纹理感知令牌合并与多模态参考注入,在视频超分、去模糊和低光增强任务上显著提升重建质量与时间一致
这篇工作最值得看的点是什么?在所有三个任务上均优于PSLD和VISION-XL,在PSNR、SSIM和WE三个指标上全面领先;在盲视频超分辨率任务上优于DiffIR2VR和ZVRD。
这篇工作的边界或风险在哪里?优点:1) 首次支持多模态参考(无参考、文本参考、图像参考、文本+图像参考)的零样本视频恢复框架;2) 双提示调优反转与采样显著加速推理并增强时序一致性;3) 纹理感知令牌合并有效平衡时序一致性和纹理保持;4) 参考自注意力和参考令牌合并有效支持图像参考。缺点:1) 推理时间仍然较长(7分钟/视频);2) 依赖预训练扩散模型的能力,对复杂退化场景可能受限;3) 文本参考需要额外生成描述文本,实际应用中可能不便。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个基于预训练文本到图像潜在扩散模型和多模态参考的零样本视频恢复与增强框架,通过双提示调优反转与采样、纹理感知视频令牌合并、参考自注意力和参考令牌合并实现加速和时序一致性增强。

实验合理度:★★★★☆

PSNR、SSIM、Warping Error (WE)。

学术研究价值:★★★★☆

提出一个基于预训练文本到图像潜在扩散模型和多模态参考的零样本视频恢复与增强框架,通过双提示调优反转与采样、纹理感知视频令牌合并、参考自注意力和参考令牌合并实现加速和时序一致性增强;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在48G A40 GPU上,无参考模式下每个采样步骤约1.184秒,总推理时间约7分6秒(360步),相比原始PSLD的1000步(23分44秒)加速约3.3倍。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 推理时间仍然较长(7分钟/视频);2) 依赖预训练扩散模型的能力,对复杂退化场景可能受限;

主要参考文献

[1] Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models. NeurIPS 2020.
[10] Luo Z, Gustafson F K, et al. PSLD: Zero-shot image restoration with text-to-image latent diffusion models.
[14] Rombach R, Blattmann A, et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022.
[19] Li X, et al. VidToMe: Video token merging for zero-shot video editing.
[20] Zhang Y, et al. ZVRD: Zero-shot video restoration with diffusion models.
[23] Wang X, et al. VISION-XL: Pseudo-batch consistent sampling for zero-shot video restoration.
[29] Garber D, et al. Distortion Adaptive Inversion for zero-shot image restoration.
[33] Nah S, et al. NTIRE 2019 Challenge on Video Deblurring and Super-Resolution (REDS).
[36] Chen C, et al. DID: Deep inverse rendering for low-light video enhancement.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球