论文标题:
Zero-Shot Video Restoration and Enhancement with Text-to-Image Latent Diffusion Models and Multi-Modal References
发表日期:
2026年08月
发表单位:
天津大学、Lappeenranta-Lahti University of Technology LUT(芬兰)
原文链接:
https://arxiv.org/pdf/2608.26476v1.pdf
如果说双提示调优解决了“快”的问题,那么纹理感知视频令牌合并(Texture-Aware Video Token Merging)解决的是“稳”和“清晰”的平衡问题。令牌合并(Token Merging)并不是新概念。它最早用于加速ViT(Vision Transformer,视觉Transformer)推理,后来被VidToMe引入视频生成领域:把不同帧之间相似的token合并成一个,自注意力计算完后还原,既减少了计算量,又因为跨帧token共享而增强了时序一致性。但一刀切的合并比例有问题——在视频修复任务中,纹理丰富的区域(比如毛发、布料纹理、树叶)对合并操作非常敏感,合并比率一大就糊成一团;而平滑区域(比如天空、墙面)怎么合并都无所谓。ZVRM把这个观察落到了具体设计里:用训练好的像素分类器把每一帧划分成平滑区域和纹理丰富区域,对两类区域分开算合并比例。平滑区域的合并比率r_s可以设得很大(省计算),纹理区域的合并比率r_t则保持很小(保细节)。更机智的是,分类器不是在一开始就定死,而是在采样过程的后半段每隔25步(N_c=25)基于当前生成的潜在表示重新分类一次——因为修复过程中图像质量在逐步改善,分类边界也该动态更新。对于低光增强任务,输入帧太暗影响分类,论文先做一次伽马校正(gamma correction)再分类。在具体实现上,纹理感知令牌合并分为空间和时间两个维度。纹理感知空间令牌合并对单帧内部的token按区域分类后分别进行相似度匹配和合并;纹理感知时间令牌合并则以第一帧为关键帧,把其他帧的token按区域分好再进行跨帧合并。时间维度的合并能在帧间共享信息,空间维度的合并能减少单帧冗余,两者加在一起,才让“既保持时序稳定又保住细节”不再是一句空话。这里有个值得一提的细节:ZVRM会把U-Net里所有3×3的2D卷积替换成1×3×3的3D卷积,让网络本身具备“看视频”的能力,而不仅仅是“看单帧”。这也是时序一致性的底层保障之一。从消融实验可以看到,去掉纹理感知空间令牌合并或时间令牌合并,WE指标都会明显反弹,而加上两者则能大幅下探。这直接验证了“不同区域不同合并比率”这个核心假设的有效性。
实验验证:全面超越现有零样本方法
论文在三个任务上验证了ZVRM的效果:4倍视频超分、视频去模糊、低光视频增强。测试数据来自REDS4、UDM10、DAVIS(修复任务)和DID数据集(低光增强,真实世界拍摄)。所有视频先中心裁剪到512×512分辨率,退化设置参照PSLD和DDRM的线性退化模型。对比方法选择PSLD(同为SD v1.5骨干)和VISION-XL(SDXL骨干),为了保证公平,ZVRM分别用SD v1.5和SDXL适配进行对比。评估指标除了常用的PSNR和SSIM,还加入了Warping Error(WE,扭曲误差)来衡量时序一致性。WE的计算方式是对帧做光流扭曲后与相邻帧比较差异,数值越低代表时序越稳定。值得注意的是,PSNR和SSIM并不能很好地反映闪烁问题,而WE能直接量化这个影响——这也是为什么论文把WE作为核心指标之一。表1展示4倍视频超分的定量对比。ZVRM(无参考)在SD v1.5骨干上全面超越PSLD:PSNR提升0.31dB,WE从2.0854降到0.5003(约1/4)。换用SDXL骨干后ZVRM(无参考)照样超越VISION-XL,PSNR 26.13dB vs 25.91dB,WE几乎是VISION-XL的一半。表2是低光视频增强的对比。同样是无参考设置,PSNR提升0.23dB,WE降到PSLD的约1/3。文本参考和图像参考还能继续带来提升。定量结果确实亮眼,但视觉对比更能直观感受差异。下图是视频超分和低光增强的可视化对比。图2:视频超分和低光视频增强的视觉质量对比。视频超分场景中,PSLD结果在巴士顶部区域不同帧呈现出不一致的纹理,而ZVRM恢复了时序一致的结果;低光增强场景中PSLD丢失大量细节,ZVRM保留了更多纹理并维持了时序稳定。由于ZVRM是一个模块化方法,可以即插即用地迁移到其他扩散骨干上。论文把ZVRM的时序模块迁移到DiffBIR上做盲视频超分,与DiffIR2VR和ZVRD对比,结果如下表。表4是DAVIS数据集上4倍盲视频超分(blind video super-resolution)的对比。ZVRM的引入让DiffBIR的PSNR从24.47dB提升到25.35dB(+0.88dB),WE从2.4785大幅降到1.3057,远超DiffIR2VR和ZVRD。表5是消融实验:DPTI(双提示调优反演)、DPTS(双提示调优采样)、TSTM(纹理感知空间令牌合并)、TTTM(纹理感知时间令牌合并)、RSA(参考自注意力)、RTM(参考令牌合并)逐一移除后对效果的影响。图3展示了不同参考图像来源的定性结果。从消融实验来看,DPTI和DPTS是加速与性能提升的核心;TSTM和TTTM对时序一致性的贡献显著;RSA和RTM在提供图像参考时作用关键。每一个模块都有明确的功能定位,组合起来才形成完整的ZVRM。论文还展示了一个有趣的现象:当提供“莫奈风格”这样的风格化文本参考时,增强结果真的带上了印象派的笔触;当用户希望做盲修复时,ZVRM也能迁移到DiffBIR这样的专用骨干上,展现出不俗的适应性。图4:盲视频超分的视觉质量对比。在真实的盲退化场景下,ZVRM迁移到DiffBIR骨干后依然能带来更清晰的纹理和更好的时序一致性。补充材料中,SDXL骨干上的视频超分结果同样显示出ZVRM在纹理恢复上的优势。视频去模糊任务上,ZVRM依然保持了更高的细节还原度和帧间一致性。
[1] Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models. NeurIPS 2020.[10] Luo Z, Gustafson F K, et al. PSLD: Zero-shot image restoration with text-to-image latent diffusion models.[14] Rombach R, Blattmann A, et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022.[19] Li X, et al. VidToMe: Video token merging for zero-shot video editing.[20] Zhang Y, et al. ZVRD: Zero-shot video restoration with diffusion models.[23] Wang X, et al. VISION-XL: Pseudo-batch consistent sampling for zero-shot video restoration.[29] Garber D, et al. Distortion Adaptive Inversion for zero-shot image restoration.[33] Nah S, et al. NTIRE 2019 Challenge on Video Deblurring and Super-Resolution (REDS).[36] Chen C, et al. DID: Deep inverse rendering for low-light video enhancement.