← 返回 PaperDaily 视觉与图像

AVSR-Diff来了:4×到8×都能稳住细节

这篇论文最有意思的地方,不是把视频放大,而是把“放大倍率”和“生成成本”硬生生拆开了。AVSR-Diff 用固定低分辨率潜空间做扩散,再用连续解码补细节,2×到8×都能跑,内存还几乎不涨,工程味很足。

AVSR-Diff来了:4×到8×都能稳住细节
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是把视频放大,而是把“放大倍率”和“生成成本”硬生生拆开了。AVSR-Diff 用固定低分辨率潜空间做扩散,再用连续解码补细节,2×到8×都能跑,内存还几乎不涨,工程味很足。


原论文信息如下:
论文标题:
AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
发表日期:
2026年07月
发表单位:
KAIST, Republic of Korea; Chung-Ang University, Republic of Korea
原文链接:
https://arxiv.org/pdf/2607.00987v1.pdf
项目链接:
https://kaist-viclab.github.io/AVSR-Diff/

视频超分辨率的瓶颈:固定尺度与时间闪烁

视频超分辨率,听起来像是“把视频放大一点”这么简单,实际上它最难的地方不是放大,而是放大以后还得像真的。静态图还好说,视频一旦涉及前后帧,细节就开始互相打架:这一帧窗户清楚了,下一帧窗框又糊了;这一帧衣服纹理出来了,下一帧又像被橡皮擦抹过。读者看到的是“闪”,模型背后其实是时序不稳定。
封面
图1:AVSR-Diff 在大倍率下的视觉质量更强,同时保持了非常高效、几乎恒定的显存占用。
传统基于回归损失的方法,比如常见的 L1、MSE,优点是稳,缺点也很直接:它们太爱“求平均值”了。平均值一求,纹理就没了,画面就容易糊成一片。后来扩散模型登场,生成能力确实强,能补出更多高频细节,但大多数视频扩散方法又被另一个问题卡住了:通常只会固定倍率,比如老老实实做 4×。现实业务里可没这么乖,2×、3.25×、8× 这种“奇葩倍率”才是常客。
更麻烦的是,很多任意尺度方法虽然支持连续放大,但它们大多靠确定性回归,结果就是:倍率一大,纹理直接滑向“高级磨皮”。而把扩散先搬到高分辨率再采样,显存和算力又会像坐电梯一样往上蹿。于是论文一针见血地指出,真正的矛盾不是“能不能超分”,而是如何把生成质量、任意倍率、时间一致性和工程成本同时兼顾
图2:扩散式任意尺度视频超分辨率的概念对比
图2:扩散式任意尺度视频超分辨率的概念对比。(a)现有方法先把输入序列显式放大,再做扩散;(b)AVSR-Diff 先在低分辨率潜空间里做尺度无关的去噪,再通过连续视频解码器实现任意尺度输出。

AVSR-Diff:解耦扩散,打破尺度枷锁

这篇论文最值钱的地方,不是又堆了一个更大的模型,而是把问题拆开了:扩散负责“想象细节”,连续解码负责“按任意倍率把细节画出来”。前者不再跟目标分辨率绑死,后者不再依赖固定倍率的像素重建。这样一来,生成成本就不必随着放大倍数一起爆炸。
图3:AVSR-Diff 的整体架构
图3:AVSR-Diff 的整体架构。可训练的 ControlNet ϕ 引导冻结的去噪 U-Net εθ 完成尺度无关的潜空间去噪;随后,连续视频解码器 Ds 结合 SAFR 模块,根据目标尺度动态调节高频细节。
这里有个很关键的工程判断:去噪过程放在固定尺寸的低分辨率潜空间里,那扩散采样的显存和时间开销就基本不再跟目标倍率强绑定。论文还特意对比了现有做法:如果先把序列拉到目标尺度再做视频扩散,3D U-Net 的内存和计算会跟着分辨率一路膨胀,长视频根本扛不住。AVSR-Diff 的思路就像先在“小厨房”里把菜炒好,再决定装盘多大,别一上来就把整栋楼租下来做饭。
这个解耦框架还有一个隐藏收益:训练和推理都更容易控制。扩散部分直接复用预训练的单图超分扩散模型 Stable Diffusion 4 Upscaler 的 VAE 和去噪 U-Net,视频任务只需要补上时序对齐和连续解码能力,不必从头训练一个巨无霸视频生成器。对工程团队来说,这种“站在预训练模型肩膀上改造”的路线,通常比从零造轮子更现实。

TGFR模块:时间一致性的守护神

扩散模型的老毛病大家都知道:它很会“编”,但也很会“抖”。视频里每一帧都单独采样,细节一旦有一点点随机波动,到了连续解码阶段就会被放大成肉眼可见的闪烁。AVSR-Diff 的 TGFR,英文全称是 Temporally-Gated Feature Recurrence,中文可以理解为“时间门控特征递归”。名字有点长,作用很朴素:把前一帧可靠的特征对齐后传给后一帧,并且不是无脑全收,而是让门控自己判断该不该接收
它的思路其实很工程化。先用光流把上一帧特征粗略挪到当前帧,再用可变形卷积做亚像素级修正,最后再加一个门控融合。前两步解决“对齐不准”,最后一步解决“旧信息别乱灌”。这比单纯做 warp 更稳,因为视频里总有遮挡、形变、运动误差,直接硬拼很容易把错误也一并传下去。
论文在这里还用了一个挺关键的正则:门控稀疏惩罚。意思很直白,别让门一直大开。只有当历史特征真的有帮助时,门才应该开;否则就让模型少依赖旧信息。这个设计很像经验丰富的剪辑师:上一帧有用的镜头留下,抖动镜头直接删掉,别把垃圾素材全塞进成片。
图5:门控稀疏惩罚对长序列稳定性的影响
图5:门控稀疏惩罚对长序列时间稳定性的影响。去掉这个约束后,误差会逐步累积,后面的帧更容易出现结构噪声和漂移。
从结果看,TGFR 解决的不是“让画面更锐”这种表面问题,而是“让扩散后端的连续解码有一个稳定输入”。这件事很重要,因为连续坐标解码对输入特征极其敏感,前面只要抖一点,后面就会抖一大片。TGFR 的价值就在于把这种抖动尽量挡在前面。

SAFR模块:频率自适应,细节更精细

如果说 TGFR 解决的是“别抖”,那 SAFR 解决的就是“怎么补细节”。SAFR 的全称是 Scale-Aware Fourier Refinement,中文可以叫“尺度感知傅里叶细化”。它干的事情很有意思:不是只在空间域里补纹理,而是直接跑到频域里,按目标尺度动态调节高频分量。
为什么要这么做?因为不同倍率对细节的需求不一样。2× 主要是“别糊”,8× 则是“别只剩轮廓”。如果用同一套固定特征去应付所有倍率,很容易在大倍率下过平滑。SAFR 的办法是先把特征送进傅里叶变换,再做通道混合和尺度门控,让网络根据目标倍率决定哪些频率该保留、哪些频率该增强。说人话就是:倍率越大,越需要更会“补高频”的脑子
图6:尺度感知特征表示的可视化
图6:尺度感知特征表示的可视化。相比不带 SAFR 的静态基线,SAFR 会根据目标尺度动态调整特征激活,以匹配需要恢复的高频残差信息。
这里还有一个细节值得注意:论文不是把原来固定尺度的 VAE 解码器直接推倒重来,而是把它扩展成连续视频解码器,再叠加坐标查询。这样做的好处是,连续尺度输出不再依赖固定尺寸的像素网格,而是可以对任意目标坐标进行查询。对超分任务来说,这就像从“只能按整块砖砌墙”升级成“可以按任意尺寸切砖”。
论文还把“尺度条件”做得比较聪明:既有尺度嵌入,也有频域门控,还会在极端 OOD(分布外)倍率下做裁剪,避免位置编码外推带来的怪异伪影。这个操作很务实,毕竟模型不是魔法师,8× 这种超出训练范围的倍率,硬外推很容易翻车。SAFR 的设计思路不是装作自己无所不能,而是尽量让模型在能力边界内稳定工作。

实验结果:全面碾压,树立新标杆

先看实验设置。论文在 REDS 训练集上训练,在 REDS4 和 Vid4 上测试,指标同时覆盖了画质、重建和时序稳定性:LPIPS、DISTS、PSNR、SSIM、tLPIPS、tOF 都上了。这个组合比较合理,因为视频超分不能只看清晰度,还得看有没有闪烁。只报 PSNR 的方法,往往只是“像素对齐做得像个老实人”,但视觉上未必讨喜。
表1:REDS4 和 Vid4 上 4× 视频超分辨率的定量比较
表1:REDS4 和 Vid4 上 4× 视频超分辨率的定量比较。该表展示了与固定尺度回归方法、固定尺度生成方法以及任意尺度方法的全面对比。
表1最有意思的地方在于,AVSR-Diff 作为一个任意尺度方法,居然在原生 4× 设定上也能压过不少固定尺度生成模型。更难得的是,它不是只赢一个指标,而是把感知质量和时间稳定性一起往前推。尤其在 tLPIPS 上,它表现得很稳,说明 TGFR 确实不是摆设。对视频任务来说,这种“细节更好、还不乱闪”的结果,比单纯 PSNR 高一点点更有说服力。
表2:REDS4 上任意尺度视频超分辨率的定量比较
表2:REDS4 上任意尺度视频超分辨率的定量比较。这里覆盖了 2×、3.25× 和 8× 三种更具代表性的连续倍率。
表2更能体现这篇论文的“真本事”。在 2× 这种相对温和的倍率下,AVSR-Diff 的 PSNR 已经能接近强回归基线;到了 3.25× 和 8×,很多固定尺度生成模型开始明显吃力,或者只能靠先生成再插值,结果细节和稳定性一起掉。AVSR-Diff 则直接在连续坐标上渲染,既保住了细节,也没有把时间一致性丢掉。换句话说,它不是只会做“标准答案”,而是连“非标准题”也能答得像样。
图4:REDS4 上不同放大倍率的定性对比
图4:REDS4 数据集上不同放大倍率的定性对比。可以看到,回归方法更容易过度平滑,而 AVSR-Diff 在纹理恢复和时序稳定性上更占优势。
定性结果里,AVSR-Diff 的优势更直观:纹理边缘更锐,细节更像真实视频,且前后帧不容易出现忽明忽暗的“塑料感”。这说明 SAFR 和 TGFR 不是各自单打独斗,而是形成了一个闭环:TGFR 提供稳定的时序特征,SAFR 再把这些特征按尺度精细地转成高频纹理。一个负责把地基打稳,一个负责把楼盖漂亮,少一个都容易歪。
表4:TGFR 门控设计的消融实验
表4:TGFR 门控设计的消融实验。长序列推理下,如果去掉门控或去掉稀疏约束,后期帧的误差会更容易累积。
表3:AVSR-Diff 关键组件消融实验
表3:AVSR-Diff 关键组件消融实验。这里能清楚看到,TGFR、连续解码器 Ds 和 SAFR 都不是“锦上添花”,而是共同决定最终效果的关键模块。
消融实验的逻辑也很清楚:只要拿掉 TGFR,时序稳定性就会掉;只保留基础解码器,细节会变软;少了 SAFR,高倍率下的高频恢复就不够。论文没有把所有提升都归功于“更大模型”,而是用消融把每个模块的作用拆开了,这一点比较可信。
表S2:与 VEnhancer 的效率对比
表S2:与 VEnhancer 的效率对比。这里报告了峰值显存、单帧运行时间和单帧计算量,能看出 AVSR-Diff 的资源占用基本不随目标尺度增长。
这一表是整篇论文最“工程味”的证据。VEnhancer 这类方法在大倍率下显存和耗时会明显上涨,而 AVSR-Diff 的峰值内存和每帧开销几乎保持恒定。注意,这不代表它绝对更快,毕竟扩散采样仍然有 50 步;但它的关键优势是不会因为倍率变大而额外爆炸。对实际部署来说,这比单纯追求一个漂亮数字更重要。
如果把这篇论文放到产品视角里看,它更像是一个“可调倍率的视频增强引擎”,而不是只能死守 4× 的单一模型。这个差异很大。因为真实场景里,用户常常不是问“能不能 4×”,而是问“能不能顺手放大到我想要的尺寸,还别闪”。AVSR-Diff 至少在论文实验里给出了一个比较像样的答案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“视频超分既想要高质量细节,又想支持任意尺度,还不能让时间一致性崩掉”的问题。核心办法是把扩散去噪和连续解码拆开,前者固定在低分辨率潜空间里做,后者再按任意倍率输出高分辨率视频。

TGFR 和 SAFR 分别在干什么?TGFR 负责时序对齐与门控递归,尽量把前后帧的特征稳定住;SAFR 负责在频域里按尺度调节高频细节,让不同倍率下都能补出更合适的纹理。一个管“别抖”,一个管“别糊”。

为什么它看起来更像能落地的方案?因为它把最贵的扩散采样锁死在固定低分辨率空间里,目标倍率变化不会让显存和算力跟着爆。再加上复用预训练扩散模型和 VAE 解码器,改造成本比从头训练一个大视频扩散模型低得多。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇论文不是单点魔改,而是把“扩散生成”和“任意尺度连续解码”拆开重组,方向挺清楚,组合也有新意。

实验合理度:★★★★☆ 指标覆盖了感知质量、重建质量和时间一致性,消融也比较完整,能支撑核心结论。

学术研究价值:★★★★☆ 它把视频扩散和任意尺度超分之间的结构性矛盾讲明白了,对后续做连续视频生成很有参考价值。

稳定性:★★★☆☆ TGFR 明显在帮忙,但扩散采样本身仍有随机性,长视频和极端场景下还需要继续验证。

适应性以及泛化能力:★★★★☆ 支持 2× 到 8× 的连续倍率,适应性不错;但分布外倍率和复杂运动场景仍是考验。

硬件需求及成本:★★★☆☆ 显存随倍率基本恒定,这是亮点;但 50 步扩散采样并不轻,离“随便一台设备实时跑”还有距离。

复现难度:★★★☆☆ 依赖预训练扩散模型、ControlNet、RAFT 和连续解码器,模块不算少,复现门槛中等偏上。

产品化成熟度:★★★☆☆ 适合离线增强、后处理和高质量内容生成,若要实时视频链路,还得继续压推理成本。

可能的问题:方法很强,但采样步数和长视频稳定性仍是现实门槛,极端倍率下也存在分布外外推风险。


主要参考文献

[1] AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution. arXiv, 2026.
[2] 项目主页:https://kaist-viclab.github.io/AVSR-Diff/
[3] 论文原文:https://arxiv.org/pdf/2607.00987v1.pdf
[4] 演示图与项目资源:见文中对应插图与链接。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
视频超分辨率也能任意缩放?这篇把“清晰细节”和“时间稳定”一起端上来的工作,值得进群细看。🤝
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。