← 返回 PaperDaily
视觉与图像
开源代码放送:让你的1080p视频秒变4K,还不抖动
单步扩散视频超分整天被时间抖动折磨?AMD和维尔茨堡大学这次玩了个新思路:给token搞“分班”,重要的走精品班,不重要的走大班合班,最后再无缝合回来。结果你猜怎么着?推理加速了,质量一点没掉,甚至更稳了。全开源的代码,值得一试。
龙哥读论文
发布于 2026-08-14 09:11:28
阅读 3
查看原文
原论文信息如下:
单步扩散VSR的困境:计算瓶颈与时间抖动
视频超分辨率(Video Super-Resolution,VSR)的目标是从低质量视频中恢复出高清版本,同时确保帧与帧之间画面连贯、不闪烁。近年来,基于扩散模型的方法,特别是那些采用Diffusion Transformer(DiT,扩散变换器)架构的模型,凭借其强大的生成先验,在VSR领域取得了令人瞩目的成就。
但是,性能强的代价是“贵”。DiT在处理视频时,需要把每一帧切分成大量的token(令牌,可以理解为最基本的图像小块),再对这些token进行密集的自注意力计算。视频数据量本来就大,这一操作的计算复杂度是token数量的平方级别,导致推理过程慢得像蜗牛爬,根本无法实用。
为解决速度问题,学界催生了“单步扩散”VSR方法。简单说,就是把原来需要几十上百次迭代去噪的扩散过程,压缩成一次前向推理,直接输出结果。像DOVE、One-Step VSR这些方法,确实把推理延迟降下来了。
但问题也随之而来:时间一致性崩了 。原来多步扩散时,每次去噪都能一点点修正错误;现在一步到位,生成过程中产生的误差无法被后续步骤纠正,直接累积起来。结果就是画面出现鬼影、闪烁,甚至在物体边缘出现“抖动”,观感极差。
更让人头疼的是,现有的一些加速手段,比如ToMe(Token Merging,令牌合并)和剪枝策略,在单步模型上反而会雪上加霜。它们“一刀切”式地压缩所有token,无视哪些token包含运动物体或精细纹理,结果把关键信息也给扔掉了,导致细节丢失和闪烁加剧。
三步走策略:离线规划+重要性评分+双流路由
面对这些困境,AMD和维尔茨堡大学的团队提出了一个巧妙的解决方案——TRaM-VSR (全称:Token Routing and Merging for Video Super-Resolution,用于视频超分辨率的令牌路由与合并框架)。它的核心思想很简单:别把计算资源浪费在“信息量少”的token上,而是精准地把算力留给关键部位,同时保证不丢掉全局上下文。
整个框架包含三套组合拳,堪称教科书级的“三步走”策略:
TRaM-VSR并没有在整个网络的所有层都进行token压缩,而是先做一个“风险评估”。它利用一个小的校准集,分析DiT网络中每一层在模拟压缩时对最终输出造成的影响。
具体来说,它计算两个信号:一是局部更新幅度Δℓ,二是端到端扰动偏移Sℓ。前者反映当前层的变化剧烈程度,后者衡量当前层的扰动会如何传播到最终的输出。两者结合形成一个“风险代理指标”Rℓ,风险越低,说明该层越适合进行token压缩。
然后,一个离线规划器会贪心地选择若干个不重叠的“路由区间”(Routed Intervals)。这些区间就是网络中进行token压缩的“安全区”。在区间之外,保持全分辨率的token处理,不丢失任何信息。
确定了哪些层做压缩之后,接下来要解决的是“哪些token值得保留”的问题。TRaM-VSR设计了一个精妙的评分机制,融合了文本相似性和时间曲率引导(Temporal Curvature Guidance,TCG)。
这个机制会给每个token打分,分数高的就是关键token,进入“精品班”;分数低的就是不那么重要的token,被划入“普通班”。具体算法在下一节细讲。
本地流(Local Stream): 保留那些得分高的关键token,以全保真度处理,负责恢复精细纹理和结构。
全局流(Global Stream): 将得分低的token合并成少量紧凑的全局token,以较低的计算成本提供全局上下文信息。
最绝的是“身份恢复”机制。在路由区间的出口,所有被“丢弃”的token位置,会被直接填入它们在进入区间前保存的原始特征(Identity Restoration),而不是使用全局流中可能已被污染的特征。这就像给每个被合并的token留了一个“快照”,在恢复时直接还原,保证了细节不会因为合并而丢失。
语义-时序融合:精准定位关键token
前面提到,TRaM-VSR的核心是重要性评分。这个评分由两个互补的部分融合而成:
首先,模型利用文本提示(Text Prompt)来指导哪些区域更重要。它计算每个图像token与文本嵌入(Text Embedding)的平均值的余弦相似度。比如,如果提示词是“一辆红色的汽车在道路上行驶”,那么与“汽车”、“红色”这些语义相关的token就会获得更高的分数。
这里计算文本相似性的公式为:sntext = Norm(cos(hn, 𝒯)),其中hn是第n个图像token的特征,𝒯是平均文本嵌入,Norm表示min-max归一化。
光靠语义还不够,因为视频中最重要的往往是运动的物体。TCG就是用来捕捉这种时间动态信息的。它通过计算token在帧间的“速度”和“曲率”,来判断哪些区域是正在运动的、时间上变化剧烈的。运动越大、变化越复杂,token的重要性就越高。
具体来说,TCG将token重塑为X ∈ RB×Fg×P×C的格式(其中Fg是帧组数,P是每组内的token数),然后计算时间速度vi = Xi+1 - Xi和曲率κi = arccos(cos(vi+1, vi))。曲率越大,表示运动方向和加速度变化越剧烈,图1中可以看到这种评分正好聚焦在汽车、行人等动态区域上。
最后,TRaM-VSR通过一个加权平均将这两个分数融合起来:s = Norm(wt * stext + wp * stcg)。实验表明,当文本权重wt设为0.6、时序权重wp设为0.4时,可以取得最佳的整体感知质量。这种融合保证了模型既能重视运动物体,又不会忽略语义要求的关键区域。
根据最终的分数,系统会对所有token进行排序,保留Top-K个token进入本地流(K = max(1, N - ⌊ρN⌋),其中ρ是预设的丢弃比率),其余的被合并到全局流。
为了更清晰地展示整个流程,可以参考论文中的算法伪代码:
算法1:TRaM-VSR 路由区间内的路由与合并操作
输入:完整令牌 X ∈ RN×C, 文本令牌 T, 丢弃比率 ρ, 全局比率 γ, 权重 wt, wp, 路由块
输出:恢复的完整令牌 X ∈ RN×C
1: 语义-时间评分:
2: stext ← TextSim(X, T) // 计算文本相似性
3: stcg ← TCG(X) // 计算时间曲率引导
4: s ← Norm(wtstext + wpstcg) // 加权融合并归一化
5: Top-K 保留:
6: K ← max(1, N - ⌊ρN⌋)
7: Kr ← TopK(s, K); Dr ← [1..N] \ Kr // 确定保留和丢弃集
8: 双流合并:
9: Xloc ← X[Kr] // 本地流:保留的令牌
10: Xglob ← GroupMean(X[Dr], γ) // 全局流:合并丢弃令牌
11: Xwork ← [Xloc; Xglob] // 工作令牌
12: 路由计算: Ywork ← F(Xwork) // 在路由块中处理
13: 恢复:
14: X[Dr] ← X[Dr] // 冻结丢弃位置的原始特征
15: X[Kr] ← Ywork[1:K] // 将处理后的保留特征放回
16: 返回 X
从伪代码可以看出,第4行完成了语义和时序信息的融合,第7行根据得分划分“精英”和“普通”token,第14行则实现了“身份恢复”——即被合并的token位置,其特征值被冻结,不会被全局流更新所污染。
身份恢复:防止信息丢失的“安全网”
“身份恢复”是整个框架的点睛之笔。在很多传统的token压缩方法中,当token被合并后,就再也找不回原来的特征了,这导致不可逆的细节损失。尤其是在没有跳跃连接(Skip-free)的DiT架构中,这种损失会在后续层中不断放大。
TRaM-VSR的做法非常“无赖”,同时也是非常有效。它在每个路由区间的入口处,把所有token的特征都“拍了个快照”保存下来。当这个区间内的计算结束后,那些被合并的token位置,不采用经过多层的全局流输出,而是直接把这个“快照”恢复到原来的位置。
这意味着,被压缩的token其实并没有“参与”区间内的复杂计算,它们只是被“完好无损”地传递了过去。这种设计完全规避了合并操作带来的污染问题,确保了在计算量减少的同时,信息的完整性不受影响。
这个安全网机制,让模型敢于在更宽的区间内进行更大比例的token压缩,而不用担心细节崩塌。
而且,通过这种设计,自注意力机制的计算复杂度从O(N2)降到了约O((Kr+Gr)2),其中Gr是合并后的全局token数量。在典型配置下,工作token数量可以大幅减少,带来显著的加速。
实验结果:速度与质量兼得
光说不练假把式。TRaM-VSR在多个标准VSR基准上进行了验证,包括合成数据集UDM10、SPMCS、YouHQ40,以及真实场景数据集RealVSR、MVSR4x和VideoLQ。所有实验均在×4放大倍数下进行,采用严格的一次推理(One-Step)设定。
从整体定量结果来看,TRaM-VSR在多个指标上表现突出。它不仅在许多感知质量指标(如LPIPS、DISTS)上保持最佳或次佳,而且在像素级保真度(PSNR/SSIM)上也极具竞争力。(注:以下表格及分析基于PaperDiary已收录论文范围内的辅助判断,非正式完全复现结论。)
在本文关注的时间一致性 方面,TRaM-VSR表现尤其亮眼。在SPMCS数据集上,其前向扭曲误差(Ewarp)低至0.97,远低于大多数对比方法,甚至优于多步的MGLD-VSR(1.68)和STAR(1.01)。在YouHQ40数据集上,1.70的Ewarp得分同样大幅领先DOVE(2.05),这表明其帧间的闪烁和抖动被显著抑制。
可视化对比更能体现方法的优势。在图3中,对比DOVE等方法,TRaM-VSR重建的纹理更加锐利,边缘保持了良好的连贯性,没有出现过度平滑。在复杂场景下(如YouHQ40的植物),TRaM-VSR清晰地恢复了叶脉纹理,而其他方法则显得模糊。
图4进一步展示了路由策略的优越性。当在DOVE骨干网络上直接应用均匀合并(ToMeSD)或均匀剪枝(TinySR)时,虽然计算量减少了,但画面出现了严重的纹理失真和结构断裂。而TRaM-VSR凭借智能路由,在相同的压缩比例下完美地保持了结构完整性。
图5通过“时空切片”的方式直观展示了时间一致性。将视频画面中一条垂直线(红色)在时间轴上的变化堆叠起来,如果画面稳定,这条线应该平滑变化;如果闪烁,则会出现明显的断裂和跳跃。从图中可以看出,其他方法(如DOVE)的时空切片存在显著的“抖动”和误差(红色区域),而TRaM-VSR的切片非常平滑,几乎看不到误差。
双流架构的必要性: 从表2可以看出,双流架构(Local+Global)全面优于单流架构。单流架构虽然也能进行重要性感知的保留,但由于没有全局流,丢弃的token信息完全丢失,导致感知质量(LPIPS 0.3391)远不如双流(0.2883)。随机路由的效果更是垫底,证明随意丢弃token是行不通的。
评分融合的互补性: 表3的消融表明,单一地使用文本相似性(Text-only)或TCG都只能取得部分优势。TCG在时间一致性(最低的Ewarp:0.9068)上表现最好,但感知质量(LPIPS、MUSIQ)不佳。文本评分在语义上有优势,但忽略了运动区域。将两者按0.6/0.4比例融合后,模型在感知质量(LPIPS 0.2883)和时间一致性(Ewarp 0.9720)上取得了最佳平衡。
图6展示了在不同路由区间配置和不同丢弃比率下的速度-质量权衡。可以看到,由离线规划器选择的特定区间(红色曲线)始终优于其他启发式放置,形成了明显更优的帕累托前沿。这意味着在实际部署时,工程师们可以简单地通过调节丢弃比率ρ来平衡速度和精度,非常灵活。
局限与展望
离线规划依赖校准。 目前的路由区间规划需要通过一个小型校准集进行离线分析。如果实际部署的视频场景与校准集差异极大(例如全是静态画面或高速运动),最优的压缩区间可能会变化。虽然论文展示了该方法在多种场景下的鲁棒性,但这仍是一个潜在的边界条件。
全局上下文的限制。 虽然双流架构通过压缩的全局token保留了上下文,但相比全分辨率处理,全局流的信息仍然是降采样的。对于需要极度精确全局语义理解的任务,这种压缩可能带来微小的性能下降。
未来展望。 该工作为扩散模型的效率优化提供了一个新范式。未来的探索方向可能包括:将这种重要性感知的路由机制扩展到多步扩散模型中,结合更先进的压缩策略,甚至将其应用到视频生成、视频编辑等其他任务中。此外,将离线规划变为在线、自适应的动态规划,也是一个非常诱人的方向。
论文最后还进行了一些有趣的讨论,如图7所示,分析了路由机制在面对“正向行驶”、“反向行驶”和“静止画面”时的行为差异。有趣的是,当汽车靠近时,模型对车影的token会“放心地”丢弃,因为阴影的扩展是可预测的;而在静态画面中,没有运动先验,深层网络反而会对阴影保持警惕。这种智能的行为,完美地体现了语义-时序融合评分的价值。
龙迷三问
问:TRaM-VSR到底解决了什么问题? 简单说,它解决的是“单步扩散视频超分”模型的推理效率问题。目前的方法要么慢(多步扩散),要么又快又抖(单步扩散+暴力压缩)。TRaM-VSR在保持甚至提升单步扩散模型的重建质量和时间一致性的前提下,通过智能的token路由和合并,显著降低了计算复杂度,实现了“又快又好”。
问:论文中“Temporal Curvature Guidance (TCG)”具体是什么意思? TCG(时间曲率引导)是一种计算token在时间轴上运动复杂程度的方法。它不只看相邻帧的速度(一阶导数),还看速度的变化率,即曲率(二阶导数)。一个token如果只是匀速移动,曲率很小;但如果它突然加速、减速或改变方向,曲率就很大。TCG通过这种分析,精准地将注意力集中在那些时间动态最丰富的区域,因为这些区域最容易在视频超分中出现闪烁和伪影。
问:这个“身份恢复”机制为什么能防止信息丢失? 想象一下,一个班里(路由区间)有两个小组:A组是精英要重点培养,B组是普通学生要去合并学习。但B组的学生在合并学习过程中,可能被其他同学带偏(特征被污染)。身份恢复的做法是:在合并学习开始时,给B组每个学生拍一张照片(保存原始特征)。学习结束后,不采用B组学生在合并组里学到的东西,而是直接把照片贴在B组学生的座位上。这样,虽然B组学生没有参加高级课程,但他们也没有丢失任何信息,并且A组学生得到了最好的教育。这个“安全网”保证了无论计算如何简化,原始数据结构不会被破坏。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★✰
将“重要性感知”和“离线规划”引入扩散模型的token压缩,特别是在单步VSR场景下通过语义-时序融合进行动态路由,思路清晰、动机充分,并非简单的组合创新。
实验合理度:★★★★★
实验设计非常严谨,覆盖了合成和真实世界的多个主流基准,对比了多种SOTA方法。消融实验设计精细,逐个验证了各模块的必要性,且速度-质量权衡的可视化让结论非常直观。
学术研究价值:★★★★✰
为扩散模型的效率优化提供了一个新的方法论范式,强调“信息密度”而非“参数数量”是效率瓶颈,启发了后续的研究。
稳定性:★★★★✰
在多个公开数据集上表现稳定,时间一致性显著优于对比方法。唯一的潜在风险是离线规划机制对校准集的依赖,但论文通过实验证明其在不同场景下依然鲁棒。
适应性以及泛化能力:★★★★✰
方法本身不依赖于特定的DiT架构,可以迁移到其他基于DiT的视频生成或恢复任务中。但目前仅在超分任务上验证,扩展到其他任务(如去噪、生成)有待验证。
硬件需求及成本:★★★★✰
训练时需要进行一次离线规划,但推理时几乎零额外开销。由于大幅减少了token数量,推理时对硬件(显存、算力)的需求显著降低,在消费级显卡上部署成为可能。
复现难度:★★★★★
论文提供了清晰的算法伪代码和完整的架构图,且承诺开源代码,复现难度低。
产品化成熟度:★★★★✰
具备很高的产品化潜力。推理速度快、质量高、时间一致性好,非常适合用于云端的视频增强服务、画质修复App的后端处理。目前的限制是需要针对特定模型进行离线区间规划,不是即插即用。
可能的问题: 离线规划依赖于校准集,如果目标分布与校准集差异过大,最优路由区间可能并非最优。此外,“身份恢复”虽然保证了信息无损,但也意味着被合并的token完全不参与该区间的语义计算,对于需要极度精细的全局一致性场景,可能存在极限。但总的来说,瑕不掩瑜,这是一篇非常扎实且有工程价值的工作。
主要参考文献
[6] DOVE: One-step diffusion video super-resolution. CVPR 2025.
[22] OpenAI. Latent diffusion transformer. NeurIPS 2024.
[44] Upscale-a-video: Video super-resolution with video diffusion priors. ECCV 2024.
[3] ToMeSD: Token merging for stable diffusion. CVPR 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
视频超分加速,Token路由合并是关键。想跟龙哥探讨更多前沿技术?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。