← 返回 PaperDaily 视觉与图像

西工大最新研究:一步超分不用蒸馏,FLOPs狂降6倍、质量反超CTMSR

一步超分又有新玩法:西工大MeanSR不靠教师模型蒸馏,直接学习低分辨率条件下的平均速度场来显式建模恢复轨迹,CLIPIQA、MUSIQ、MANIQA全面涨,FLOPs只有之前最强单步方法CTMSR的约1/6,推理还快了近一倍。感兴趣怎么实现的,往下看。

西工大最新研究:一步超分不用蒸馏,FLOPs狂降6倍、质量反超CTMSR
原论文信息如下:
论文标题:
MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution
发表日期:
2026年08月
发表单位:
西北工业大学(School of Computer Science, Northwestern Polytechnical University)
原文链接:
https://arxiv.org/pdf/2608.09405v1.pdf
超分辨率(Super-Resolution,SR)这个任务,说简单也简单,说难也难。简单在于目标就一句话:把一张低分辨率(LR)图放大成高分辨率(HR)图,还要看着清晰、真实;难在于从 LR 到 HR 的解空间是无穷的,一只猫的毛该往哪个方向长,算法很难凭空猜出来。扩散模型天然擅长这种“从模糊到精细”的生成,但代价是慢——像 StableSR 这样的模型,单张图需要 200 步迭代去噪,跑一次要 8 秒多钟,这还没算上算力成本。
为了让扩散超分落地,研究者把目光转到了一步生成。SinSR、TSD-SR 这类方法通过蒸馏把教师模型的能力压缩到单步网络里,确实快,但训练前得先有一个强大的教师,存储和训练开销都不小。CTMSR 则干脆去掉蒸馏,用概率流常微分方程(Probability Flow Ordinary Differential Equation,PF-ODE)一致性训练学一步映射,但问题也随之而来:它并没有显式地建模“从低分辨率到高分辨率”这个恢复过程本身,优化目标始终隔着几层纱。
西北工业大学研究者提出的 MeanSR,想把这层纱彻底掀开。方法名很直白:Mean(平均)+ SR。核心思路是在低分辨率图像条件下,直接学习一个“平均速度场”,把退化加噪的状态一口气搬到合理的高分辨率结果上。整个过程只需要一次网络前向(即一个 NFE,Network Function Evaluation,网络函数评估),不需要教师模型,也不需要多步迭代。

从隐式蒸馏到显式轨迹建模:MeanSR的核心创新

图1:代表性一步超分方法的对比。x轴为CLIPIQA,y轴为推理时间,气泡大小代表FLOPs。MeanSR在感知质量与计算效率之间取得了良好的平衡。
代表性一步超分方法的对比。x轴为CLIPIQA,y轴为推理时间,气泡大小代表FLOPs。MeanSR在感知质量与计算效率之间取得了良好的平衡。
先解释一下什么叫“隐式建模”。CTMSR 的一致性训练,本质是让模型在不同时间步上对同一张图的预测保持一致,通过这种自洽约束来逼近一步生成。听起来不错,但“恢复的动态”本身——也就是从噪声一步步走向清晰 HR 图像的过程——并没有被直接监督。模型只知道“中间状态该长什么样”,不知道“该以什么速度往哪个方向走”。
MeanSR 的思路来自 MeanFlow。MeanFlow 的核心洞察是:如果已经有一条从噪声到数据的线性插值路径,那么可以定义一个有限时间区间上的平均速度,只要估准这个速度,就能一步从噪声跳到干净数据,完全不需要迭代数值积分。
具体来说,MeanSR 先把 HR 图像编码到潜空间得到 z₀,LR 图像编码后作为条件特征 cᴸᴿ。然后按 Flow Matching 的方式构造线性插值路径:
z_t = (1-t)z_0 + tε
其中 ε 是标准高斯噪声,t∈[0,1]。t=1 时是纯噪声,t=0 时回到干净 HR 潜变量。传统扩散模型要沿这条路径一步步走回去,而 MeanSR 想的是:能不能直接算出从时间 t 到时间 r 的“平均速度”,然后一步跨过去?
z_r = z_t - (t-r)u(z_t, c^LR, r, t) u(z_t, c^LR, r, t) = 1/(t-r) ∫_r^t v(z_τ, c^LR, τ) dτ
这个平均速度 u 就是瞬时速度 v(z_τ)=ε−z₀ 在 [r,t] 区间上的积分均值。瞬时速度在流匹配里是一个常数方向场,因此平均速度天然地把“噪声方向”和“干净潜变量”的关系编码了进去。作者进一步推导出平均速度与瞬时速度之间的微分关系:
u(z_t, c^LR, r, t) = v(z_t, c^LR, t) - (t-r) d/dt u(z_t, c^LR, r, t)
构建平均速度需要知道平均速度对时间 t 的导数,也就是雅可比矩阵。这里直接用 PyTorch 或 JAX 提供的 Jacobian-vector product(雅可比-向量积)函数即可高效计算,不需要维护额外的大网络。于是训练目标就变成让 Transformer 网络 u_θ 拟合这个平均速度:
L_MeanSR = E ||u_θ(z_t, c^LR, r, t) - sg(u(z_t, c^LR, r, t))||²
其中 sg 表示 stop-gradient 操作,用来稳定优化。到了推理阶段,直接从纯噪声出发设 t=1、r=0:
z^SR = z_1 - u_θ(z_1, c^LR, 0, 1)
z¹ 是随机采样的高斯噪声,cᴸᴿ 是 LR 图像编码得到的条件特征。得到潜空间结果后,用预训练 VAE 解码器还原到像素空间即可。整个过程只调用了一次 u_θ,一个 NFE 搞定,真正的一步超分。
图2:MeanSR框架总览。第一阶段在MeanFlow框架下通过预测平均速度来估计LR条件下的恢复轨迹;第二阶段通过分布轨迹匹配将生成的恢复轨迹与真实HR轨迹对齐。SATS分别为轨迹估计和轨迹对齐分配不同的时间分布。
MeanSR框架总览。第一阶段在MeanFlow框架下通过预测平均速度来估计LR条件下的恢复轨迹;第二阶段通过分布轨迹匹配将生成的恢复轨迹与真实HR轨迹对齐。SATS分别为轨迹估计和轨迹对齐分配不同的时间分布。

两阶段训练策略:恢复轨迹估计与分布轨迹匹配

Stage 1 学的是“从噪声到干净”的平均速度,这个目标能保证轨迹方向大致正确,但生成结果的纹理细节往往还不够“真”。为此,MeanSR 在第二阶段引入了分布轨迹匹配(Distribution Trajectory Matching,DTM),这个思路最早由 CTMSR 提出,本文把它重新放到了平均速度场的生成框架里。
具体做法是:给定真实 HR 潜变量 z₀ 和模型重建出的 ẑ₀,分别施加相同的随机扰动,得到两条配对的轨迹状态;再用一个共享的延迟目标网络分别映射,得到投影重建结果 z′₀ 和 ẑ′₀。两条轨迹之间的差异写成:
Δ = ẑ′₀ - z′₀
然后用这个差异构造一个“伪目标”,直接去修正生成的轨迹:
z̃₀ = sg(ẑ₀ - Δ)
最后在图像空间用感知损失把生成结果拉向修正后的伪目标:
L_DTM = LPIPS(D(ẑ₀), D(z̃₀))
这里的 LPIPS(Learned Perceptual Image Patch Similarity,学习感知图像块相似度)是一个基于深度特征的感知相似度指标。之所以选择在图像空间执行 LPIPS 而不是在潜空间做简单的 L2 距离,是因为感知一致性更贴近人的视觉判断。训练时 MeanFlow 目标会继续保留,保证轨迹估计不漂移,DTM 则提供分布级对齐。
表3给出了 DTM 的消融结果:不加 DTM 时 CLIPIQA 只有 0.661,加 DTM 并作用在平均速度场上能涨到 0.715,而作用在重建图像空间(DTM-x₀)则达到 0.725。这说明轨迹级分布对齐与显式速度场学习是互补的,直接在重建图像上做感知对齐效果最好。
表3:分布轨迹匹配(DTM)及不同对齐形式在ImageNet-Test上的消融。
表3:分布轨迹匹配(DTM)及不同对齐形式在ImageNet-Test上的消融。DTM-x₀代表在重建图像空间对齐,DTM-u代表在平均速度场空间对齐。

阶段感知时间采样:优化目标的精准匹配

既然两个阶段的目标本质上不同,时间采样自然也要分开。SATS(Stage-Aware Temporal Sampling,阶段感知时间采样)就是这一思路的落地。
Stage 1 需要精确估计数据流形附近的平均速度,近数据区的速度估计方差更小、更稳定,所以 SATS 采用 logit-normal 分布(t∼LogNormal(−0.4,1.0)),把更多训练样本分配到低噪声区域。Stage 2 的 DTM 需要把整条轨迹都对齐,如果只用低噪声区域,高频时间段的监督就会缺失,因此改用均匀分布 t∼U(0,1),让轨迹的每一个时间点都能获得均衡反馈。
表5:阶段感知时间采样(SATS)的消融。第二阶段从第一阶段使用logit-normal采样预训练的模型初始化。
表5:阶段感知时间采样(SATS)的消融结果。SATS 的组合策略全面优于固定采样,这也说明“什么阶段干什么事”在轨迹学习中同样成立。

实验全面领先:感知质量与计算效率的双重突破

实验配置方面,训练数据是 ImageNet 上按 RealESRGAN 退化流程构造的 256×256 图像对,测试集包括合成基准 ImageNet-Test(3000 张)和真实世界基准 RealSR、RealSet65。评价指标既有参考指标 LPIPS,也有无参考感知指标 CLIPIQA、MUSIQ、MANIQA。
表1:真实世界基准上的感知质量与计算效率定量比较。
表1:真实世界基准上的感知质量与计算效率定量比较。MeanSR 在 RealSR 和 RealSet65 上均取得了全部感知指标的最佳结果。
在 RealSR 上,MeanSR 的 CLIPIQA 达到 0.6520,MUSIQ 达到 60.171,MANIQA 达到 0.5486,均超过 CTMSR;在 RealSet65 上优势更明显,MANIQA 从 CTMSR 的 0.4371 涨到 0.6561,提升约 50%。与此同时,MeanSR 的 FLOPs 只有 46.18G,推理耗时 26.39ms,而 CTMSR 是 305.50G / 50.52ms——算力需求降到约 1/6,推理时间缩短近一半,感知质量却反超。拿扩散模型对比更夸张,相比 StableSR,RealSR 上 MANIQA 从 0.3021 涨到 0.5486,提升 81.6%;RealSet65 上从 0.3097 涨到 0.6561,提升 111.9%。
表2:合成ImageNet-Test基准上的定量比较。
表2:合成ImageNet-Test基准上的定量比较。在 CLIPIQA、MUSIQ、MANIQA 上 MeanSR 均领先,MANIQA 比 CTMSR 高 19.5%。
合成基准上同样稳定领先:MANIQA 比 CTMSR 高 19.5%,CLIPIQA 高 5.8%,MUSIQ 高 3.0%。唯一需要提一下的是 LPIPS 指标略逊于 CTMSR(0.228 vs 0.197),说明 MeanSR 更侧重感知真实感而不是像素级精确重建,这也是感知超分领域一个常见的权衡取舍。
作者还分析了训练收敛速度。从图5可以看出,达到相近的 CLIPIQA 水平,MeanSR 需要的训练步数大约是 CTMSR 的 1/13,这得益于显式轨迹建模提供了更直接的监督信号。
图5:ImageNet上以CLIPIQA衡量的训练收敛对比。
图5:ImageNet上以CLIPIQA衡量的训练收敛对比。MeanSR以约13倍更少的训练步数达到与CTMSR相当的CLIPIQA水平。
第二阶段训练迭代次数也不是越多越好。表4显示,Stage 2 训练 10k 步时效果最好;20k 步时 MUSIQ 和 MANIQA 已经开始下滑;到 30k 步时各项指标几乎崩盘(CLIPIQA 从 0.725 掉到 0.294)。这说明 DTM 在训练后期可能出现震荡,实际复现时需要把迭代次数卡在合适范围。
表4:第二阶段训练迭代次数对ImageNet-Test结果的影响。
表4:第二阶段训练迭代次数对ImageNet-Test结果的影响。10k步为最佳,30k步时指标显著退化。
定性对比更能直观看出差距。下图是 RealSet65 上猫脸特写的恢复效果:ESRGAN 等传统 GAN 方法纹理偏“油”,StableSR 等扩散方法容易过度平滑,CTMSR 虽有改进但毛发的方向感仍有涂抹痕迹。MeanSR 恢复出的毛发根根分明,眼睛轮廓更干净,整体更接近真实拍摄质感。
(a) 低分辨率图像 (b) ESRGAN 对比结果之一 (c) BSRGAN (e) RealESRGAN 对比结果之二 (f) StableSR-200 (g) LDM-15 (d) SwinIR (h) ResShift-4 (i) SinSR-1 (j) CTMSR-1 (k) MeanSR-1
图3:RealSet65数据集上的定性比较。放大查看效果更佳。MeanSR在毛发细节、边缘结构等区域表现出更自然的恢复效果。
图4:合成ImageNet示例上的定性比较。放大查看效果更佳。
图4:合成ImageNet示例上的定性比较。MeanSR在保持结构一致性的同时,生成了更锐利的边缘和更自然的材质细节。

总结与展望:一步超分的未来方向

MeanSR 把平均速度场引入一步感知超分,用显式轨迹建模取代隐式一致性约束,再配合 DTM 和 SATS,在质量、速度和训练成本之间找到了不错的平衡。相比 CTMSR,在降低约 6 倍 FLOPs、近 2 倍推理时间的同时,感知指标不降反升,训练收敛还快了约 13 倍,这个组合确实有吸引力。
不过局限也很明显。LPIPS 相对 CTMSR 有所退步,意味着在像素级重建精度上还有提升空间;Stage 2 训练超过 20k 步后指标下降,训练稳定性需要进一步约束;真实场景的退化往往更复杂,基于 ImageNet 合成退化训练的模型能覆盖多大范围的真实退化,仍需更大规模评测。
未来方向也清晰:把平均速度场推广到视频超分、盲超分和通用图像恢复任务;研究更稳定的轨迹对齐损失,避免 DTM 后期震荡;探索与扩散蒸馏、对抗训练等其他加速范式的结合。一步超分这个赛道,MeanSR 算是往前迈了一大步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?西工大提出MeanSR,通过低分辨率条件平均速度场显式建模恢复轨迹,配合分布轨迹匹配与阶段感知时间采样,实现免蒸馏一步感知超分。
这篇工作最值得看的点是什么?在RealSR和RealSet65上所有感知指标全面最优,相比CTMSR在MANIQA上提升19.9%和50.0%,FLOPs降低约6倍,推理加速近2倍;在ImageNet-Test上CLIPIQA、MUSIQ、MANIQA均最优。
这篇工作的边界或风险在哪里?优点:显式建模恢复轨迹,避免教师模型依赖,计算效率高,感知质量优异;缺点:LPIPS指标不如CTMSR,第二阶段训练步数敏感,需要仔细调优。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出MeanSR框架,通过LR条件平均速度场学习显式建模有限时间超分恢复轨迹,结合分布轨迹匹配和阶段感知时间采样实现一步感知超分辨率。

实验合理度:★★★★☆

LPIPS、CLIPIQA、MUSIQ、MANIQA

学术研究价值:★★★★☆

提出MeanSR框架,通过LR条件平均速度场学习显式建模有限时间超分恢复轨迹,结合分布轨迹匹配和阶段感知时间采样实现一步感知超分辨率;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

46.18G FLOPs,推理时间26.39ms

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:LPIPS指标不如CTMSR,第二阶段训练步数敏感,需要仔细调优。

主要参考文献

[1] Niu A, Kou J, Zhang K, et al. MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution[J]. arXiv preprint arXiv:2608.09405, 2026.
[2] You Z, et al. CTMSR: Consistency Trajectory Modeling for One-Step Super-Resolution[C]. 2025.
[3] Geng C, et al. Mean-Flow: A Mean-Field Approach to Generative Modeling[J]. 2025.
[4] Wang Y, et al. SinSR: Diffusion-Based Image Super-Resolution in a Single Step[C]. CVPR 2024.
[5] Lipman Y, et al. Flow Matching for Generative Modeling[C]. ICLR 2023.

融会贯通

结合 PaperDaily 已收录论文可以观察到,一步超分正在经历从“蒸馏依赖”到“免蒸馏”再到“显式轨迹建模”的演进。SinSR 证明了蒸馏可行,CTMSR 证明了免蒸馏可行,MeanSR 则进一步说明:与其让模型在隐式约束中摸索,不如直接把恢复过程“讲清楚”。这条思路与当下扩散模型领域的流匹配、整流流(Rectified Flow)趋势一脉相承。
需要说明的是,本次 MCP 实验对比数据库的实时检索没有成功,无法提供同数据集的横向数值验证,因此本文所有对比数字均引用自论文原文。不同论文的数据集划分和退化设置存在差异,读者在做横向比较时需要留意 split/setting 是否对齐。从领域趋势来看,显式轨迹建模很可能成为未来一步图像恢复的默认范式之一,值得持续跟踪。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
一张糊图想变清?MeanSR一步就能搞定。读论文、找思路、看代码,来龙哥读论文星球和微信群,和超分同路人一起交流~扫描下方二维码或添加龙哥助手微信号:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,更快通过邀请。群内还有图像处理、大模型、自动驾驶等五大方向等你来聊!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。