← 返回 PaperDaily
视觉与图像
西工大最新研究:一步超分不用蒸馏,FLOPs狂降6倍、质量反超CTMSR
一步超分又有新玩法:西工大MeanSR不靠教师模型蒸馏,直接学习低分辨率条件下的平均速度场来显式建模恢复轨迹,CLIPIQA、MUSIQ、MANIQA全面涨,FLOPs只有之前最强单步方法CTMSR的约1/6,推理还快了近一倍。感兴趣怎么实现的,往下看。
龙哥读论文
发布于 2026-08-14 21:50:23
阅读 22
查看原文
原论文信息如下:
超分辨率(Super-Resolution,SR)这个任务,说简单也简单,说难也难。简单在于目标就一句话:把一张低分辨率(LR)图放大成高分辨率(HR)图,还要看着清晰、真实;难在于从 LR 到 HR 的解空间是无穷的,一只猫的毛该往哪个方向长,算法很难凭空猜出来。扩散模型天然擅长这种“从模糊到精细”的生成,但代价是慢——像 StableSR 这样的模型,单张图需要 200 步迭代去噪,跑一次要 8 秒多钟,这还没算上算力成本。
为了让扩散超分落地,研究者把目光转到了一步生成。SinSR、TSD-SR 这类方法通过蒸馏把教师模型的能力压缩到单步网络里,确实快,但训练前得先有一个强大的教师,存储和训练开销都不小。CTMSR 则干脆去掉蒸馏,用概率流常微分方程(Probability Flow Ordinary Differential Equation,PF-ODE)一致性训练学一步映射,但问题也随之而来:它并没有显式地建模“从低分辨率到高分辨率”这个恢复过程本身,优化目标始终隔着几层纱。
西北工业大学 研究者提出的 MeanSR,想把这层纱彻底掀开。方法名很直白:Mean(平均)+ SR。核心思路是在低分辨率图像条件下,直接学习一个“平均速度场” ,把退化加噪的状态一口气搬到合理的高分辨率结果上。整个过程只需要一次网络前向(即一个 NFE,Network Function Evaluation,网络函数评估),不需要教师模型,也不需要多步迭代。从隐式蒸馏到显式轨迹建模:MeanSR的核心创新
先解释一下什么叫“隐式建模”。CTMSR 的一致性训练,本质是让模型在不同时间步上对同一张图的预测保持一致,通过这种自洽约束来逼近一步生成。听起来不错,但“恢复的动态”本身——也就是从噪声一步步走向清晰 HR 图像的过程——并没有被直接监督。模型只知道“中间状态该长什么样”,不知道“该以什么速度往哪个方向走”。
MeanSR 的思路来自 MeanFlow。MeanFlow 的核心洞察是:如果已经有一条从噪声到数据的线性插值路径,那么可以定义一个有限时间区间上的平均速度 ,只要估准这个速度,就能一步从噪声跳到干净数据,完全不需要迭代数值积分。
具体来说,MeanSR 先把 HR 图像编码到潜空间得到 z₀,LR 图像编码后作为条件特征 cᴸᴿ。然后按 Flow Matching 的方式构造线性插值路径:
两阶段训练策略:恢复轨迹估计与分布轨迹匹配
Stage 1 学的是“从噪声到干净”的平均速度,这个目标能保证轨迹方向大致正确,但生成结果的纹理细节往往还不够“真”。为此,MeanSR 在第二阶段引入了分布轨迹匹配(Distribution Trajectory Matching,DTM) ,这个思路最早由 CTMSR 提出,本文把它重新放到了平均速度场的生成框架里。
具体做法是:给定真实 HR 潜变量 z₀ 和模型重建出的 ẑ₀,分别施加相同的随机扰动,得到两条配对的轨迹状态;再用一个共享的延迟目标网络分别映射,得到投影重建结果 z′₀ 和 ẑ′₀。两条轨迹之间的差异写成:
表3给出了 DTM 的消融结果:不加 DTM 时 CLIPIQA 只有 0.661,加 DTM 并作用在平均速度场上能涨到 0.715,而作用在重建图像空间(DTM-x₀)则达到 0.725。这说明轨迹级分布对齐与显式速度场学习是互补的,直接在重建图像上做感知对齐效果最好。
阶段感知时间采样:优化目标的精准匹配
既然两个阶段的目标本质上不同,时间采样自然也要分开。SATS(Stage-Aware Temporal Sampling,阶段感知时间采样)就是这一思路的落地。
Stage 1 需要精确估计数据流形附近的平均速度,近数据区的速度估计方差更小、更稳定,所以 SATS 采用 logit-normal 分布(t∼LogNormal(−0.4,1.0)),把更多训练样本分配到低噪声区域。Stage 2 的 DTM 需要把整条轨迹都对齐,如果只用低噪声区域,高频时间段的监督就会缺失,因此改用均匀分布 t∼U(0,1),让轨迹的每一个时间点都能获得均衡反馈。
实验全面领先:感知质量与计算效率的双重突破
实验配置方面,训练数据是 ImageNet 上按 RealESRGAN 退化流程构造的 256×256 图像对,测试集包括合成基准 ImageNet-Test(3000 张)和真实世界基准 RealSR、RealSet65。评价指标既有参考指标 LPIPS,也有无参考感知指标 CLIPIQA、MUSIQ、MANIQA。
在 RealSR 上,MeanSR 的 CLIPIQA 达到 0.6520,MUSIQ 达到 60.171,MANIQA 达到 0.5486,均超过 CTMSR;在 RealSet65 上优势更明显,MANIQA 从 CTMSR 的 0.4371 涨到 0.6561,提升约 50%。与此同时,MeanSR 的 FLOPs 只有 46.18G,推理耗时 26.39ms,而 CTMSR 是 305.50G / 50.52ms——算力需求降到约 1/6,推理时间缩短近一半,感知质量却反超。拿扩散模型对比更夸张,相比 StableSR,RealSR 上 MANIQA 从 0.3021 涨到 0.5486,提升 81.6%;RealSet65 上从 0.3097 涨到 0.6561,提升 111.9%。
合成基准上同样稳定领先:MANIQA 比 CTMSR 高 19.5%,CLIPIQA 高 5.8%,MUSIQ 高 3.0%。唯一需要提一下的是 LPIPS 指标略逊于 CTMSR(0.228 vs 0.197),说明 MeanSR 更侧重感知真实感而不是像素级精确重建,这也是感知超分领域一个常见的权衡取舍。
作者还分析了训练收敛速度。从图5可以看出,达到相近的 CLIPIQA 水平,MeanSR 需要的训练步数大约是 CTMSR 的 1/13,这得益于显式轨迹建模提供了更直接的监督信号。
第二阶段训练迭代次数也不是越多越好。表4显示,Stage 2 训练 10k 步时效果最好;20k 步时 MUSIQ 和 MANIQA 已经开始下滑;到 30k 步时各项指标几乎崩盘(CLIPIQA 从 0.725 掉到 0.294)。这说明 DTM 在训练后期可能出现震荡,实际复现时需要把迭代次数卡在合适范围。
定性对比更能直观看出差距。下图是 RealSet65 上猫脸特写的恢复效果:ESRGAN 等传统 GAN 方法纹理偏“油”,StableSR 等扩散方法容易过度平滑,CTMSR 虽有改进但毛发的方向感仍有涂抹痕迹。MeanSR 恢复出的毛发根根分明,眼睛轮廓更干净,整体更接近真实拍摄质感。
图3:RealSet65数据集上的定性比较。放大查看效果更佳。MeanSR在毛发细节、边缘结构等区域表现出更自然的恢复效果。
总结与展望:一步超分的未来方向
MeanSR 把平均速度场引入一步感知超分,用显式轨迹建模取代隐式一致性约束,再配合 DTM 和 SATS,在质量、速度和训练成本之间找到了不错的平衡。相比 CTMSR,在降低约 6 倍 FLOPs、近 2 倍推理时间的同时,感知指标不降反升,训练收敛还快了约 13 倍,这个组合确实有吸引力。
不过局限也很明显。LPIPS 相对 CTMSR 有所退步,意味着在像素级重建精度上还有提升空间;Stage 2 训练超过 20k 步后指标下降,训练稳定性需要进一步约束;真实场景的退化往往更复杂,基于 ImageNet 合成退化训练的模型能覆盖多大范围的真实退化,仍需更大规模评测。
未来方向也清晰:把平均速度场推广到视频超分、盲超分和通用图像恢复任务;研究更稳定的轨迹对齐损失,避免 DTM 后期震荡;探索与扩散蒸馏、对抗训练等其他加速范式的结合。一步超分这个赛道,MeanSR 算是往前迈了一大步。
龙迷三问
这篇论文到底在解决什么问题? 西工大提出MeanSR,通过低分辨率条件平均速度场显式建模恢复轨迹,配合分布轨迹匹配与阶段感知时间采样,实现免蒸馏一步感知超分。
这篇工作最值得看的点是什么? 在RealSR和RealSet65上所有感知指标全面最优,相比CTMSR在MANIQA上提升19.9%和50.0%,FLOPs降低约6倍,推理加速近2倍;在ImageNet-Test上CLIPIQA、MUSIQ、MANIQA均最优。
这篇工作的边界或风险在哪里? 优点:显式建模恢复轨迹,避免教师模型依赖,计算效率高,感知质量优异;缺点:LPIPS指标不如CTMSR,第二阶段训练步数敏感,需要仔细调优。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出MeanSR框架,通过LR条件平均速度场学习显式建模有限时间超分恢复轨迹,结合分布轨迹匹配和阶段感知时间采样实现一步感知超分辨率。
实验合理度: ★★★★☆
LPIPS、CLIPIQA、MUSIQ、MANIQA
学术研究价值: ★★★★☆
提出MeanSR框架,通过LR条件平均速度场学习显式建模有限时间超分恢复轨迹,结合分布轨迹匹配和阶段感知时间采样实现一步感知超分辨率;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
46.18G FLOPs,推理时间26.39ms
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: LPIPS指标不如CTMSR,第二阶段训练步数敏感,需要仔细调优。
主要参考文献
[1] Niu A, Kou J, Zhang K, et al. MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution[J]. arXiv preprint arXiv:2608.09405, 2026.
[2] You Z, et al. CTMSR: Consistency Trajectory Modeling for One-Step Super-Resolution[C]. 2025.
[3] Geng C, et al. Mean-Flow: A Mean-Field Approach to Generative Modeling[J]. 2025.
[4] Wang Y, et al. SinSR: Diffusion-Based Image Super-Resolution in a Single Step[C]. CVPR 2024.
[5] Lipman Y, et al. Flow Matching for Generative Modeling[C]. ICLR 2023.
融会贯通
结合 PaperDaily 已收录论文可以观察到,一步超分正在经历从“蒸馏依赖”到“免蒸馏”再到“显式轨迹建模”的演进。SinSR 证明了蒸馏可行,CTMSR 证明了免蒸馏可行,MeanSR 则进一步说明:与其让模型在隐式约束中摸索,不如直接把恢复过程“讲清楚”。这条思路与当下扩散模型领域的流匹配、整流流(Rectified Flow)趋势一脉相承。
需要说明的是,本次 MCP 实验对比数据库的实时检索没有成功,无法提供同数据集的横向数值验证,因此本文所有对比数字均引用自论文原文。不同论文的数据集划分和退化设置存在差异,读者在做横向比较时需要留意 split/setting 是否对齐。从领域趋势来看,显式轨迹建模很可能成为未来一步图像恢复的默认范式之一,值得持续跟踪。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!