← 返回 PaperDaily 视觉与图像

CVPR 2026风格新作RFMSR:超分辨率不再从噪声硬冲

这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。

CVPR 2026风格新作RFMSR:超分辨率不再从噪声硬冲
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。


原论文信息如下:
论文标题:
RFMSR: Residual Flow Matching for Image Super-Resolution
发表日期:
2026年07月
发表单位:
华中科技大学;武汉大学
原文链接:
https://arxiv.org/pdf/2607.12753v1.pdf
开源代码链接:
https://github.com/FazeHsw/RFMSR

方法创新:残差光流匹配与两阶段训练

这篇论文最有意思的地方,不是把模型再堆大一点,而是先把“起点”改了。传统 flow matching 做图像生成,默认从纯高斯噪声出发,像是让修图师闭着眼从一团雾里猜原图;RFMSR 则直接把起点挪到低质图像对应的潜空间附近,等于让模型先看见轮廓,再补细节。这个思路很朴素,但很对路。
图2:RFMSR整体流程示意图
图2:RFMSR整体流程示意图。上半部分是前向过程,HQ 潜变量逐步被推到以 LQ 潜变量为中心的高斯分布;下半部分是反向过程,模型从靠近 LQ 的随机点出发,逐步修复成最终超分结果。这里的关键不是“从噪声到图像”,而是“从带结构的噪声到更干净的图像”。
先把几个术语说人话。flow matching可以理解成“学一条连续的搬运路线”,模型不直接猜最终图片,而是学每个时刻应该往哪儿走。Conditional Flow Matching,CFM是“条件流匹配”,意思是训练时不仅看起点,还看终点,让模型学会从指定起点搬到指定终点。这里的 Residual Flow Matching,就是把起点从标准高斯改成“围绕低质图像的高斯”,残差的味道很浓:不是从零造图,而是在已有结构上修。
公式1:流模型的基本微分方程
公式1:流模型的基本微分方程。xt 表示时刻 t 的状态,vθ 是神经网络学到的速度场,t∈[0,1]。训练的目标很直接:让模型学会“在每个时刻该往哪儿挪”。推理时则从 t=1 一路积分回 t=0,最终得到超分结果。
RFMSR 的第一刀,砍在源分布上。标准 flow matching 里,源分布是 p1=N(0,I),也就是从纯噪声开始;RFMSR 改成 p1=N(y0,σ2I),其中 y0 是低质图像的潜变量,σ 控制初始扰动强度。换句话说,起跑线不再是“啥也没有”,而是“已经有个大概轮廓”。这一步对超分尤其重要,因为低清图本来就包含了边缘、布局、主体位置等结构信息,白白丢掉太浪费了。
公式2:以低质图像潜变量为中心的源分布
公式2:以低质图像潜变量为中心的源分布。这里的 σ 不是摆设,它决定模型起点离 LQ 结构有多远。σ 太小,模型容易退化成“按像素回归”;σ 太大,又会把结构先验冲散。论文后面专门做了消融,说明这个参数确实不是随便拍脑袋定的。
公式3:残差流的轨迹定义
公式3:残差流的轨迹定义。xt=x0+t·(y0-x0)+t·σ·ε,ε∼N(0,I)。这个式子很像“从 HQ 慢慢退回到 LQ 周围,再在这个附近加一点随机扰动”。它的妙处在于,轨迹不是从无到有,而是从“有结构的近邻”逐步回到目标图像。
对应的训练目标也顺势改写。CFM 仍然负责学速度场,只不过监督信号变成了“从 LQ 附近的随机点走向 HQ 潜变量”的方向。这个设计很工程:既保留 flow matching 的连续建模优势,又让模型始终记得低质输入不是空气,而是带信息的条件。
公式4:条件流匹配损失
公式4:条件流匹配损失。它本质上是在做速度回归:模型预测的 vθ(xt,t,c) 要尽量接近真实的目标速度 x1-x0。其中 c 表示条件信息,也就是低质图像潜变量和语义特征。这里的思路并不花哨,但比“纯噪声起步”更符合超分任务的直觉。
第二刀更像是“既要又要”。现实部署里,大家当然希望一步出图,别让模型慢悠悠走 15 步、25 步像在散步。但很多单步加速方法一压缩,就把多步能力一起扔了,后面想再细修都没门。RFMSR 的两阶段训练就是为了解决这个尴尬:既要单步快,又不想把多步能力彻底废掉。
公式5:第二阶段联合优化目标
公式5:第二阶段联合优化目标。Phase II 在保留 CFM 速度损失的同时,加上 LPIPS 感知损失和 PatchGAN 对抗损失。LPIPS 更关注“看起来像不像”,GAN 更擅长逼出纹理细节,而 CFM 继续保证整体流场不跑偏。这个组合的意思很明确:单步结果要更好看,但不能把多步能力一起牺牲掉。
这套两阶段训练的逻辑其实很像“先教会走路,再教会冲刺”。Phase I 只做速度场预训练,让模型把流形和轨迹学扎实;Phase II 再在 t=1 的单步预测上加端到端监督,把视觉质量往上拽一把。与常见蒸馏不同的是,它不是把模型压成只能单步的“瘦身版”,而是保留了原本的多步推理接口。工程上这点挺值钱,毕竟单步是效率,多步是质量,能两头兼顾的方案不多。
认真看下来,这个方法的重点不是“多加了几个损失”,而是把超分任务的先验关系重新排了一遍:LQ 不是噪声,LQ 是起点;单步不是终点,多步也不能被顺手废掉。这个判断很实在,也很像真正做工程的人会想到的改法。

核心优势:从噪声到结构先验的范式转变

RFMSR 的优势可以浓缩成一句话:不是让模型“更会画”,而是让模型“少走弯路”。标准高斯起点像从一团随机噪声里摸黑找门,RFMSR 则是从门框旁边开始修。对图像超分这种任务来说,结构先验本来就存在,继续从纯噪声起步,多少有点浪费算力。
图1:对比从LQ中心高斯与标准高斯采样的差异
图1:对比从 LQ 中心高斯与标准高斯采样的差异。左边的起点保留了低质图像的结构信息,右边则是完全随机的噪声。对超分任务来说,前者显然更像“带着地图出门”,后者更像“闭眼蒙”。
论文还解释了一个很容易被忽略的问题:为什么不能把噪声彻底拿掉,只做确定性的线性插值。答案也很直白——超分是典型的一对多问题,同一张 LQ 图像可以对应很多合理的 HQ 细节。如果没有随机性,模型很容易学成条件均值,最后输出就会偏平、偏糊,纹理像被熨斗烫过一样。噪声在这里不是干扰项,而是给模型保留“多种合理答案”的空间。
图3:噪声强度σ对视觉效果的影响
图3:噪声强度 σ 对视觉效果的影响。σ=0 时,模型会退化成确定性回归,结果更平,但也更糊;把 σ 提到 1.0 后,细节会更丰富,视觉观感明显更像真实图像。这个结论很关键:不是噪声越少越好,而是要在结构保留和随机细节之间找到平衡。
从实现角度看,RFMSR 还有一个隐藏优点:它不需要额外引入庞大的文本到图像基础模型。论文采用的是 VOSR 的架构思路,骨干是 LightningDiT,编码器用 SD2.1 的 VAE,再加 DINOv2 语义特征。换句话说,它是一个纯视觉框架,不靠外部文本提示“瞎指挥”,这对超分任务非常重要,因为超分的目标是忠实还原输入,而不是凭空脑补。
这也解释了为什么 RFMSR 在一些细节上会比 T2I 路线更稳。文本提示有时会带来“想象力过剩”,把本来不存在的纹理或笔画补出来;而 RFMSR 主要依赖 LQ 结构和视觉条件,输出更容易贴近原图语义。对实际业务来说,这种“少胡说八道”的能力,往往比单纯追求更锐利更重要。

实验验证:全面超越现有方法

实验部分最值得看的,不是某个单项指标的“擦边赢”,而是 RFMSR 在多个数据集、多个设置下都能站住脚。论文选了 LSDIR、ImageNet-Test 和 RealSR 三个真实场景测试集,又把方法分成多步版和单步版来比较,这样的设计比较公平,也更能说明方法到底是“真强”还是“PPT 强”。
表1:三大数据集上的定量比较
表1:三大数据集上的定量比较。RFMSR 在多步设置下整体表现很稳,尤其在感知类指标上经常拿到最优或次优;在单步设置下,RFMSR 也明显优于同类单步方法,说明两阶段训练确实把“一步出图”的质量抬上去了。更重要的是,它没有依赖大体量文本到图像基础模型,路线更轻。
从结果结构看,RFMSR 的单步版并不是“为了快而牺牲太多质量”的妥协品。比如在 LSDIR 和 ImageNet-Test 上,LPIPS、DISTS、FID 这些感知指标都很能打,说明它不是只会把图像修得更锐,而是整体分布更接近真实图像。RealSR 上的表现也说明它对真实退化场景有一定适应性,不只是合成退化里的“实验室选手”。
图4:真实图像上的视觉对比
图4:真实图像上的视觉对比。可以看到,部分方法会出现局部伪影、纹理发虚,甚至文字和边缘都开始“自由发挥”;RFMSR 则更像是在认真补细节,既保结构,又尽量不乱编。这种效果对超分任务非常关键,因为用户通常不想要“看起来很炫但不对”的图,而是“看起来像原图该有样子”的图。
论文还专门做了一个很有说服力的对照:在相同架构和训练条件下,把标准 rectified flow 和 residual flow 放在一起比。结果显示,残差流在多个步数下都更有优势,尤其是感知指标和整体视觉质量。这说明提升并不只是来自更大模型或更长训练,而是源分布设计本身就更适合超分任务。
表2:标准rectified flow与残差流的多步比较
表2:标准 rectified flow 与残差流的多步比较。两者共享同样的模型结构,差别只在于起点分布。这样的控制变量实验非常关键,因为它几乎把“性能提升是不是因为别的花活”这件事堵死了。结果表明,只要把起点从纯高斯换成 LQ 中心高斯,模型就能更好地兼顾失真与感知质量。
再看训练策略对比。Phase I 只做速度场预训练时,多步推理能力很自然,但单步质量不够强;加入 Phase II 之后,单步指标明显改善,同时多步能力并没有被彻底废掉。反过来,Consistency 这类方法虽然单步看起来还行,但一旦拉到多步,质量反而明显掉下去,说明它更像是“压缩后不可逆”的路线。
表3:不同训练策略在多步推理下的比较
表3:不同训练策略在多步推理下的比较。这里最值得注意的是,Phase II 并没有把模型“锁死”成单步学生,而是保留了多步推理的空间。对实际系统来说,这意味着同一个模型可以按场景切换:实时场景走单步,追求更高质量时再走多步,这种灵活性很实用。
最后是噪声强度 σ 的消融。论文给出的结论很明确:σ 不是越小越好,适度噪声能帮助模型保留更丰富的纹理生成空间。这个结果其实挺反直觉,但很合理。超分不是简单的“去噪”,而是在保留结构的同时恢复高频细节;如果把随机性完全拿掉,模型就会变得过于保守,细节自然也会少。
表6:噪声强度σ的消融实验
表6:噪声强度 σ 的消融实验。这个表其实在提醒一件事:生成式超分里,随机性不是敌人,关键是随机性要被放在正确的位置。RFMSR 选择的是“围绕 LQ 的受控随机”,而不是“漫天撒噪声”,这才是它能兼顾结构和纹理的原因。

总结与未来展望:通往更高效、高质量的ISR之路

RFMSR 这篇工作给超分领域提了一个很实在的方向:别总盯着“模型还能不能再大一点”,先想想“起点能不能更聪明一点”。把源分布从纯噪声改成 LQ 中心高斯,本质上是承认低质输入本身就有价值;再用两阶段训练把单步和多步兼容起来,则是承认效率和质量并不一定只能二选一。
当然,这条路线也不是没有代价。它仍然依赖较强的编码器、较大的 backbone,以及较完整的训练数据;对极端退化、分布外图像或特别苛刻的实时场景,效果还能不能稳住,仍需要更多验证。换句话说,这不是“拿来就无脑上线”的方案,但作为高质量生成式超分框架,它已经比很多只会堆基础模型的路线更像一门正经工程。
如果把视野放长一点,RFMSR 代表的其实是一种更普适的思路:生成式恢复任务不一定非要从“无信息噪声”起步,凡是输入本身带有强先验的任务,都可以考虑把源分布往条件信息上靠。这个想法放在去噪、去模糊、图像修复、视频增强里,都有继续挖的空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决两个痛点:一是传统 flow matching 做超分时从纯噪声起步,浪费了低质图像里本来就存在的结构信息;二是很多单步加速方法虽然快,但会把多步推理能力一起丢掉。RFMSR 用“LQ 中心高斯 + 两阶段训练”同时处理了这两个问题。

σ 这个参数为什么这么重要?σ 控制源分布里随机扰动的强度。σ 太小,模型容易变成确定性回归,结果更平但也更糊;σ 合理时,模型既能保住 LQ 结构,又能生成更丰富的纹理细节,所以论文把它当成关键超参数来分析。

两阶段训练和普通蒸馏有什么区别?普通蒸馏常常把模型压成只能单步用的学生模型,快是快了,但多步能力没了;RFMSR 的两阶段训练是在保留 flow matching 速度场学习的基础上,再加单步端到端监督,所以它既能单步高质量输出,也还能多步逐步细修。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把源分布从纯噪声挪到 LQ 潜变量附近,这个改法不花哨,但很抓任务本质,属于“少做无用功”的聪明改法。

实验合理度:★★★★☆

对比了多步、单步、不同流匹配策略和噪声消融,控制变量比较清楚,结论可信度不错。

学术研究价值:★★★★☆

它不只是在超分里涨点数,更是在告诉大家:生成式恢复任务的“起点设计”值得认真研究,方法论意义挺强。

稳定性:★★★☆☆

视觉效果和指标都不错,但仍依赖较强骨干和较完整训练流程,离轻量级即插即用还有距离。

适应性以及泛化能力:★★★☆☆

在三个真实数据集上表现稳定,但更多退化类型、更多倍率和更复杂场景还需要进一步验证。

硬件需求及成本:★★☆☆☆

骨干是 0.5B 级别的 LightningDiT,训练和推理都不算轻,适合研究和高质量离线场景,不算低成本方案。

复现难度:★★★☆☆

代码已开源是加分项,但训练配置、数据规模和大骨干仍然让复现门槛不低。

产品化成熟度:★★★☆☆

若面向高质量离线超分或可切换单/多步的服务,具备一定落地潜力;若追求极致轻量实时,还得继续瘦身。

可能的问题:方法思路扎实,但计算开销仍偏大,且主要验证集中在 ×4 超分和特定退化管线,离更广泛部署还差一口气。


主要参考文献

Huang, S., Luo, T., Liu, J., Liu, D., Zhou, P. RFMSR: Residual Flow Matching for Image Super-Resolution. arXiv preprint arXiv:2607.12753, 2026.
代码地址:https://github.com/FazeHsw/RFMSR

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。