← 返回 PaperDaily
视觉与图像
CVPR 2026风格新作RFMSR:超分辨率不再从噪声硬冲
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
原论文信息如下:
方法创新:残差光流匹配与两阶段训练
这篇论文最有意思的地方,不是把模型再堆大一点,而是先把“起点”改了。传统 flow matching 做图像生成,默认从纯高斯噪声出发,像是让修图师闭着眼从一团雾里猜原图;RFMSR 则直接把起点挪到低质图像对应的潜空间附近,等于让模型先看见轮廓,再补细节。这个思路很朴素,但很对路。
先把几个术语说人话。flow matching可以理解成“学一条连续的搬运路线”,模型不直接猜最终图片,而是学每个时刻应该往哪儿走。Conditional Flow Matching,CFM是“条件流匹配”,意思是训练时不仅看起点,还看终点,让模型学会从指定起点搬到指定终点。这里的 Residual Flow Matching,就是把起点从标准高斯改成“围绕低质图像的高斯”,残差的味道很浓:不是从零造图,而是在已有结构上修。
RFMSR 的第一刀,砍在源分布上。标准 flow matching 里,源分布是 p1=N(0,I),也就是从纯噪声开始;RFMSR 改成 p1=N(y0,σ2I),其中 y0 是低质图像的潜变量,σ 控制初始扰动强度。换句话说,起跑线不再是“啥也没有”,而是“已经有个大概轮廓”。这一步对超分尤其重要,因为低清图本来就包含了边缘、布局、主体位置等结构信息,白白丢掉太浪费了。
对应的训练目标也顺势改写。CFM 仍然负责学速度场,只不过监督信号变成了“从 LQ 附近的随机点走向 HQ 潜变量”的方向。这个设计很工程:既保留 flow matching 的连续建模优势,又让模型始终记得低质输入不是空气,而是带信息的条件。
第二刀更像是“既要又要”。现实部署里,大家当然希望一步出图,别让模型慢悠悠走 15 步、25 步像在散步。但很多单步加速方法一压缩,就把多步能力一起扔了,后面想再细修都没门。RFMSR 的两阶段训练就是为了解决这个尴尬:既要单步快,又不想把多步能力彻底废掉。
这套两阶段训练的逻辑其实很像“先教会走路,再教会冲刺”。Phase I 只做速度场预训练,让模型把流形和轨迹学扎实;Phase II 再在 t=1 的单步预测上加端到端监督,把视觉质量往上拽一把。与常见蒸馏不同的是,它不是把模型压成只能单步的“瘦身版”,而是保留了原本的多步推理接口。工程上这点挺值钱,毕竟单步是效率,多步是质量,能两头兼顾的方案不多。
认真看下来,这个方法的重点不是“多加了几个损失”,而是把超分任务的先验关系重新排了一遍:LQ 不是噪声,LQ 是起点;单步不是终点,多步也不能被顺手废掉。这个判断很实在,也很像真正做工程的人会想到的改法。
核心优势:从噪声到结构先验的范式转变
RFMSR 的优势可以浓缩成一句话:不是让模型“更会画”,而是让模型“少走弯路”。标准高斯起点像从一团随机噪声里摸黑找门,RFMSR 则是从门框旁边开始修。对图像超分这种任务来说,结构先验本来就存在,继续从纯噪声起步,多少有点浪费算力。
论文还解释了一个很容易被忽略的问题:为什么不能把噪声彻底拿掉,只做确定性的线性插值。答案也很直白——超分是典型的一对多问题,同一张 LQ 图像可以对应很多合理的 HQ 细节。如果没有随机性,模型很容易学成条件均值,最后输出就会偏平、偏糊,纹理像被熨斗烫过一样。噪声在这里不是干扰项,而是给模型保留“多种合理答案”的空间。
从实现角度看,RFMSR 还有一个隐藏优点:它不需要额外引入庞大的文本到图像基础模型。论文采用的是 VOSR 的架构思路,骨干是 LightningDiT,编码器用 SD2.1 的 VAE,再加 DINOv2 语义特征。换句话说,它是一个纯视觉框架,不靠外部文本提示“瞎指挥”,这对超分任务非常重要,因为超分的目标是忠实还原输入,而不是凭空脑补。
这也解释了为什么 RFMSR 在一些细节上会比 T2I 路线更稳。文本提示有时会带来“想象力过剩”,把本来不存在的纹理或笔画补出来;而 RFMSR 主要依赖 LQ 结构和视觉条件,输出更容易贴近原图语义。对实际业务来说,这种“少胡说八道”的能力,往往比单纯追求更锐利更重要。
实验验证:全面超越现有方法
实验部分最值得看的,不是某个单项指标的“擦边赢”,而是 RFMSR 在多个数据集、多个设置下都能站住脚。论文选了 LSDIR、ImageNet-Test 和 RealSR 三个真实场景测试集,又把方法分成多步版和单步版来比较,这样的设计比较公平,也更能说明方法到底是“真强”还是“PPT 强”。
从结果结构看,RFMSR 的单步版并不是“为了快而牺牲太多质量”的妥协品。比如在 LSDIR 和 ImageNet-Test 上,LPIPS、DISTS、FID 这些感知指标都很能打,说明它不是只会把图像修得更锐,而是整体分布更接近真实图像。RealSR 上的表现也说明它对真实退化场景有一定适应性,不只是合成退化里的“实验室选手”。
论文还专门做了一个很有说服力的对照:在相同架构和训练条件下,把标准 rectified flow 和 residual flow 放在一起比。结果显示,残差流在多个步数下都更有优势,尤其是感知指标和整体视觉质量。这说明提升并不只是来自更大模型或更长训练,而是源分布设计本身就更适合超分任务。
再看训练策略对比。Phase I 只做速度场预训练时,多步推理能力很自然,但单步质量不够强;加入 Phase II 之后,单步指标明显改善,同时多步能力并没有被彻底废掉。反过来,Consistency 这类方法虽然单步看起来还行,但一旦拉到多步,质量反而明显掉下去,说明它更像是“压缩后不可逆”的路线。
最后是噪声强度 σ 的消融。论文给出的结论很明确:σ 不是越小越好,适度噪声能帮助模型保留更丰富的纹理生成空间。这个结果其实挺反直觉,但很合理。超分不是简单的“去噪”,而是在保留结构的同时恢复高频细节;如果把随机性完全拿掉,模型就会变得过于保守,细节自然也会少。
总结与未来展望:通往更高效、高质量的ISR之路
RFMSR 这篇工作给超分领域提了一个很实在的方向:别总盯着“模型还能不能再大一点”,先想想“起点能不能更聪明一点”。把源分布从纯噪声改成 LQ 中心高斯,本质上是承认低质输入本身就有价值;再用两阶段训练把单步和多步兼容起来,则是承认效率和质量并不一定只能二选一。
当然,这条路线也不是没有代价。它仍然依赖较强的编码器、较大的 backbone,以及较完整的训练数据;对极端退化、分布外图像或特别苛刻的实时场景,效果还能不能稳住,仍需要更多验证。换句话说,这不是“拿来就无脑上线”的方案,但作为高质量生成式超分框架,它已经比很多只会堆基础模型的路线更像一门正经工程。
如果把视野放长一点,RFMSR 代表的其实是一种更普适的思路:生成式恢复任务不一定非要从“无信息噪声”起步,凡是输入本身带有强先验的任务,都可以考虑把源分布往条件信息上靠。这个想法放在去噪、去模糊、图像修复、视频增强里,都有继续挖的空间。
龙迷三问
这篇论文到底解决了什么问题?它主要解决两个痛点:一是传统 flow matching 做超分时从纯噪声起步,浪费了低质图像里本来就存在的结构信息;二是很多单步加速方法虽然快,但会把多步推理能力一起丢掉。RFMSR 用“LQ 中心高斯 + 两阶段训练”同时处理了这两个问题。
σ 这个参数为什么这么重要?σ 控制源分布里随机扰动的强度。σ 太小,模型容易变成确定性回归,结果更平但也更糊;σ 合理时,模型既能保住 LQ 结构,又能生成更丰富的纹理细节,所以论文把它当成关键超参数来分析。
两阶段训练和普通蒸馏有什么区别?普通蒸馏常常把模型压成只能单步用的学生模型,快是快了,但多步能力没了;RFMSR 的两阶段训练是在保留 flow matching 速度场学习的基础上,再加单步端到端监督,所以它既能单步高质量输出,也还能多步逐步细修。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把源分布从纯噪声挪到 LQ 潜变量附近,这个改法不花哨,但很抓任务本质,属于“少做无用功”的聪明改法。
实验合理度:★★★★☆
对比了多步、单步、不同流匹配策略和噪声消融,控制变量比较清楚,结论可信度不错。
学术研究价值:★★★★☆
它不只是在超分里涨点数,更是在告诉大家:生成式恢复任务的“起点设计”值得认真研究,方法论意义挺强。
稳定性:★★★☆☆
视觉效果和指标都不错,但仍依赖较强骨干和较完整训练流程,离轻量级即插即用还有距离。
适应性以及泛化能力:★★★☆☆
在三个真实数据集上表现稳定,但更多退化类型、更多倍率和更复杂场景还需要进一步验证。
硬件需求及成本:★★☆☆☆
骨干是 0.5B 级别的 LightningDiT,训练和推理都不算轻,适合研究和高质量离线场景,不算低成本方案。
复现难度:★★★☆☆
代码已开源是加分项,但训练配置、数据规模和大骨干仍然让复现门槛不低。
产品化成熟度:★★★☆☆
若面向高质量离线超分或可切换单/多步的服务,具备一定落地潜力;若追求极致轻量实时,还得继续瘦身。
可能的问题:方法思路扎实,但计算开销仍偏大,且主要验证集中在 ×4 超分和特定退化管线,离更广泛部署还差一口气。
主要参考文献
Huang, S., Luo, T., Liu, J., Liu, D., Zhou, P. RFMSR: Residual Flow Matching for Image Super-Resolution. arXiv preprint arXiv:2607.12753, 2026.
代码地址:https://github.com/FazeHsw/RFMSR

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

