← 返回 PaperDaily 视觉与图像

BMVC 2026:零遗忘图像恢复,3.6%参数换15.25dB

先问一个很真实的问题:一个部署在野外监控杆上的图像恢复系统,第一年只需要去噪,第二年碰上了雾霾天开始需要去雾,第三年台风季又来了要处理雨纹。每一次新需求,难道都要把旧数据翻出来重新训练一遍?

BMVC 2026:零遗忘图像恢复,3.6%参数换15.25dB
原论文信息如下:
论文标题:
Restoring Without Forgetting: Continual Learning Across Image Degradations
发表日期:
2026年08月
发表单位:
Rochester Institute of Technology
原文链接:
https://arxiv.org/pdf/2608.23799v1.pdf

paperdaily_reaction_gif

封面:RwF 持续多退化图像恢复框架

从"一个模型吃遍所有退化"到"持续学习":图像恢复的新范式

先问一个很真实的问题:一个部署在野外监控杆上的图像恢复系统,第一年只需要去噪,第二年碰上了雾霾天开始需要去雾,第三年台风季又来了要处理雨纹。每一次新需求,难道都要把旧数据翻出来重新训练一遍?可旧数据往往因为存储、隐私、授权问题早已不在了。于是只能在新数据上微调,结果就是学会了去雾、忘了去噪,越学越倒退。
这就是灾难性遗忘(Catastrophic Forgetting):神经网络在学新任务时,把旧任务的权重覆盖掉了,旧技能断崖式失效。传统多退化修复的主流做法,要么是"一个退化训练一个专用网络",参数爆炸、维护成本惊人;要么是"All-In-One联合训练",一次性看到所有退化数据,可现实世界里退化是按时间顺序一个个冒出来的,哪有未卜先知把所有退化提前集齐的条件?
罗切斯特理工学院(Rochester Institute of Technology)的研究者把这个问题重新定义了一遍,发表在 BMVC 2026 上。他们提出RwF(Restoring without Forgetting,恢复而不遗忘)框架,核心思路非常干脆:把多退化图像恢复当作一个领域增量学习(Domain-Incremental Learning,DIL)问题——退化类型逐个出现、旧数据不可访问、测试时还不知道输入属于哪种退化。三个看似不可能同时满足的条件,RwF 居然全都接住了。
先看三种范式的直观对比。图1(a)展示了传统 One-By-One(每个退化一个独立网络)、All-In-One(单网络联合训练)和 RwF(冻结骨干+轻量适配器)的差异;图1(b)则给出五类退化顺序学习时的平均增量 PSNR:顺序微调(Sequential FT)随着退化累积一路下滑,而 RwF 稳稳扛住了所有域的性能。
图1(a):三种多退化图像恢复范式对比 图1(b):五类退化顺序学习下的平均增量PSNR,顺序微调性能下降而RwF保持稳定
图1:(a) 多退化图像恢复的三种范式:One-By-One(每个退化一个网络)、All-In-One(单网络联合训练)与 RwF(冻结预训练骨干,附加轻量退化专用适配器并在推理时无监督路由);(b) 五类依序学习的退化(噪声、+模糊、+雨、+雾、+低光)上的平均增量 PSNR,顺序微调随退化累积显著遗忘,RwF 在所有域上保持稳定。
这里有一个很容易被忽略、但非常关键的设计选择:RwF 把高斯去噪预训练的 Restormer 或 NAFNet 骨干直接冻结,作为整个系统的"通用自然图像先验底盘"。为什么噪声域可以白嫖?因为去噪网络要在区分信号与噪声的过程中学习干净自然图像的统计分布,这恰恰是其他退化恢复可以复用的最底层能力。后续四种退化(模糊、雨、雾、低光)则各自学习一组低秩适配器,从一个共享的"修复底座"上长出新技能。

冻结骨干+低秩适配器:如何从构造上消除遗忘

RwF 的整体框架如图2所示。流程可以分为三层来看:最底层是一个被冻结的去噪预训练编码器-解码器骨干,提供通用的自然图像先验;中间层是为每种新退化训练的一组网络级联低秩适配器(即"恢复路径"),路径之间严格参数隔离;最上层是一个基于原型匹配的无监督路由模块,推理时把未知输入分配给正确的路径。
图2:RwF框架结构图
图2:RwF 框架——去噪预训练的编码器-解码器骨干被冻结,每种新退化训练一组网络级联低秩适配器路径(严格参数隔离),先前路径与骨干保持不变。通过池化第一编码器阶段特征形成域原型,推理时以余弦相似度将未知输入路由到匹配路径进行恢复。
低秩适配器(Low-Rank Adapter)的数学形式非常简洁。给定骨干某个块的特征向量 z,适配器通过一个瓶颈结构计算残差修正:
低秩适配器公式
其中 W_down ∈ R^(r×d) 与 W_up ∈ R^(d×r) 构成秩为 r(r 远小于 d)的瓶颈,σ 是 ReLU 激活,LN 是层归一化,s 是固定缩放系数。按 LoRA 风格的初始化,W_down 用 Kaiming 初始化,W_up 初始化为零,这样适配器插入瞬间就是恒等映射,完全不打乱预训练特征。
单看一个适配器只修正一个块,而逆转一种退化往往需要沿编码-解码全程协同修正。所以 RwF 把一组覆盖网络所有块的适配器打包成一条"恢复路径":
恢复路径定义公式
这里的 L 是骨干的总块数。比如 Restormer 的 Transformer 块中,路径增强的前向传播会包裹 FFN 之后残差:
路径增强前向公式
Attn 和 FFN 全部冻结,只有适配器参数可训练。对于 NAFNet 这样的全卷积网络,适配器则注入通道混合分支之后,定义方式完全一致,所以 RwF 是骨干无关的。
顺序学习时的参数隔离是"从构造上消除遗忘"的关键。在第 t 个域,骨干与所有已提交路径 Φ<t 全部冻结,只优化新初始化的 Φt:
路径优化公式
因为不同域的路径参数位于互不相交的子空间,跨域梯度恒为零,遗忘被严格证明为 。同时,单域适配器的参数量仅为骨干的 3% 到 4%,五个域累计也只相当于 1.15 个骨干,比 5 个独立专用网络省了 4 倍以上的参数。
不过这里还埋着一个更深的问题:实验中采用了一个内容控制基准,所有退化都施加在同一个干净图像集上。为什么要费这个劲?如果不这么做,每个真实数据集自带不同的内容分布(街景、室内、风景),路由器和适配器就会把"内容差异"误当"退化差异",模型学会的是内容识别而不是退化识别。RwF 用一个共享语料库将所有域的内容分布对齐,数学上可以严格证明路由信息完全来自退化算子本身,这正是全部分析可靠性的地基。

无监督路由:不告诉模型输入是什么退化,它怎么知道该用哪条路?

测试时不知道输入属于哪种退化,是持续部署场景里最麻烦的问题。RwF 没有训练任何分类头,而是直接利用冻结骨干特征空间的几何结构,提出了一种原型匹配路由机制。
路由特征从哪里取,是个很有讲究的问题。分类领域的持续学习通常取分类器前的深度特征,但在图像恢复的跨退化设定下,结论恰恰相反:恢复骨干的本职工作是沿编码器抑制退化信号、逼近干净图像,越深的特征退化信息越少;到了瓶颈层,不同退化已经收敛到相似的"干净吸引子"附近,几乎无法区分。所以 RwF 在第一个编码器阶段末尾读取特征,那里退化痕迹保留得最明显。
拿到特征图之后怎么聚合?不同退化留下的印记在不同阶的统计量上:噪声放大通道标准差但不怎么改均值;雾霾把均值和方差都压平;雨纹在干净背景上引入结构化的高空间方差;低光照改变了整体亮度均值。只用全局平均池化(Global Average Pooling)会把方差信号丢掉,于是 RwF 对一阶矩(均值)和二阶矩(标准差)分别做 ℓ2 归一化再拼接成一个 2C 维的嵌入向量:
特征矩计算 路由决策公式
训练阶段取该域一半训练样本的嵌入平均作为域原型,推理时计算未知输入嵌入与所有原型的余弦相似度,取最大者对应的路径执行恢复。整个过程零额外参数、零训练开销,一次路由只多一次骨干前向。
有趣的是,即使路由偶尔选错,结果也远没有想象中那么灾难。图3展示了一个很有意思的案例:一张真实雾天图像(左)被错误路由到了雨纹去除路径,结果依然被恢复得八九不离十(右)。这说明不同退化的适配器路径之间共享了骨干的自然图像先验,存在一定的容错空间。
图3:雾天输入被误路由到去雨路径仍能基本恢复
图3:一张 D4 雾天输入(左)被误路由到 D3 去雨路径,仍然得到较好的恢复结果(右)。
此外,RwF 在顺序训练时不做任何显式正则化,也不需要重放(Replay)任何旧样本。因为每个路径和原型都是独立在冻结骨架上估计的,跨域不存在梯度耦合,最终模型状态与域到达顺序无关——也就是说 先学雾再学雨,和先学雨再学雾,最终效果完全一致。这种"顺序无关性"在持续学习里是相当奢侈的性质。

15dB提升背后的实验设计:内容控制基准与真实退化迁移

实验设计上,RwF 做了一个很多论文想做却嫌麻烦的事情:内容控制基准。五种退化(噪声、运动模糊、雾、雨、低光)全都施加在 DIV2K 同一个干净图像集上,每种退化的生成算子都严格对齐对应修复领域的文献设置:运动模糊核按参数化轨迹光栅化,雾用 Koschmieder 大气散射模型配合 MiDaS 深度估计,雨用多层深度平面合成加大气 veiling,低光用伽马衰减加泊松散粒噪声和高斯读出噪声。这样,五个域的唯一区别就是退化算子,实验的任何差异都能干净地归因到方法本身。
训练协议也值得一提。所有适配器路径统一用 ℓ1 像素损失、AdamW 优化器、学习率 2×10⁻⁴、训练 10 万迭代。相比从头训练的 Restormer(3×10⁻⁴)和 NAFNet(10⁻³),学习率刻意调低,因为是在预训练骨干上做精细微调。RwF 与顺序微调基线使用完全相同的骨干和超参数,唯一区别就是是否冻结骨干、是否加适配器,保证对比公平。
评估协议采纳了持续学习社区的标准框架,用评估矩阵 R 记录"训练完第 b 个域之后,在域 j 上的恢复质量",并给出三个汇总指标:最终平均性能 A_B、增量平均性能 Ā、平均遗忘 F。其中 F=0 代表完美保持。表1给出 oracle 设置下五域序列的持续学习对比:在 Restormer 骨干上,RwF 的最终平均 PSNR 比顺序微调高出 15.25 dB,在 NAFNet 上高出 11.83 dB,遗忘指标更是直接降到 0。
表1:五域序列持续学习对比(oracle设置)
表1:oracle 设置下五域序列(D1→D5:噪声、模糊、雨、雾、低光)的持续学习对比。
如果只看合成数据,说服力还是有限。RwF 进一步做了 sim-to-real 迁移实验:把五条适配器路径直接搬到 11 个经典真实退化基准上,共 3465 张图像。在不知道真实退化标签的域无关(domain-agnostic)设置下,路由准确率达到了 89.5%,重建质量与"幻想中的 oracle 完美路由"相比,PSNR 差距只有 0.94 dB。这说明三个关键事实:一是合成数据训练出来的适配器确实能迁移到真实退化;二是原型路由虽然简单,但跨数据集也足够可靠;三是即便剩下 10.5% 的误路由,图像质量损失也非常有限,呼应了图3的容错分析。
表2:RwF-Restormer在11个真实退化基准上的域无关评估
表2:RwF-Restormer 在 11 个真实退化基准上的域无关评估,报告域无关(Pred.)与 oracle 两种设置下的路由准确率和重建质量。
图4给出五类退化共享同一场景的视觉对比。上排是退化输入,中排是走完 D1→D5 全流程后的顺序微调 Restormer 输出,下排是 RwF-Restormer 在域无关推理下的输出,标注每张图的 PSNR。中排的雾气图像基本糊成一片,低光图像细节严重丢失,而 RwF 在每一类退化上都给出了干净、稳定、可用的恢复结果。
图4:五类退化共享场景的定性对比
图4:共享场景下五类退化域的定性对比。上:退化输入;中:顺序微调 Restormer 完成 D1→D5 全流程后的输出;下:RwF-Restormer 在域无关推理下的输出,路由器预测标注为(DtA)。每张恢复图为对应 PSNR。
路由机制本身的两个设计决策也被单独验证。表3比较了从不同编码器深度读取路由特征的效果,结果清晰地呈现"越浅越好"的倒挂现象——最浅的第一阶段特征路由准确率最高,验证了"恢复骨干的深层特征已经丢失退化信号"的判断。表4则比较了嵌入聚合方式,只用平均池化、只用标准差、以及均值和标准差的独立归一化拼接,后者明显占优,说明二阶统计量确实携带了正交的退化判别信息。
表3:路由质量与特征读取深度的关系
表3:RwF-Restormer 上路由质量与特征读取深度的关系。
表4:路由质量与嵌入聚合方式对比
表4:路由质量与嵌入聚合方式的对比。
对比 PaperDaily 已收录论文库中的持续图像恢复相关工作,RwF 是目前少有的、把"无遗忘保证"与"无监督路由"同时做出来的框架。CauSiam 做的是持续测试时适应(test-time adaptation),方向不同;MINI 虽然能扩展新能力,但嵌入池容量在设计时就得固定,不能随退化累积而扩张。RwF 在这条赛道上建立了第一个可以系统比较的基线,为后续工作提供了明确的对标坐标。
增补插图
实验结果分析:RwF 能work,主要有三个原因。第一,去噪骨干天然携带了与具体退化无关的自然图像先验,这是所有适配器能快速收敛的公共底座;第二,低秩适配器把"每个域的专属知识"压缩到极小的参数子空间,路径之间物理隔离,遗忘从数学上被清零,这是方法有效的结构性保障;第三,路由特征选择在第一编码器阶段读取均值+标准差双矩拼接,恰好捕捉了不同退化在底层统计特征上的差异化印记,而且完全不需要训练额外的分类器。实验结果也诚实反映了局限:十一个真实基准的路由准确率是 89.5% 而非 100%,说明合成数据与真实退化之间仍有分布差距;同时对每种退化只学一条固定路径,没有覆盖"同一种退化不同强度"这种更细的粒度。

局限与展望:全局退化路由、适配器泛化与未来方向

RwF 把"没有旧数据、不知道输入退化种类、还不能忘掉旧技能"这三个持续部署最苛刻的条件同时解决,往前迈了一大步,但边界也很清楚。最显眼的局限是路由机制的封闭性:原型库只在已见过的退化类型之间做选择,如果部署环境突然出现一种全新的、训练时从未见过的退化(比如极端雾霾加传感器坏点),路由器会强行把它分给最相似的已知类型。RwF 用共享骨干先验兜底了一个低配恢复结果,但不能真正学会新退化。
第二个局限是"每域一路"的粒度。现实中退化往往是一个连续谱:降噪有 σ=10 和 σ=50 的区别,模糊有轻度手持抖动和重度长时间曝光,低光有傍晚和深夜。RwF 目前的固定路径设计无法区分强度和程度的差异,这为后续"域内路内的强度自适应"留下了空间。第三,适配器本身是作为"岗位专用"训练的,没有探索跨域共享正迁移的机制——也许模糊和低光之间存在可复用的中间表征,但目前完全隔离的参数空间把这类协同效应挡住了。
未来值得期待的方向也很明确:如何设计一个"全局退化路由",让原型库可以随部署动态扩容,而不是闭集匹配;如何让适配器在保持零遗忘的同时,允许路与路之间的知识迁移;以及如何把 RwF 从离线持续学习推进到在线流式持续学习,让模型在真实运行中一边推理一边学。工具链方面,代码与权重已开源,复现门槛不高,RwF 有潜力成为持续图像恢复方向的事实基线。
龙哥表情包:这不生气,真的佩服

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?RwF将多退化图像恢复建模为持续域增量学习:冻结去噪骨干、逐域挂载低秩适配器,构造性实现零遗忘;再以无监督原型路由识别输入退化,五域序列较顺序微调提升最高15.25dB,迁移11个真实基准89.5%路由精度。
这篇工作最值得看的点是什么?RwF在五域序列上相比朴素顺序微调,Restormer骨干上最终平均PSNR提升15.25 dB,NAFNet上提升11.83 dB;在11个真实退化基准上达到89.5%路由准确率,与oracle路由仅差+0.94 dB PSNR。
这篇工作的边界或风险在哪里?优点:(1) 通过参数隔离从构造上消除灾难性遗忘,无需正则化或回放;(2) 参数高效,每个新域仅需约3-4%骨干参数;(3) 无监督路由机制无需域标签;(4) 在Transformer和卷积骨干上均验证有效。缺点:(1) 对全局性退化(如低光)的路由准确率较低(LOL-v1仅46.7%);(2) 对超出训练合成分布的真实退化(如Rain100H重雨)存在适配器泛化差距;(3) 适配器数量随域数线性增长,长期部署时参数累积仍需关注。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出RwF框架,冻结预训练去噪骨干网络,为每个新退化类型增量式学习轻量级低秩适配器路径,通过原型匹配机制在测试时无监督路由到正确的恢复路径,从根本上消除灾难性遗忘。

实验合理度:★★★★☆

PSNR, SSIM, 路由准确率(ID Acc.),以及持续学习指标AB(最终平均质量)、Ā(增量平均质量)、F(平均遗忘量)

学术研究价值:★★★★☆

提出RwF框架,冻结预训练去噪骨干网络,为每个新退化类型增量式学习轻量级低秩适配器路径,通过原型匹配机制在测试时无监督路由到正确的恢复路径,从根本上消除灾难性遗忘;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

RwF-Restormer总参数量约31M(27.11M骨干+4×0.98M适配器),相比5个独立专家网络(135.6M)减少超过4倍;推理时路由仅需一次stage-1前向传播,无额外可训练参数。

复现难度:★★★☆☆

https://github.com/AlifAshrafee/Restoring-Without-Forgetting

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 对全局性退化(如低光)的路由准确率较低(LOL-v1仅46.7%);

主要参考文献

[1] Alif Ashrafee, Bartosz Krawczyk. Restoring Without Forgetting: Continual Learning Across Image Degradations. BMVC 2026. 论文链接:https://arxiv.org/pdf/2608.23799v1.pdf
[2] 项目开源地址:https://github.com/AlifAshrafee/Restoring-Without-Forgetting
[3] Zamir S W, et al. Restormer: Efficient Transformer for High-Resolution Image Restoration. CVPR 2022.
[4] Chen L, et al. Simple Baselines for Image Restoration. ECCV 2022. (NAFNet)
[5] van de Ven G M, Tolias A S. Three Scenarios for Continual Learning. arXiv:1904.07734.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球