← 返回 PaperDaily 视觉与图像

武大最新CoRE-UIR:一网打尽12种遥感退化,PSNR+1.05dB、提速近12倍!

“单模型修复所有退化”的热潮里,武汉大学这个工作把专家网络玩出了新花样——公共专家打底、低秩残差专家补丁,还能白嫖CLIP语义先验。12种退化一锅端,PSNR涨了1.05dB,速度却快了近12倍,遥感修复玩家值得一读。

原论文信息如下:
论文标题:
CoRE-UIR: Prior-guided common and residual experts for efficient all-in-one remote sensing image restoration
发表日期:
2026年07月(arXiv:2607.27898v1)
发表单位:
武汉大学(测绘学院、人工智能学院、测绘遥感信息工程国家重点实验室)
原文链接:
https://arxiv.org/pdf/2607.27898v1.pdf
开源代码链接:
https://github.com/zzaiyan/CoRE-UIR

图6:真实遥感退化场景下的可视化修复效果。
无人机在天上飞一圈,带回来的照片可能是雾里看花、雨丝纵横、暗光模糊甚至多种退化叠加在一起。如果按照老思路,雾天一个去雾模型、雨天一个去雨模型、低光又一个提亮模型,工程上根本维护不过来。于是“全合一图像修复”(All-in-One Image Restoration,AiOIR)成为一个很自然的诉求:一个模型,吃下所有退化类型。
但想法很美,落地很难。遥感场景下,AiOIR面临三重困境。

1. 全能修复的“三重困境”:如何让一个模型搞定所有遥感退化?

第一,退化线索弱且隐式。很多退化是全局统计偏移与局部结构破坏混在一起的。雾和灰尘会改变整幅图像的颜色、对比度和能见度,但强度又随场景深度变化;雨则是稀疏的局部条纹。模型很难用一个统一的描述符把退化类型和退化程度组织起来。
第二,参数冗余严重。很多自适应修复方法借助专家混合(Mixture of Experts,MoE)机制,为不同退化分配不同的专家分支。但多个专家常常在学重复的行为——毕竟去雾和低光增强都需要对比度提升和亮度归一化。全秩专家一多,参数和算力都白白浪费。
第三,单一退化假设失效。真实遥感图像里,运动模糊和低光常常一起出现,雨和雾也会叠加。专门处理单一退化的模型面对复合退化时经常“按下葫芦浮起瓢”。
武汉大学团队提出的CoRE-UIR(Common and Residual Experts for Universal Image Restoration,公共与残差专家通用图像修复),就是冲着这三个痛点来的。它把修复能力显式拆成“公共专家+残差专家”两层:公共专家负责所有退化都需要的通用修复,低秩残差专家只补退化专属的差异。配合CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)先验引导,实验里整体平均PSNR相对最强基线BaryIR提升了1.05dB,推理速度快了11.83倍,峰值显存占用降了85.3%
这个成绩是怎么做到的?从头拆开看。
图1:CoRE-UIR整体框架。左侧为退化先验嵌入,右侧为全局-局部自适应网络。

2. 核心创新:公共专家与残差专家的“能力分工”

先说说MoE的“老毛病”。传统MoE里,每个专家都是一套完整的网络分支,路由网络根据输入自动激活不同专家。但图像修复和语言模型不一样,它的大部分基础能力(比如去噪、对比度调整、纹理恢复)是几乎所有退化都共享的。用一堆全秩专家去重复学习这些共性,显然不是最优解。
CoRE-UIR的解法很巧妙:保留骨干网络里的原始密集块作为“公共密集专家”,它始终处于激活状态,负责所有退化都需要的修复行为;另外再放一组低秩残差专家,只负责“当前样本特有的那部分补偿”。由于残差专家是低秩的,模型想学也学不出太复杂的通用行为,于是被“逼”着去专注退化差异。
具体地,每个CoRE块内部维护N个低秩专家对(A_n, B_n),每一对由两层3×3卷积组成,映射关系是C→r→C,其中秩r远小于通道数C。这个设计借鉴了LoRA(Low-Rank Adaptation,低秩自适应)的思想:用极小的参数量描述一个残差方向。
那如何选择专家?这里有一个原型引导路由(Prototype-Guided Router,PG-Router)。先让退化先验嵌入z_deg过一个线性层得到路由查询向量,再和一组可学习的原型向量做缩放余弦相似度,保留得分最高的k个专家,再Softmax归一化得到路由权重g。这组原型向量可以理解为“退化原型”——每个原型对应一种退化风格的原型,路由分数反映当前输入与这些原型有多像。对复合退化来说,Top-k稀疏路由允许同时激活多个专家,正好匹配“雨+暗光”这类多重退化。
最终输出就是公共专家输出加上加权求和后的低秩残差专家输出,可以写成:F_out = E_com(F_in) + Σ g_n · E_res,n(F_in)。其中E_com表示公共密集专家,E_res,n表示第n个低秩残差专家,g_n是对应的路由权重。
图3:原型引导路由的结构,通过余弦相似度选择最相关的低秩残差专家。
这种“公共+残差”的分解还有一个额外收益:由于残差专家是低秩的,即使专家数量增加,额外参数和延迟也被压得很低。这也解释了为什么CoRE-UIR能在12种退化上都保持高精度的同时,推理速度和显存表现却接近单任务模型。

3. 先验引导:把CLIP的“语义大脑”调教成“修复专家”

有了好的专家结构,还需要一个“调度员”来决定让专家往哪个方向修补。CoRE-UIR找来的调度员是CLIP。CLIP是OpenAI在亿级图文对(image-text pairs)上训练的视觉-语言模型,它提取到的特征对“图像里有什么”非常敏感。但CLIP天生是做语义对齐的,不是做图像修复的,直接拿来当退化先验会“驴唇不对马嘴”。
论文的做法是参数高效微调:冻结CLIP图像编码器,只训练一个轻量适配器(Adapter),把CLIP特征翻译成面向修复的退化嵌入。项目实现中使用的CLIP图像编码器是OpenAI开源的ViT-Base-Patch32,权重可以直接用。
为了兼顾全局和局部信息,退化先验嵌入(Degradation Prior Embedding,DPE)模块会构造两个视图:一个全局缩放视图保留整体雾浓度、亮度偏移等场景级退化信息;一个局部裁剪视图捕捉雨丝、模糊边缘等细节纹理。两个视图的CLIP特征拼接后送入适配器,压缩成紧凑的退化嵌入z_deg。训练时还加了一个多标签分类头,让z_deg能够同时预测当前样本包含哪几种退化。这个分类头训练完就丢弃,真正的修复阶段只需要z_deg做条件输入。
图2:全局特征调制(GFM)模块的结构。
先验嵌入准备好之后,怎么注入骨干网络?论文设计了一个全局特征调制(Global Feature Modulation,GFM)模块。这里有个细节:同一个退化类型在不同图像、不同网络阶段的表现程度不一样,所以GFM把“退化先验”和“当前特征图的状态”两路信息结合,用类似Squeeze-and-Excitation的方式做通道级重标定。公式上,先对特征图做全局平均池化再过线性层得到状态描述子f_state,对z_deg过线性层得到先验描述子f_prior,两者相加后经过一个瓶颈MLP加Sigmoid,得到通道权重w,最后特征图按照F + LN(F)⊙w完成调制,其中LN表示LayerNorm,⊙表示通道维逐元素相乘。
在整体网络中,GFM在每一层的入口做一次全局调制,CoRE在块内部做局部残差补偿,一个管全局统计,一个管局部结构——这种“全局+局部”的解耦设计,正好对应遥感退化中“全局偏移+局部破坏”同时存在的特点。

4. 实验全景:质量、速度、下游任务,一个都不能少


4.1 实验设置

实验覆盖了无人机和卫星两个域。主战场是MDVD-108K数据集,包含6种单一退化和6种复合退化;卫星域则在MDRS-Landsat上做泛化验证。评价指标采用PSNR和SSIM,下游任务验证使用目标检测精度。

4.2 定量对比与效率

先看定量结果。在MDVD-108K上,CoRE-UIR的PSNR/SSIM相比SOTA方法几乎全面领先,尤其在复合退化上优势更为明显——靠的就是“公共专家打底+低秩残差专家针对性补偿”这种冗余更小的结构,以及CLIP先验给出的稳定退化判别信息。
表2:MDVD-108K上与主流通用修复方法的定量对比(PSNR/SSIM)。
质量只是其中一张王牌。CoRE-UIR相对BaryIR实现了11.83倍加速和85.3%峰值显存下降。低秩残差专家让路由分支的增量开销变得非常小,公共密集专家本身又是所有退化共享的,换来的是接近单任务模型的推理成本。这个性价比在工程上非常诱人。
表4:不同方法在推理速度与显存占用上的对比。

4.3 可视化与下游任务

可视化结果同样明显。在低光+雨、雾+模糊这类复合退化场景下,CoRE-UIR能很好地兼顾“整体提亮/去雾”和“局部去雨丝/清晰化”,而对比方法往往只处理了一半。
图5:复合退化场景下不同修复方法的视觉效果对比。
除了修复质量,论文还做了下游任务验证:把修复后的图像喂给目标检测器。结果显示,CoRE-UIR修复后的图像在检测精度上整体优于其他修复方法,说明修复不只是在像素上好看,对更高层的视觉感知也有正收益。
表5:修复后图像的目标检测性能对比。
图6:真实退化无人机图像上的修复效果展示。

4.4 实验结果分析

CoRE-UIR能work的核心原因,在于它把“大多数人需要的公共能力”和“少数场景需要的专属能力”彻底拆开。低秩残差专家的设计限制了每个专家的表达容量,反而让路由能学习到更有区分度的退化原型。从消融实验来看,去掉GFM或去掉残差专家都会带来明显掉点,说明“全局调制”和“局部补偿”两者缺一不可。
需要客观指出的是,上述对比优势是在PaperDaily已收录的同类方法范围内得到的辅助判断。不同对比方法可能有不同的训练数据规模和训练设置,跨论文横向对比时建议保持谨慎。但就论文自身的受控实验设置来看,CoRE-UIR确实是目前综合表现最均衡的通用遥感修复方法之一。

5. MDVD-108K数据集:补齐无人机多退化修复的短板

谈遥感通用修复,数据是绕不开的坎。此前遥感领域没有一个大规模、带检测标注的无人机多退化基准,很多工作只能在小规模数据上自娱自乐。CoRE-UIR的团队干脆自己造了一个数据集:MDVD-108K(Multi-Degradation VisDrone Dataset,多退化VisDrone数据集)。
数据集基于VisDrone检测数据集构建。先用Depth Anything V2估计场景深度,再基于物理退化模型合成退化图。退化分为6种单一类型:天气类(雾、灰尘、雨)和成像类(低光、运动模糊、散焦模糊);复合退化则从天气类和成像类中各取一个做配对,一共6种。这样覆盖了“全局统计偏移”和“局部结构破坏”的组合,逼着模型必须同时具备全局调制与局部残差补偿能力。
整个数据集总共108,500张512×512图像,其中108,000张是合成配对数据,按86,400/10,800/10,800划分训练/验证/测试;另有500张真实退化无人机图像用于定性展示。为了支持下游任务评估,原本的VisDrone检测标签被映射成三个粗粒度类别:person(行人/人群)、micro_vehicle(自行车/三轮车/摩托车等小型车辆)、vehicle(汽车/卡车/公交车等车辆)。更重要的是,数据划分严格沿用VisDrone官方的train/val/test划分,合成在划分之后进行,避免数据泄漏。
图4:MDVD-108K中不同单一/复合退化样本示例。
表1:MDVD-108K数据集的组合设计与数量统计。
这个数据集本身可能是比模型更持久的贡献——它给了遥感修复领域一个可以横向对比的公共基准,尤其是“复合退化”这个之前很少被系统讨论的维度。项目代码和数据集将遵循Apache-2.0协议开源,这一点对社区也非常友好。

6. 总结与展望:通用修复的下一个突破口在哪里?

CoRE-UIR把“解耦”这件事做到了相当高的程度:能力层面解耦出公共专家与低秩残差专家,特征层面解耦出全局调制与局部补偿,先验层面解耦出语义理解与修复控制。每一步都不算惊世骇俗,但组合起来,确实把全能修复的质量-效率权衡往前推了一大截。
当然,它也不是终点。CLIP的语义先验对遥感图像的适配还有局限——遥感图像和自然图像分布差异不小,未来或许可以用遥感专属的视觉-语言模型替代CLIP;另外当前数据集主要由合成退化构成,真实退化与合成退化之间还有分布gap,MDVD-108K里的500张真实图像目前也只用于定性评估。未来如果能引入自监督退化估计或无监督域适应,模型在真实场景下的泛化能力会更值得期待。

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

CoRE里的低秩残差专家和LoRA有什么关系?LoRA是在冻结权重旁边加一条低秩旁路B×A来微调大模型,只学一个低秩增量。CoRE的思路类似,它把每个残差专家设计成A_n和B_n两个低秩矩阵的乘积,容量被限制在很小的秩r内。正因如此,专家们“没能力”复现全套通用修复行为,只能去学退化差异,从而实现公共能力和残差能力的分工。可以说CoRE是LoRA思想在视觉MoE路由场景下的变体。

GFM每层都要做,会不会增加很多计算量?不会。GFM只是对特征图做全局平均池化、两个线性层和Sigmoid,输出的是通道权重,计算量只跟通道数挂钩,与空间分辨率解耦,整体开销非常轻量。相比传统SE注意力只是多了一条先验分支,计算量几乎可以忽略,却能让骨干网络每个阶段的入口都对齐退化先验。

CLIP图像编码器不是很大吗?冻结它做推理不会很慢吗?确实,CLIP编码器本身有几百M参数,且输入需要先缩放/裁剪。但关键在它的推理频率很低——整个模型只需对降质图计算一次全局+局部两个视图的特征,之后所有阶段共享同一个退化嵌入z_deg。真正的像素级修复由轻量骨干完成,所以整体推理速度依然能比BaryIR快近12倍。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

“公共+低秩残差专家”的分解思路是对MoE冗余问题的一次精准手术,不是颠覆式创新,但落点非常巧妙,工程视角很强。

实验合理度:★★★★☆

对比方法覆盖了通用修复到遥感专用修复的完整谱系,也有消融和下游任务验证。唯一不足是部分对比方法官方实现缺失,可能存在设置差异,但整体可信度较高。

学术研究价值:★★★★☆

两层解耦的思想以及MDVD-108K数据集的构建,都会给后续遥感通用修复研究提供清晰的参考坐标。

稳定性:★★★★☆

在单一、复合、真实退化以及跨域卫星数据上都有不错表现,稳定性在同类方法中属第一梯队。

适应性以及泛化能力:★★★★☆

无人机和卫星域都验证过,但仍以合成退化为主,真实复杂光照下的泛化还需要更多实测数据来证明。

硬件需求及成本:★★★★★

冻结CLIP+低秩残差专家+轻量骨干,推理速度和显存占用都明显优于同级别的全秩MoE方案,部署成本非常友好。

复现难度:★★★★☆

代码和数据集均已开源(Apache-2.0),依赖也常规,环境照着requirements装即可。不过MDVD-108K数据集需自行下载并按要求组织目录,复现仍要花点时间。

产品化成熟度:★★★★☆

已经接近可部署水平,尤其适合无人机巡查、遥感应急响应等对时效性敏感的工程场景。真实退化覆盖有限,是当前产品化的主要制约。

可能的问题:部分改进幅度来自精心设计但较为复杂的模块组合,消融实验可以再深挖每个组件的独立贡献;真实退化测试集样本偏少,说服力有限。后续若能补充跨传感器、跨分辨率的真实数据评估,会更有说服力。


主要参考文献

[1] Zhang Z, Yuan Q, Li J, et al. CoRE-UIR: Prior-guided common and residual experts for efficient all-in-one remote sensing image restoration. arXiv:2607.27898v1, 2026.
[2] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision. ICML, 2021.
[3] Shazeer N, Mirhoseini A, Maziarz K, et al. Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. ICLR, 2017.
[4] Wang Z, Bovik A C, Sheikh H R, et al. Image quality assessment: From error visibility to structural similarity. IEEE Transactions on Image Processing, 2004.
[5] Zhang R, Isola P, Efros A A, et al. The unreasonable effectiveness of deep features as a perceptual metric. CVPR, 2018.
[6] Lihe Z, et al. Ada4DIR: Adaptive degradation-aware learning for all-in-one image restoration. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
遥感影像“一键美颜”,CoRE-UIR 请来公共专家+残差专家双保险,12种退化一锅端还这么快~想看更多图像修复前沿解读?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。