← 返回 PaperDaily 视觉与图像

小米ACM MM 2026新作:图像修复告别"一刀切",像素级引导涨1.51dB

大伙儿平时用手机拍照,有没有遇到过这种场景:明明窗外阳光正好,拍出来的照片却一半清晰一半糊,或者人脸是清楚的,背景却蒙了一层雾。这时候大多数修复算法会怎么做?

小米ACM MM 2026新作:图像修复告别"一刀切",像素级引导涨1.51dB
原论文信息如下:
论文标题:
Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance
发表日期:
2026年08月
发表单位:
Xiaomi Corporation
原文链接:
https://arxiv.org/pdf/2608.09482v1.pdf

像素级恢复:告别“一刀切”的图像修复时代
大伙儿平时用手机拍照,有没有遇到过这种场景:明明窗外阳光正好,拍出来的照片却一半清晰一半糊,或者人脸是清楚的,背景却蒙了一层雾。这时候大多数修复算法会怎么做?它们恨不得拿同一把“刷子”把整张图都刷一遍——降噪就全图降噪,去雨就全图去雨。结果呢?该修的地方修不干净,不该动的地方反而被抹掉了细节,简直是“伤敌一千,自损八百”。
小米公司的一支研究团队显然也注意到了这个问题,他们最近在arXiv上发布了一项新工作——MGN-AIR(Multimodal Guidance Network for All-in-One Image Restoration,多模态引导的全合一图像恢复网络)。这项工作的核心就一句话:别再对整张图“一刀切”了,咱们按像素来修
先看一张图,大家感受一下问题的本质。下图中,上面一行是传统方法的思路——用prompt(提示)给整张图一个全局引导,告诉模型“这张图有雨,去雨吧”。但真实世界里的退化哪有这么乖巧?一张图片里可能同时有雨、有雾、有噪声,而且不同位置的退化程度天差地别。有的地方需要重拳出击,有的地方只需要轻轻拂尘。
图1:现有方法通常集成提示来提供全局级别的图像恢复引导。相比之下,本文方法通过利用编码全局退化和局部退化强度的文本与视觉提示,实现细粒度的像素级恢复。
图1:现有方法通常集成提示来提供全局级别的图像恢复引导。相比之下,本文方法通过利用编码全局退化和局部退化强度的文本与视觉提示,实现细粒度的像素级恢复。
看这张图的对比就非常直观:左侧是“低光照”图像,几乎整张图都被噪声覆盖,需要全局修复;右侧是“雨”图像,只有局部区域受雨滴影响,其余部分其实是干净的。拿处理低光照的思路去处理雨天图像,那些没下雨的区域不就被白白“修理”了一顿吗?这正是本文要解决的核心痛点。

多模态引导:让模型知道“看哪里”和“怎么修”

这里要先普及一个背景知识:什么是“提示”(Prompt)?在图像修复领域,prompt可以理解为给模型的一个“额外说明”。就好比你去理发店,光说“剪短一点”是不够的,还得说清楚“两边推掉、上面打薄、刘海修一下”。文本提示(textual prompt)告诉模型“这张图有什么类型的退化”,比如“下雨了”、“起雾了”、“太暗了”,对应理发时说的“我要剪什么发型”。视觉提示(visual prompt)则告诉模型“退化在哪些位置、严重程度如何”,对应理发时说清楚“哪些地方要重点处理”。
之前的方案里,文本提示和视觉提示通常是在“全局层面”用一下就完事了。文本提示在整张图上告诉模型“这是雨”,视觉提示则在某个特征层的全局向量上加一个偏移量。问题在于:雨不是均匀落在每个像素上的啊!有的像素被雨滴完全遮挡,有的像素干干净净,你用同一个全局提示去引导恢复,就像给全班同学布置同一道题,不管大家各自的薄弱点在哪。
MGN-AIR的破局思路很直接:在像素级别上融合文本提示和视觉提示,让每个像素都知道自己“该被怎么处理”。具体来说,它用文本提示提供全局语义信息——这张图的退化类型是什么?再用视觉提示提供局部空间信息——每个像素的退化强度有多大?两者结合,生成一个逐像素的“恢复矩阵”(restoration matrix),告诉模型:这个像素要重点修、那个像素轻轻带过就好。
打个比方:以前的方法是给图片写一张“医嘱”——“这张图有肺炎,开阿莫西林”;MGN-AIR做的是给图片拍一张CT,标出每个病灶的位置和大小,然后“精准打击”。这显然比“盲开药”要靠谱得多。

三大核心模块:从视觉提示到像素级恢复矩阵

接下来看看MGN-AIR的整体架构。如图2所示,模型延续了U-Net编码器-解码器的基本骨架,但在每一层都嵌入了本文的核心单元——多模态引导块(Multimodal Guidance Block,MGB)。MGB里包含三个关键部件:视觉提示生成模块(Visual Prompt Generation Module,VPGM)、多模态引导模块(Multimodal Guidance Module,MGM),以及像素级恢复模块(Pixel-Level Restoration Module,PLRM)。
图2:MGN-AIR的整体框架。左侧是U-Net架构,由本文提出的多模态引导块(MGB)组成。右侧描述了MGB的细节。(1)生成由退化图像和干净图像之间的差异监督的视觉提示;(2)在多模态提示引导下估计逐像素恢复矩阵;(3)基于恢复矩阵执行像素级恢复。
图2:MGN-AIR的整体框架。左侧是U-Net架构,由本文提出的多模态引导块(MGB)组成。右侧描述了MGB的细节。(1)生成由退化图像和干净图像之间的差异监督的视觉提示;(2)在多模态提示引导下估计逐像素恢复矩阵;(3)基于恢复矩阵执行像素级恢复。
这三个模块的配合逻辑如下:VPGM负责“看”,MGM负责“想”,PLRM负责“做”。每个阶段第i层输入上一层的特征F^(i-1),依次经过三个模块,得到该层的输出F^i。公式可以直观地表示为:
公式1:V^i = VPGM(F^(i-1));P^i = MGM(T, V^i);F_s^i = PLRM(P^i, F^(i-1))。
公式1:在第i层,首先由VPGM生成视觉提示V^i,然后MGM结合文本提示T和视觉提示V^i生成多模态引导P^i,最后由PLRM根据引导P^i对特征F^(i-1)进行像素级恢复,得到中间特征F_s^i。
再说得细一点。在VPGM里,第一层的视觉提示是通过“显式监督”学出来的:直接拿退化图像和干净图像做逐像素差,求绝对值、对通道取平均、再做一次min-max归一化——这个差值图就是最真实的“退化热力图”,哪里有退化、退化多严重,一目了然。模型照着这个热力图去学习生成视觉提示。到了更深层,就不需要这么直白的监督信号了,让网络自己隐式地学,效果反而更好,因为深层语义更抽象。
公式2:X = (1/C)∑|I_HQ^i - I_LQ^i|;X_hat = (X - X_min) / (X_max - X_min)。
公式2:退化热力图的构造方式。其中I_HQ和I_LQ分别表示干净图像和退化图像,C是通道数。首先对每个通道的绝对差求平均,再进行min-max归一化,得到范围在0到1之间的退化强度图。
MGM部分的设计也很有意思。文本提示从哪来?作者直接用了CLIP的文本编码器(CLIP是OpenAI提出的图文对比预训练模型),假设输入的退化类型是“雨”,那CLIP文本编码器就会吐出一个512维的向量T,代表“雨”的语义特征。问题是这个向量是全局的,怎么让它跟局部的视觉提示V逐像素地融合呢?作者先对T做全局平均池化,拼上一个可学习的缩放参数β,过一个1D卷积,再把这个全局特征在空间上复制扩张成H×W大小,然后跟视觉提示V逐元素相乘,最后过一个2D卷积和Sigmoid激活函数,就得到了每个像素在[0,1]区间的恢复强度——也就是恢复矩阵P。
公式3:T^p = Concat[Avg(T); β];V^p = Conv1D(T^p) ⊙ V;P = Sigmoid(Conv2D(V^p))。
公式3:多模态引导模块的计算过程。全局文本特征T经过聚合后与可学习参数β拼接,通过1D卷积后与视觉提示V逐元素相乘,再通过2D卷积和Sigmoid得到最终的逐像素恢复矩阵P。
最后一步是PLRM,也就是真正“动手修”的部分。这里用了一个很巧妙的加权策略:对于退化严重的像素(恢复矩阵P的值接近1),主要依赖局部相邻区域的上下文信息来修复,用的是3×3卷积和空洞卷积的组合,用来扩大感受野;对于退化较轻的像素(P的值接近0),则更多依赖图像中重复出现的结构模式,用的是8×8窗口内的空间注意力机制。最后,把两种策略的结果按P进行加权融合,相当于是“按需分配”算力。
这个设计逻辑非常符合直觉:一张被暴雨淋过的照片,那些被雨滴糊死的地方,旁边的像素信息也被污染了,你只能靠更大范围的邻居信息去“猜”;而一张逆光照片里的暗部区域,虽然亮度不够,但边缘和纹理信息还在,注意力机制就能从远处找到相似结构来帮忙“补光”。

实验全面领先:混合退化场景提升1.51dB

有了理论支撑,再看看实际表现。论文在多个基准上做了测试,其中最有说服力的当属CDD11数据集——这是一个专门模拟“复合退化”的基准,把低光照(L)、雾(H)、雨(R)、雪(S)四种基础退化两两组合甚至三三组合,形成11种退化场景。换句话说,同一张图里可能既有雾又有雨,而且不同区域退化组合还不一样,这非常接近真实世界的恶劣天气。
表1:CDD11复合退化数据集上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在单一和复合退化上均一致优于现有模型。
表1:CDD11复合退化数据集上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在单一和复合退化上均一致优于现有模型。
从表1可以看到,MGN-AIR在单个退化任务上就展现出了碾压性优势,比如在Haze任务上PSNR达到36.06dB,比之前最好的MoCE-IR高出3.4dB;在Rain任务上达到36.53dB,也比MoCE-IR高出2.22dB。复合退化场景更是全线飘红,平均值30.56dB,比MoCE-IR高1.51dB,比OneRestore高2.09dB。要知道在图像恢复领域,PSNR能提升0.5dB都算是显著进步了,这1.51dB的提升可以说是“降维打击”。
图3:MoCE-IR、OneRestore和本文方法在CDD11数据集上的可视化结果。用不同颜色的框标出全局图像和局部细节,便于观察。MGN-AIR能有效去除雾、雨和雪条纹,同时保留图像中的局部细节。
图3:MoCE-IR、OneRestore和本文方法在CDD11数据集上的可视化结果。用不同颜色的框标出全局图像和局部细节,便于观察。MGN-AIR能有效去除雾、雨和雪条纹,同时保留图像中的局部细节。
再看图3的可视化对比,红色框标出的区域是细节最丰富的地方。可以看出,MoCE-IR和OneRestore在处理这种混合退化时,要么没把雾除干净,要么把雪的纹理给糊掉了。MGN-AIR的效果则干净得多,雨丝去掉的同时,远处的建筑轮廓和树木纹理都保存完好。
在五种典型退化任务(去噪、去雾、去雨、去模糊、低光照增强)的联合测试中(表2),MGN-AIR同样表现突出,平均PSNR达到了31.44dB,比基线PromptIR提升了2.29dB,比最新的DFPIR也高出不少,特别是在去模糊和去雨任务上分别提升了2.36dB和1.85dB。
表2:五种退化任务上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在所有基准上平均取得了新的SOTA性能。最佳表现已加粗显示。
表2:五种退化任务上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在所有基准上平均取得了新的SOTA性能。最佳表现已加粗显示。
有意思的是,MGN-AIR在去噪任务上的提升幅度相对温和,论文里也做了解释:噪声是一种对全局和局部信息都造成严重干扰的退化,对整张图的每个像素几乎“无差别攻击”,所以像素级引导的优势反而没那么大。这也从侧面说明了一个道理:像素级恢复并非万能药,它最适合的场景是“退化分布不均匀”的场合——而这恰恰是绝大多数真实场景的常态。
表3:三种退化任务上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在所有基准上平均取得了新的SOTA性能。
表3:三种退化任务上的SOTA方法比较。PSNR(dB,↑)和SSIM(↑)在完整RGB图像上报告。本文方法在所有基准上平均取得了新的SOTA性能。
此外作者还做了消融实验(表4),验证了视觉提示、文本提示以及像素级恢复策略各自的有效性。去掉任何一个组件,性能都有不同程度的下降,说明三个模块是“一个都不能少”的铁三角关系。在计算量对比(表5)中,MGN-AIR的参数量和FLOPs也控制在合理范围内,并非靠堆算力取胜。
表4:多模态引导块设计的消融研究。报告PSNR(dB,↑)和SSIM(↑)。
表4:多模态引导块设计的消融研究。报告PSNR(dB,↑)和SSIM(↑)。
表5:计算成本比较。
表5:计算成本比较。

局限与展望:像素级恢复的下一步

当然,MGN-AIR也不是没有短板。从实验结果来看,它对均匀噪声的去除效果提升相对有限。这也好理解——当每个像素都“无一幸免”地被噪声污染时,“看哪里”这个问题的答案就失去了区分度,视觉提示能提供的信息量自然就变少了。另外,训练时需要用到退化图和干净图的逐像素差异作为监督信号,这意味着在真实场景中采集训练数据时会比较“挑剔”——如果只有退化图而没有对应的干净图,VPGM就没办法显式监督了。
另外,虽然计算量不算离谱,但窗口大小为32的傅里叶域自注意力加上8×8的空间注意力模块,在移动端设备上的实时推理还是会有些压力。作为一篇发在ACM Multimedia 2026上的论文,MGN-AIR更像是在方法论上给大家开了一扇窗,而非直接给你一个能装进手机里的“成品”。后续如果能结合蒸馏、剪枝这些轻量化技术,把它塞进SoC里,那才是真正的“落地生花”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?小米团队提出MGN-AIR,通过视觉提示生成、多模态引导与像素级恢复三大模块,让模型逐像素自适应决定修复方式。在CDD11混合退化基准上平均PSNR超越最新方法1.51dB,多项全合一恢复任务刷新SOTA。
这篇工作最值得看的点是什么?在CDD11混合退化基准上平均PSNR达到30.56dB,比现有最优方法MoCE-IR提升1.51dB;在五退化任务上平均PSNR达到31.44dB,比DFPIR提升0.80dB;在三退化任务上平均PSNR达到34.61dB,比DFPIR提升0.67dB。
这篇工作的边界或风险在哪里?优点:提出像素级恢复策略,能有效处理非均匀退化;多模态引导机制结合全局和局部信息;在多个基准上取得最优性能。缺点:在纯去噪任务上性能略低于现有方法;计算复杂度较高;视觉提示生成依赖退化图像与清晰图像的差异,限制了实际应用场景。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出MGN-AIR框架,通过视觉提示生成模块估计像素级退化图,并结合文本提示生成像素级恢复矩阵,实现细粒度的全合一图像恢复。

实验合理度:★★★★☆

PSNR、SSIM

学术研究价值:★★★★☆

提出MGN-AIR框架,通过视觉提示生成模块估计像素级退化图,并结合文本提示生成像素级恢复矩阵,实现细粒度的全合一图像恢复;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

34.33M参数,215.19G FLOPs,推理延迟63.25ms

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:在纯去噪任务上性能略低于现有方法;计算复杂度较高;视觉提示生成依赖退化图像与清晰图像的差异,限制了实际应用场景。

融会贯通

把MGN-AIR放到一个更大的坐标系里来看,它的价值会更明显。结合PaperDaily已收录的论文可以观察到,全合一图像恢复正沿着“从粗到细”的路线演进:早期的AirNet尝试用对比学习区分不同退化,PromptIR引入可学习的视觉提示来提供任务级引导,DA-CLIP借助CLIP的多模态表征做全局控制,而MGN-AIR进一步把控制粒度从“图级”下沉到“像素级”。这个趋势跟自然语言处理里从“序列级情感分类”走向“词级(token-level)精细建模”的发展路径其实是异曲同工的。
不过也要提醒各位读者,虽然MGN-AIR在CDD11上比MoCE-IR提升1.51dB,但不同论文的实验设置、训练数据划分、退化参数选择可能存在差异,直接横向对比不同论文中的绝对数值时需要谨慎。比如某些方法在训练时用了额外的数据增强或知识蒸馏策略,而另一些没有。CDD11数据集虽然是目前混合退化常用的基准,但各方法在具体超参数调优程度上也未必完全公平。因此,更稳妥的解读是:MGN-AIR在同一基准、同一实验条件下,确实做到了全面领先,但“1.51dB”这个数字本身并不等于在所有真实场景下都能复现。
从工程落地的角度看,这项工作的思路对移动端影像系统也有启发:与其在手机里塞十几个针对不同场景的专用修复模型,不如训练一个“感知全局、精修局部”的统一模型。VPGM本质上是在做“退化感知”,PLRM则类似“动态算子选择”,这两个模块配合起来,可以看作一种“可微分”的AutoML——只是搜索空间从网络结构换成了像素级的恢复策略。

主要参考文献

[1] Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng. Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance. arXiv preprint arXiv:2608.09482v1, 2026.
[2] Boyun Li, Xiao Liu, Peng Hu, et al. All-in-one image restoration network (AirNet). In ECCV, 2022.
[3] Vaishnav Potlapalli, Syed Waqas Zamir, Salman Khan, et al. PromptIR: Prompting for all-in-one image restoration. In NeurIPS, 2023.
[4] Syed Waqas Zamir, Aditya Arora, Salman Khan, et al. Restormer: Efficient transformer for high-resolution image restoration. In CVPR, 2022.
[5] Yutong Xie, Jianhong Han, et al. DA-CLIP: Degradation-aware CLIP for all-in-one image restoration. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
图像修复别再一刀切,像素级引导才是解😎。想跟龙哥一起读论文、聊AI、探讨更多多模态修复新思路?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。