← 返回 PaperDaily 视觉与图像

ECCV 2026南开新作:像素看不清?超像素来救!7M参数横扫雨雪雾

恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得

ECCV 2026南开新作:像素看不清?超像素来救!7M参数横扫雨雪雾
原论文信息如下:
论文标题:
Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM
发表日期:
2026-08-01

发表单位:
南开大学(深圳福田)国际先进研究院、南开大学计算机学院、北京科技大学、澳门大学

原文链接:
https://arxiv.org/abs/2608.01760

开源代码链接:
https://github.com/LIDAYU-DayuLi/SSR

项目链接:
https://github.com/LIDAYU-DayuLi/SSR

恶劣天气下的图像恢复为何如此困难?

SSR模型在RainDrop数据集上的视觉效果展示图
先给大家看一张动图:左边是布满雨滴的车窗,右边是经过SSR恢复后的清晰画面,连雨滴边缘被遮挡的物体轮廓都“找”回来了。这就是我们今天的主角——来自南开大学等机构的ECCV 2026新作SSR,一项把状态空间模型(SSM)从“像素扫描”升级为“超像素语义扫描”的通用恶劣天气图像恢复方案。它的参数量只有7.05M,却在六个基准数据集上拿下了SOTA。
想象一个场景:暴雨天,自动驾驶汽车的车载摄像头拍到的画面,一半被挡风玻璃上的雨滴糊住,另一半被雨幕折射得严重变形。再切换到一个雪天,安防监控画面里漫天雪花乱飞,行人的轮廓变得断断续续。更麻烦的是,同一个画面里往往同时存在多种降质——背景有雾、前景有雨滴、空中还飘着雪。这种复合降质,在计算机视觉里叫做“恶劣天气图像恢复”,目标很直白:输入一张被雨、雪、雾糟蹋过的图,输出一张干净清晰的图。
这件事难在哪?难在降质在空间上的分布极度不均匀。雨滴是局部的遮挡,雾是全局的浓度覆盖,雪是随机散布的小颗粒。用传统的手写先验去建模(比如暗通道先验),假设条件太理想,真实场景根本扛不住;用深度网络去硬学,早期任务专用模型又只能对付单一降质,下雨的模型拿去去雾就拉了。
于是学界转向了“All-in-one”统一恢复,一个模型吃下所有天气。Transformer架构全局建模能力强,但注意力机制的复杂度随图像尺寸平方增长,跑一张高清图代价很大。状态空间模型(SSM)作为新秀,提供了线性复杂度的长程建模能力,是高效恢复的潜力股。但问题来了:视觉SSM在处理图像时,需要先把2D图像展平成一维序列,再递归传递状态。这个“展平方式”太关键了,直接决定了状态传播的语义质量。
(a) Raster [25] (b) Local Window [13] (c) Hilbert [45] (d) S3M(ours)
扫描机制对比。(a-c)现有预定义扫描策略属于内容不可知的范式,可能从语义冲突区域学到非判别性特征。(d)本文提出的超像素引导选择性扫描机制(S³M)将扫描轨迹限制在感知一致的区域内,有效防止信息泄漏,保证结构感知的状态演化。
现有的SSM扫描轨迹,无论是光栅扫描、局部窗口,还是希尔伯特曲线,都是内容无关的几何路径,完全不看画面里到底是什么。比如光栅扫描沿水平方向逐行扫过,一不留神就把天空、树、地面这些语义完全不同的区域强行接成一段连续序列。SSM的状态传播被这些语义冲突的token干扰,学到的特征自然不够干净。本文的想法非常直接:既然像素排列方式不合理,那就别按像素排队了,把图像按“感知连贯区域”重新组织,让状态在语义一致的“格子”里流动,这就是论文标题说的“Pixel Ignores, Superpixel Sees”。

从像素扫描到语义引导:SSR的核心创新

SSR(Semantic-center guided State space model for image Restoration)整体采用层次化的U型编码器-解码器结构。输入退化图像I_in,先用一个3×3卷积提取浅层特征,随后进入三级对称编码器-解码器网络,每级由多个S³M块堆叠而成。编码器与解码器之间通过跳跃连接融合多尺度特征,最后用一个3×3卷积输出残差R。最终恢复图像由如下公式得到:
I_rec = I_in + R
也就是说,网络学习的不是直接从无到有生成干净图,而是学习一个“残差图”,加到输入上即可得到恢复结果。这种设计降低了学习难度,也是Restormer等主流恢复框架的标准做法。
Fig. 2: SSR整体架构
图2:本文提出的语义中心引导状态空间模型(SSR)整体架构。模型采用层次化U形编码器-解码器结构,捕获多尺度特征以完成统一天气恢复。骨干由多个S³M块组成,其中集成了超像素引导选择性扫描机制(S³M)和区域级门控机制(RGM),沿通道维度对退化异常值进行调制。跳跃连接将编码器特征与上采样后的解码器特征融合。
每个S³M块内部,采用“空间混合器+通道前馈网络”的经典结构,类似于Transformer块中把自注意力替换为SSM:
X' = S3M(LN(X)) + X X_out = FFN(LN(X')) + X'
其中LN表示层归一化,FFN是前馈网络,X'是经过S³M空间混合后的中间特征。这里的核心就在S³M模块:它由“超像素引导扫描”和“区域级门控”两个组件协同构成。前者决定空间维度上“按什么顺序传播”,后者在通道维度上“调整每个区域的响应强度”。
Fig. 3: S3M块结构
图3:S³M块结构。(a)通过集成S³M和前馈网络(FFN)实现结构感知的特征变换。(b)S³M融合了两个协同创新:超像素引导扫描将状态传播限制在感知一致的区域内,防止从语义冲突区域学习非判别性特征;区域级门控沿通道维度对每个语义单元内的退化异常值进行调制。

超像素引导扫描与区域门控:两大关键机制解析


超像素引导的选择性扫描机制

先科普一下“超像素”(Superpixel)这个概念。超像素不是某一种物体,而是图像分割的一种预处理结果——把颜色、纹理等低级特征相似的相邻像素“抱团”,形成一个个感知上连贯的小区域。这就好比把一张照片按内容拆成很多块“拼图”,每块内部的像素高度相似、语义相对统一。超像素常用于分割任务的前处理,SLIC算法就是一种经典实现。
本文用超像素生成器把中间特征图X_mid∈R^(H×W×D)划分为R个感知连贯的区域{S_r},每个像素(i,j)被分配一个区域标签l_ij。扫描时不再依赖固定几何轨迹,而是定义一个排列算符P_l,把属于同一个超像素的空间token重排为连续序列,然后在重排后的序列上执行SSM状态传播:
超像素引导扫描公式
处理后,再通过逆排列把序列还原为原始空间排布。这样一来,SSM的状态沿着语义边界流动,不会穿越物体边界把不同区域的退化信息混在一起。直观地说,SSM从“沿着一条线乱走”变成了“在语义圈子里散步”,学到的特征自然更干净。
超像素的数量K是影响该机制的关键超参数。论文用K=8、K=16、K=32做了对比,结果很直观:K=8时区域太大,把不同语义的东西混在一起;K=32时区域太碎,把一个完整物体切成好多块;K=16刚好能提供最连贯、最统一的语义表示。
(a) Input (b) K=8 (c) K=16 (d) K=32
图6:不同K值下图像划分的可视化。K=8导致区域过大、语义混杂,K=32则导致区域碎片化。K=16能提供最连续、最连贯的语义表示。

区域级门控机制(RGM)

超像素扫描解决了“跨区域串扰”,但同一个超像素区域内部也可能存在退化不均衡,比如雨滴和干净的背景被划到了同一个区域。为此,论文提出了区域级门控机制(Region-level Gating Mechanism, RGM),对每个区域做通道维度的“自适应校准”。
对每个感知区域S_r,先在通道维度上计算区域均值μ_r和方差σ_r²:
区域统计量计算公式
这两个统计量拼接后,经过一个轻量级MLP(两层全连接+非线性激活),为区域生成一个通道级门控因子g_r∈R^C。然后对区域内每个token做如下调制:
门控公式 状态更新公式
其中σ是Sigmoid函数,⊙表示逐元素乘,h是SSM的隐藏状态。门控因子经过Sigmoid后相当于给每个通道一个0到1的“闸门”:对退化严重的通道压低响应,对干净通道保持甚至放大响应,实现区域内退化异常值的抑制。这个设计思路类似于SENet的通道注意力,但它是“区域级”的,与超像素划分紧密结合,让SSM的输入序列在送入状态更新之前先经过一次“区域化清洗”。
Fig. 4: RGM机制示意图
图4:区域级门控机制(RGM)示意。(a)输入特征X_mid及超像素标签将空间域划分为感知一致的区域。(b)RGM计算区域统计量(μ_r, σ_r²),并使用轻量级MLP生成自适应门控因子g_r进行通道调制。(c)门控后的特征可视化X~。

损失函数:L1 + 结构相关性约束

训练时,本文使用了L1损失保证像素级保真度:
L1损失公式
同时引入了一个序列级Pearson相关损失,把恢复图和真值图展平成一维序列后,计算两者的线性相关程度:
这个损失能鼓励网络在特征层面保持与清晰图像的结构一致性,而不是只追求逐像素接近,从而减少过度平滑和几何失真。总损失是两者直接相加:
总损失公式

实验结果:以7.05M参数超越SOTA

先看训练设置。模型在单张NVIDIA A40 GPU上训练了30万次迭代,训练集由三部分组成:Snow100K的9000张合成雪天图、Raindrop的1069张真实雨滴图、Outdoor-Rain的9000张合成雨天图。输入patch大小采用渐进式策略,从128逐步增大,优化器为AdamW,初始学习率3×10⁻⁴,采用余弦退火调度。这种设置基本是图像恢复任务的标准配置,没有搞特殊。
在定量对比上,SSR与Restormer、AWRCP、Histoformer、MambaIRv2、EVSSM、CPLPromptIR等近年的强模型同台竞技,结果如下:
Table 1: 恶劣天气恢复定量对比
表1:恶劣天气恢复的定量对比。加粗为最佳,下划线为次佳。在Outdoor(雨+雾复合降质)上,SSR达到33.22dB,比第二名的CPLPromptIR(32.16dB)高出了1.06dB,这是一个相当显著的领先。在平均PSNR和SSIM上,SSR也以34.15dB和0.9442锁定第一。
当然,SSR在个别基准上并未拿到最优。比如RainDrop上,Histoformer的PSNR为33.06dB,略高于SSR的32.82dB;Snow100K-S上,两者也几乎打平。这说明在单一局部降质场景中,超像素引导的收益没有在复合降质场景中那么大。但在“平均性能”这个维度上,SSR是最均衡的。
Table 2: Outdoor数据集上的性能与复杂度对比
表2:Outdoor数据集上的性能与复杂度对比。最亮眼的数据在这里:SSR参数量仅7.05M,是表中所有模型里最小的,比CPLPromptIR的36.00M减少了约80.4%,比Restormer的26.12M减少了约73%。FLOPs也控制得很好,54.27G不到Restormer(141G)的一半,比MambaIRv2(76.5G)还低。以前我们总说“SSM比Transformer高效”,但真正把这种高效同时兑现为“参数少+算力低+效果最好”的模型,并不多见。
在视觉效果上,SSR的优势同样直观:
Fig. 5: 视觉对比
图5:SSR与SOTA统一恢复方法的视觉对比。上:雨滴去除;中:联合去雨和去雾;下:去雪。在雨滴去除任务中,SSR能清晰地恢复出被雨滴遮挡的车辆内部结构;在雨雾复合场景中,远处指示牌上的“WAY OUT”文字依然可读;在去雪任务中,SSR在去除雪花的同时没有引入模糊伪影,小物体的边缘保留得很好。
在真实世界数据集上,SSR的表现也相当扎实。由于真实场景没有清晰的参考图,无法使用PSNR/SSIM评估,作者采用了Q-Align多模态无参考指标和NIQE/IL-NIQE无参考指标:
Table 3: 真实数据集对比
表3:真实世界数据集上的定量对比。左:Q-Align评估(越高越好)。右:NIQE和IL-NIQE评估(越低越好)以及参数量对比。四个真实子集上SSR全部取得最佳或持平,同时参数量远小于对照模型。这说明超像素引导的优势并不过度依赖合成数据,在真实退化场景中同样可以泛化。
消融研究方面,论文主要验证了两个问题。一是超像素数量K的选取,实验表明K=16是最佳平衡点,具体数据如下:
Table 4: 超像素数量消融
表4:超像素数量(K)在不同数据集上的消融实验。K=16在大多数基准上取得了最佳或次佳效果,说明区域粒度太粗或太细都不利于语义一致的状态传播。
Table 5: 扫描与门控策略消融
表5:不同扫描与门控策略的综合消融研究。将超像素扫描替换为光栅扫描或局部窗口扫描,性能均有明显下降,这直接证明了“语义引导”对SSM状态传播的价值。单独去掉RGM门控,性能同样受损,说明区域级通道调制是超像素扫描的必要补充。
另外论文还对比了P70级别的推理延迟:
Table 6: 推理延迟对比
表6:代表性Mamba架构与Transformer架构的推理延迟对比。SSR在同等或更优性能下,推理速度相比Restormer有明显优势。

局限性与未来展望

SSR的亮点很突出,但局限也比较清晰。最大的问题在于超像素数量K需要人工设定。K=8和K=32都会导致性能下降,而不同分辨率、不同场景下最优K值很可能不同,这给实际部署带来了一定的调参成本。
其次,超像素生成目前用的是通用算法(论文引用[55]),与SSM的状态传播机制并不是端到端联合优化的。也就是说,“区域怎么划分”是固定的,网络只能在“给定区域划分”的前提下去学特征。如果区域划分本身不够好,后续的状态传播再厉害也受限。一个值得探索的方向是让超像素生成模块参与梯度反传,实现完全端到端的分组学习和扫描学习。
此外,目前的验证场景主要集中在静态图像上,如果扩展到视频恢复,还需要额外引入时序一致性约束,这个方向有潜力但还需要后续工作补上。总的来说,SSR为SSM在图像恢复中的扫描策略提供了一个很有启发性的新思路——让序列的“组织方式”服务于语义,而非让语义屈从于固定的几何路径。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?南开大学等提出SSR,将状态空间模型的像素级扫描升级为超像素语义引导扫描,配合区域级门控校准退化异常值。参数量仅7.05M,却在六个恶劣天气恢复基准上刷新SOTA,平均PSNR达34.15dB,为全天气统一图像恢复提供了高效新范式
这篇工作最值得看的点是什么?在6个基准数据集上达到最优或次优性能,平均PSNR达34.15dB,SSIM达0.9442;在Outdoor数据集上以7.05M参数超越CPLPromptIR 1.06dB,参数量减少80.4%
这篇工作的边界或风险在哪里?优点:(1) 提出超像素引导的扫描机制,有效解决SSM在语义冲突区域学习非判别性特征的问题;(2) 区域级门控机制实现细粒度的退化校准;(3) 参数量仅7.05M,计算效率高。缺点:(1) 实际推理速度略慢于优化良好的Transformer模型;(2) 依赖超像素聚类的准确性,极端天气下可能失效;(3) 动态超像素聚类和区域引导扫描需要频繁的内存置换,增加GPU同步开销。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把SSM的扫描范式从像素级提升到超像素语义级,角度十分新颖。虽然超像素本身不是一个新概念,但把它作为SSM的扫描单位并配合区域门控,在图像恢复领域属于首次,思路值得肯定。

实验合理度:★★★★☆

在6个主流基准上做了充分的对比和消融,包含合成和真实场景、参考和无参考指标、性能和复杂度分析,实验设计较为完整。但部分对比方法(如EVSSM、MambaIRv2)在统一恢复任务上属于跨任务迁移,实际对比公平性还有一定的讨论空间。

学术研究价值:★★★★☆

为SSM在视觉任务中的“扫描策略”提供了语义感知的新范式。这个思路不仅适用于图像恢复,对分割、检测等密集预测任务的SSM架构设计也有参考意义。

稳定性:★★★☆☆

在不同天气场景下整体表现稳定,但对超像素数量K较敏感,K值偏离最优区间时性能有明显下降。在极端复杂场景(如暴雨叠加运动模糊)下的鲁棒性还需要更多验证。

适应性以及泛化能力:★★★★☆

能同时处理雨、雪、雾、雨滴等多种降质,且真实场景表现不错,说明泛化能力较强。目前的方法聚焦于静态图像,视频等时序场景还未涉及。

硬件需求及成本:★★★★☆

7.05M参数、54.27G FLOPs,推理成本远低于Transformer类模型,在车载、安防等边缘设备上有不错的部署潜力。训练仍需要单张A40级GPU,算是中等成本。

复现难度:★★★★☆

代码已在GitHub开源,基于BasicSR框架实现,依赖项清晰(PyTorch、mamba-ssm、einops等),按说明配置环境即可复现。超像素生成部分可能需要额外关注具体实现细节。

产品化成熟度:★★★☆☆

模型体积小、效率高,具备落地基础。但目前还缺少针对车载、监控等具体场景的优化部署方案,比如TensorRT推理、NPU适配等。超像素分割模块也会带来额外的计算开销,在嵌入式平台上的实时性有待实测。

可能的问题:超像素生成与SSM不是端到端联合优化,分组方式固定不变,这限制了上限;K值需要人工调整,自适应能力不足;在纯合成数据上训练的模型迁移到真实极端天气时,性能能保持多少仍需要更多证真。论文偏工程验证,机制分析还可以再深入一些。


主要参考文献

[1] Zamir S W, Arora A, Khan S, et al. Restormer: Efficient transformer for high-resolution image restoration[C]. CVPR 2022.
[2] Li B, Liu X, Hu P, et al. All-in-one image restoration for unknown corruption[C]. CVPR 2022.
[3] Gu A, Dao T. Mamba: Linear-time sequence modeling with selective state spaces[C]. COLM 2024.
[4] Chen H, et al. MambaIRv2: When Mamba meets image restoration[C]. CVPR 2025.
[5] Ouyang J, et al. Histoformer: Histogram-based transformer for image restoration[C]. ECCV 2024.
[6] 论文原文:Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM. arXiv:2608.01760.
[7] 开源代码:https://github.com/LIDAYU-DayuLi/SSR

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
今天的雨雪雾,SSR帮你一键擦净;明天的论文难题,龙哥陪你逐个拆解。想第一时间获取更多图像恢复、大模型与智能体前沿解读?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。