SSR(Semantic-center guided State space model for image Restoration)整体采用层次化的U型编码器-解码器结构。输入退化图像I_in,先用一个3×3卷积提取浅层特征,随后进入三级对称编码器-解码器网络,每级由多个S³M块堆叠而成。编码器与解码器之间通过跳跃连接融合多尺度特征,最后用一个3×3卷积输出残差R。最终恢复图像由如下公式得到:也就是说,网络学习的不是直接从无到有生成干净图,而是学习一个“残差图”,加到输入上即可得到恢复结果。这种设计降低了学习难度,也是Restormer等主流恢复框架的标准做法。图2:本文提出的语义中心引导状态空间模型(SSR)整体架构。模型采用层次化U形编码器-解码器结构,捕获多尺度特征以完成统一天气恢复。骨干由多个S³M块组成,其中集成了超像素引导选择性扫描机制(S³M)和区域级门控机制(RGM),沿通道维度对退化异常值进行调制。跳跃连接将编码器特征与上采样后的解码器特征融合。每个S³M块内部,采用“空间混合器+通道前馈网络”的经典结构,类似于Transformer块中把自注意力替换为SSM:其中LN表示层归一化,FFN是前馈网络,X'是经过S³M空间混合后的中间特征。这里的核心就在S³M模块:它由“超像素引导扫描”和“区域级门控”两个组件协同构成。前者决定空间维度上“按什么顺序传播”,后者在通道维度上“调整每个区域的响应强度”。图3:S³M块结构。(a)通过集成S³M和前馈网络(FFN)实现结构感知的特征变换。(b)S³M融合了两个协同创新:超像素引导扫描将状态传播限制在感知一致的区域内,防止从语义冲突区域学习非判别性特征;区域级门控沿通道维度对每个语义单元内的退化异常值进行调制。
[1] Zamir S W, Arora A, Khan S, et al. Restormer: Efficient transformer for high-resolution image restoration[C]. CVPR 2022.[2] Li B, Liu X, Hu P, et al. All-in-one image restoration for unknown corruption[C]. CVPR 2022.[3] Gu A, Dao T. Mamba: Linear-time sequence modeling with selective state spaces[C]. COLM 2024.[4] Chen H, et al. MambaIRv2: When Mamba meets image restoration[C]. CVPR 2025.[5] Ouyang J, et al. Histoformer: Histogram-based transformer for image restoration[C]. ECCV 2024.[6] 论文原文:Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM. arXiv:2608.01760.[7] 开源代码:https://github.com/LIDAYU-DayuLi/SSR