先抛个问题给各位:如果让你在一张卫星图上找出“最引人注目”的目标,比如飞机、舰船或者大片建筑群,这事儿你觉得难吗?对人类来说,眼睛一扫就能给出答案。但同样的任务交给AI,问题就多了:目标尺度从十几个像素到几百个像素都有,屋顶、道路、水面在纹理上跟目标傻傻分不清,还有各种遮挡和低对比度场景……这就是光学遥感图像显著目标检测(ORSI-SOD)每天都要面对的现实毒打。
最近,南京大学团队放出一记“组合拳”:把Mamba架构推到遥感显著性检测的前线,提出SPLG-Mamba,全称Structure-Preserving Local-Global Mamba Network,即结构保持的局部-全局Mamba网络。它的思路很有意思——既然浅层特征和深层特征各有所长也各有毛病,那就别一碗水端平:浅层特征用局部窗口建模防止背景纹理乱串,深层特征用全局建模保证目标整体一致,中间再加门控融合控制细节注入。就这么三板斧,直接在ORSSD、EORSSD、ORSI-4199三个公开基准上刷爆榜单,窄目标这类“结构退化重灾区”的F指标直接涨了1.46个百分点。代码已开源,想复现的可以直接开箱。
光学遥感显著检测为何难?结构退化是核心痛点
要理解这篇文章,先得搞清楚ORSI-SOD到底难在哪。显著目标检测(Salient Object Detection, SOD)是让模型自动找出图像中最吸引注意力的物体或区域,比如照片里的人、车、招牌。自然图像里的SOD已经做得很成熟了,但光学遥感图像完全不是一回事:成像视角是从上往下拍,一张图覆盖的范围大、目标数量多且分布密集,同一个场景里目标的大小、朝向、形状能相差十万八千里。更麻烦的是,道路、屋顶、水面这些背景在纹理上和目标高度相似,前景背景的区分度经常一言难尽。
这就引出了论文最核心的痛点:结构退化。所谓结构退化,是指模型虽然大致定位到了目标,但预测结果不完整、不连续——有的地方缺了一块,有的窄条状部分断成几截,有的把背景纹理误判成了前景。论文作者分析,这种退化主要出在层次化特征传播的过程中:浅层特征细节丰富但容易激活背景纹理,深层特征语义明确但容易过度平滑,跨尺度融合缺乏约束又会把不相关的响应搅在一起。这三股力量交织,最终导致预测图“缺胳膊少腿”。
ORSI-SOD的特征处理示意图。上面一行是典型的编码器-解码器流程;下面一行展示了本文在局部-全局Mamba建模之前提出的平滑细节重校准。白色表示正确的目标预测、黑色表示正确的背景、红色表示预测错误。
图1上面一行是典型的编码器-解码器流程,白色是正确的目标预测、黑色是正确的背景,红色是错误。可以看到红色区域往往出现在目标的边缘、细长部位和低对比度区域,这正是结构退化的高发位置。下面一行是论文提出的处理思路:在Mamba建模之前,先把平滑响应和细节残差分开重校准。这就引出了SPLG-Mamba的三步走策略。
SPLG-Mamba:三步走实现结构保持的特征传播
SPLG-Mamba的整体设计逻辑非常清晰,把结构保持这个目标拆成三个阶段,分别对应特征传播的三个关键环节:建模前重校准、建模中分级处理、解码时门控融合。
图2:SPLG-Mamba的框架图。该网络由SwinV2编码器、SDR、局部-全局Mamba、GCSF和预测头组成。
图2展示了完整的框架流程。输入图像经过SwinV2编码器(Swin Transformer V2)提取四层特征金字塔{F₁, F₂, F₃, F₄},由浅到深分辨率递减、语义递增。四层特征先经过SDR重校准,再分别送入局部Mamba或全局Mamba块,最后从最深处的Z₄开始,通过GCSF逐级融合上采样,输出最终显著图。整个流程有一个贯穿始终的目标:让特征在传播过程中既不丢细节,也不被噪声带偏。
第一步:SDR——把特征拆成两半,各取所需
SDR的全称是Smooth-Detail Recalibration,中文可以理解为“平滑-细节重校准”。为什么要做重校准?因为浅层特征里的细节残差既包含有用的边角信息,也混着背景纹理。如果直接把这些残差送入后续建模,背景纹理就会被一路放大;要是强行压掉,窄目标、细结构又会被误伤。所以关键不是粗暴地加或减,而是有选择性地校准。
图3:SDR块的细节。
SDR的处理流程如下:对于第i层编码器特征Fᵢ,先用2×2平均池化加双线性插值得到平滑响应Aᵢ,再用Fᵢ减Aᵢ得到细节残差Rᵢ。Aᵢ保留区域级的整体布局,Rᵢ则突出边界和内部细结构。然后一个由卷积和残差通道注意力组成的学习路径比较Rᵢ和Aᵢ,生成一个修正量加回Fᵢ,得到重校准后的特征F̂ᵢ。因为修正量是残差形式,网络可以自由选择“补细节”还是“压噪声”,同时不会偏离原特征太远。
第二步:Local-Global Mamba——浅层用局部,深层用全局
接下来是论文最核心的模块。Mamba是近期大火的选择性状态空间模型,能以线性复杂度建立长距离依赖,比Transformer的二次方注意力划算得多。VMamba进一步把它扩展到了视觉领域,提出了VSS块(Visual State-Space Block,视觉状态空间块),通过2D选择性扫描在行、列两个方向前后扫描来聚合空间上下文。
图4:局部-全局Mamba示意图。浅层特征在局部窗口内建模,深层特征在完整特征图上建模。
SPLG-Mamba巧妙地利用了“同一个状态空间算子、不同建模范围”这一点:浅层的高分辨率特征(F₁、F₂)包含大量细结构和重复背景模式,如果用全局建模,很容易把不同位置但纹理相近的背景区域串起来,产生虚假的前景响应。所以对浅层特征用局部Mamba:先把特征切成8×8的非重叠窗口,在每个窗口内独立做VSS扫描,再还原窗口位置。而对深层特征(F₃、F₄),分辨率低、语义更抽象,空间范围对维持目标整体性至关重要,于是直接用全局Mamba在完整特征图上建模。
这种“浅层局部、深层全局”的分配,可以理解成一个团队分工:刚入职的新人(浅层)在自己的工位(局部窗口)里干活,不要到处乱窜;经验丰富的老手(深层)负责统筹全局,保证项目(目标)整体不散架。两个Mamba用的是同一个VSS块,只是作用范围不同,并没有额外引入一套复杂结构。这个设计相当克制,也便于工程实现。
第三步:GCSF——门控跨尺度融合,细节注入要“看脸色”
解码阶段同样有个老问题:顶层语义流空间分辨率低,需要从侧边层补充细节。但侧边细节的好坏很大程度上取决于对应层的纹理干扰程度——有些侧边层带来的细节是金子,有些是沙子。GCSF(Gated Cross-Scale Fusion,门控跨尺度融合)的思路就是让网络自己判断“这次注入多少”。
公式1:门控值g的计算。给定上采样后的顶层特征T̃和同层侧边特征L,两者拼接成Q,经1×1卷积和批归一化(BN)后,用Sigmoid函数映射到[0,1]区间。
公式2:融合输出Y的计算。门控值g对候选更新U和上采样语义流T̃做逐元素加权。g接近1的位置多采用候选更新(相信侧边细节),g接近0的位置保留原始语义流(避免被不可靠的浅层细节带偏)。候选更新U也不是简单的卷积输出,而是经过全局通道重加权、通道缩减和空间选择三步提炼。
这里面的U同样是经过通道注意力机制加强过的候选更新,从深到浅经过三级GCSF融合之后,还要再接一个全局Mamba块做最后的精修,再送入预测头。这样的设置保证了细节补充是“有监督、有克制”的,不是一股脑全往上堆。
训练细节:辅助“躯干”监督,让内部结构也被照顾到
结构保持不仅靠网络设计,训练策略也有讲究。论文除了监督最终的显著图S,还额外引入了一个辅助的body输出S_b。这个body分支只在训练时使用,推理时直接去掉。它的监督目标G_b通过对显著性标注做归一化距离变换生成:离物体边界越远的内部像素,在body mask中的权重越大。说白了,就是让模型别只顾着描边,内部区域也要填满、填饱满。
公式3:总体监督损失。最终显著图的mask损失和辅助body的mask损失加权求和,λ_s=1.20,λ_b=0.10。
公式4:mask损失由IoU损失(交并比损失)、Dice损失和SSIM损失(结构相似性损失,Structural Similarity Index Measure)三部分组合。IoU和Dice管前景覆盖范围,SSIM管局部结构一致性。
实验验证:三大基准全面领先,结构属性优势显著
论文在ORSSD、EORSSD、ORSI-4199三个公开数据集上做了完整评测。ORSSD包含600张训练图、200张测试图;EORSSD规模更大一些,1400张训练、600张测试;ORSI-4199有2000张训练、2199张测试,并且额外提供了9种属性标注,包括大目标(BSO,Big Salient Object)、小目标(SSO,Small Salient Object)、窄目标(NSO,Narrow Salient Object)、低对比度场景(LCS,Low-Contrast Scene)等,非常适合做细粒度分析。
表1:ORSSD和EORSSD上的量化对比。红色、绿色、蓝色分别标出第一、第二、第三名;“–”表示未提供结果。
表1给出了ORSSD和EORSSD上与14个近期方法的全面对比。在ORSSD上,SPLG-Mamba在6个指标里拿到5个第一,其中加权F值F_β^w达到0.9290,明显拉开第二名。在EORSSD上同样全面占优,平均绝对误差M降到0.0041,平均F值F_mean达到0.8877。这些指标对应的具体含义包括:M是平均绝对误差(越低越好),S_m是结构相似度(S-measure),F_β^w是加权F值,F_max和F_mean是最大/平均F值,E_max是最大E值。从数值分布可以看出,SPLG-Mamba的优势不是单点爆发,而是整体均衡提升。
图5:ORSSD、EORSSD和ORSI-4199上的精确率-召回率(PR)曲线和F-measure曲线。
图5是三个数据集上的PR曲线和F-measure曲线。可以直观看到,SPLG-Mamba的曲线在整个阈值范围内都保持在高位,这说明优势不是靠某个特定二值化阈值“时来运转”,而是预测响应本身更稳定、更可区分。
表3:具有挑战性的ORSI-4199数据集上的量化对比。红色、绿色、蓝色分别标出第一、第二、第三名。
表3是ORSI-4199上的完整对比。这个数据集最难,也是结构退化最能体现差距的地方。SPLG-Mamba在七个指标里拿六个第一(S_m第二),单项F_w达到0.8791。论文还专门报告了MS-SSIM(Multi-Scale Structural Similarity Index Measure,多尺度结构相似性指标),用于评估跨空间尺度的结构一致性,SPLG-Mamba以0.8677登顶。
图6:ORSI-4199各属性上的MS-SSIM对比。可以看出在窄目标、复杂目标、低对比度场景等“结构退化重灾区”,优势尤为显著。
图6展示的就是MS-SSIM在整体和9个属性上的表现。可以看到,SPLG-Mamba在几乎所有属性上都拿到了最佳,尤其在窄目标(NSO)、复杂目标(CSO)和低对比度场景(LCS)这些最考验结构保持能力的属性上,领先幅度拉得很大。这算是对核心痛点的直接回应。
表2:模型复杂度和推理速度对比。FPS数值受硬件平台影响,仅作参考。
模型复杂度方面,表2对比了参数量、FLOPs和FPS。SPLG-Mamba参数量107.27M,FLOPs 54.67G,在384×384输入下跑到61 FPS。相比IPDiff这种扩散路线(4 FPS),Mamba架构的推理效率优势非常明显。当然FPS的具体数值受硬件平台影响,不同论文间不能直接硬比,但量级差距是清晰的。
消融与可视化:每个组件都不可或缺
好文章要有硬核的消融。表4展示了逐步去除或替换各模块的结果。去掉SDR后,MS-SSIM从0.8677掉到0.8541;把局部+全局改成全部使用全局Mamba或者全部使用局部Mamba,性能都有明显下滑;去掉GCSF,F_w和E_max同样有下跌。每个组件都有存在的价值,没有多余的设计。
表4:ORSI-4199上的消融研究。每列最佳结果用红色标出。
表5则更加细粒度,按ORSI-4199的9个属性对比了三种Mamba配置。可以看到:统一用全局Mamba,在复杂场景(CS)和窄目标(NSO)上明显吃亏;统一用局部Mamba,在大目标(BSO)和复杂目标(CSO)上又不够看;只有“浅层局部、深层全局”的组合在几乎所有属性上都保持第一或并列第一。
表5:局部Mamba和全局Mamba在ORSI-4199各属性上的消融研究。每行最佳结果用红色标出。
可视化部分更直观。图7把SPLG-Mamba和几个对比方法在ORSI-4199上的预测结果放在一起比,红色表示预测错误。在窄长目标、复杂形状、低对比度等困难样本上,SPLG-Mamba的预测图明显更完整、更连续,没有出现“缺胳膊少腿”的情况。
图7:ORSI-4199上的定性对比。红色表示预测错误。
图8进一步打开了SDR的黑盒:上面一行是浅层特征的输入、平滑响应和细节残差,下面一行是深层的。可以清楚看到,平滑响应保留了大区域结构,细节残差集中显示边界和纹理。有了SDR的处理,背景纹理(比如道路、建筑物边缘)的激活被明显压制,而真实目标的细节被保留。
图8:SDR在浅层和深层编码器级别的输入、平滑响应和细节残差。青色表示真实标注边界。平滑和细节对共享同一颜色范围。
图9则展示了局部/全局Mamba输入输出和最终GCSF更新的特征响应。浅层的局部Mamba主要对细节区域做精修,不扩散到无关区域;深层的全局Mamba让目标区域整体更一致;GCSF的更新则补上了边界和内部细结构。
图9:局部Mamba和全局Mamba的特征响应以及最终GCSF更新。青色表示真实标注边界。每对Mamba输入-输出共享颜色范围,GCSF更新单独归一化。
局限与展望:边界模糊与多目标干扰仍是挑战
最后聊聊这篇论文的局限。图10给出了几种典型的失败案例:当多个目标紧紧相邻或相互遮挡时,SPLG-Mamba容易把多个目标粘连成一整块;在极端弱对比度场景下,目标边界仍然不够精确;对于部分不完全可见的目标,预测也会出现边缘抖动。论文作者也提到,这是结构保持类方法普遍面临的边界问题。
图10:具有代表性的失败案例。红色叠加区域表示假阳性和假阴性区域。
展望未来,方向也比较清晰:一是引入更强的边缘或轮廓约束,让边界预测更精细;二是在门控融合里加入目标级甚至实例级的建模线索,帮助分离相邻目标;三是结合遥感图像特有的先验知识,比如地理信息、传感器参数、多时相数据,进一步提升跨场景泛化能力。另外,SPLG-Mamba目前是单帧模型,如果往视频遥感方向扩展,时序一致性会是新的挑战。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?南京大学提出SPLG-Mamba,面向光学遥感图像显著目标检测。
这篇工作最值得看的点是什么?在ORSSD、EORSSD和ORSI-4199三个数据集上均取得最优或次优结果。在ORSSD上6个指标中5个排名第一;在EORSSD上5个指标排名第一;在ORSI-4199上7个指标中6个排名第一。在NSO、ISO和CSO等结构相关属性上全面领先。
这篇工作的边界或风险在哪里?优点:1)首次将局部-全局Mamba建模按特征层级分配,浅层用局部建模、深层用全局建模,设计合理且有效;2)SDR模块在状态空间建模前对平滑响应和细节残差进行重校准,创新性地解决了纹理诱导的背景响应问题;3)GCSF通过门控机制控制跨尺度细节注入,有效平衡了语义一致性和细节保留;4)在三个基准数据集上均取得SOTA结果,消融实验充分验证了各组件贡献。缺点:1)模型参数量较大(107.27M),相比轻量级方法(如RAMENet的5.18M)不够高效;2)在SSO属性上优势不明显,All-local变体在S_m和MS-SSIM上略优;3)对与相邻人造结构外观相似的显著目标边界仍存在预测溢出问题。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
提出SPLG-Mamba网络,通过平滑-细节重校准(SDR)、层级感知的局部-全局Mamba和门控跨尺度融合(GCSF)三个协同组件,在状态空间建模前后实现结构保持的特征传播,解决光学遥感图像显著目标检测中的结构退化问题。
实验合理度:★★★★☆
平均绝对误差(M)、S-measure(S_m)、加权F-measure(F_β^w)、最大和平均F-measure(F_β^max和F̄_β)、最大E-measure(E_ξ^max)、MS-SSIM
学术研究价值:★★★★☆
提出SPLG-Mamba网络,通过平滑-细节重校准(SDR)、层级感知的局部-全局Mamba和门控跨尺度融合(GCSF)三个协同组件,在状态空间建模前后实现结构保持的特征传播,解决光学遥感图像显著目标。
稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本:★★★☆☆
107.27M参数,54.67G FLOPs,在NVIDIA RTX 4090上达到61 FPS(输入尺寸384×384)
复现难度:★★★☆☆
https://github.com/yxu9910/SPLG-Mamba
产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题:;3)GCSF通过门控机制控制跨尺度细节注入,有效平衡了语义一致性和细节保留;4)在三个基准数据集上均取得SOTA结果,消融实验充分验证了各组件贡献。
主要参考文献
[1] Xu Y, Hou R, Ren T, et al. SPLG-Mamba: Structure-Preserving Local-Global Mamba Network for Salient Object Detection in Optical Remote Sensing Images[J]. arXiv preprint arXiv:2608.29626, 2026.
[2] Gu A, Dao T. Mamba: Linear-Time Sequence Modeling with Selective State Spaces[J]. arXiv preprint arXiv:2312.00752, 2023.
[3] Liu Z, et al. VMamba: Visual State Space Model[J]. arXiv preprint arXiv:2401.10166, 2024.
[4] Liu Z, et al. Swin Transformer V2: Scaling Up Capacity and Resolution[C]. CVPR, 2022.
[5] Zhang Q, et al. ORSI-4199: A Challenging Benchmark for Salient Object Detection in Optical Remote Sensing Images[J]. IEEE TGRS, 2023.
项目主页与开源代码:https://github.com/yxu9910/SPLG-Mamba
遥感图像看不懂?显著目标找不全?来龙哥读论文粉丝群,和一群搞算法的小伙伴聊聊Mamba、SOD和遥感解译那些事儿~ 扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),备注格式正确可更快被通过并邀请进群哦!
第一步:SDR——把特征拆成两半,各取所需
第二步:Local-Global Mamba——浅层用局部,深层用全局
第三步:GCSF——门控跨尺度融合,细节注入要“看脸色”
训练细节:辅助“躯干”监督,让内部结构也被照顾到
论文创新性分数:★★★★☆
提出SPLG-Mamba网络,通过平滑-细节重校准(SDR)、层级感知的局部-全局Mamba和门控跨尺度融合(GCSF)三个协同组件,在状态空间建模前后实现结构保持的特征传播,解决光学遥感图像显著目标检测中的结构退化问题。实验合理度:★★★★☆
平均绝对误差(M)、S-measure(S_m)、加权F-measure(F_β^w)、最大和平均F-measure(F_β^max和F̄_β)、最大E-measure(E_ξ^max)、MS-SSIM学术研究价值:★★★★☆
提出SPLG-Mamba网络,通过平滑-细节重校准(SDR)、层级感知的局部-全局Mamba和门控跨尺度融合(GCSF)三个协同组件,在状态空间建模前后实现结构保持的特征传播,解决光学遥感图像显著目标。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
107.27M参数,54.67G FLOPs,在NVIDIA RTX 4090上达到61 FPS(输入尺寸384×384)复现难度:★★★☆☆
https://github.com/yxu9910/SPLG-Mamba产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:;3)GCSF通过门控机制控制跨尺度细节注入,有效平衡了语义一致性和细节保留;4)在三个基准数据集上均取得SOTA结果,消融实验充分验证了各组件贡献。
主要参考文献
遥感图像看不懂?显著目标找不全?来龙哥读论文粉丝群,和一群搞算法的小伙伴聊聊Mamba、SOD和遥感解译那些事儿~ 扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),备注格式正确可更快被通过并邀请进群哦!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!