← 返回 PaperDaily
视觉与图像
遥感学会用新模型:边缘清晰度暴涨,分类精度超越SOTA
PolSAR分类一直受困于边缘模糊和各向异性散射建模。现有Mamba方法要么只做空间域,要么固定扫描方向。本文提出DA-Mamba,巧妙结合NSCT多方向分解和方向自适应扫描,在四个数据集上全面超越SOTA。方向感知扫描+双域融合的设计,既保留全局语义又捕捉精细边缘,思路干净实用,值得关注。
龙哥读论文
发布于 2026-08-14 09:11:49
阅读 8
查看原文
原论文信息如下:
PolSAR分类的痛点:空间处理丢失边缘细节
先来聊聊一个很“高大上”但又跟我们生活息息相关的话题——雷达卫星图像分类。
大家或许在天气预报或者地图软件里见过那种黑白或者彩色的卫星云图,但 PolSAR (极化合成孔径雷达 ,Polarimetric Synthetic Aperture Radar)要高级得多。它不只是拍张照片,还能通过发射和接收不同极化的雷达波,获得地物更丰富的散射信息,对全球地表覆盖、农业监测、城市规划甚至灾害评估都至关重要。
最近几年,深度学习确实让PolSAR分类如虎添翼。但细看这些方法,无论是老牌的CNN,还是后来的Transformer,都存在着各自的“先天缺陷”。CNN感受野小,抓不住全局信息;Transformer虽然能看全局,但计算量是二次方的,面对高分辨率雷达图,直接让算力“原地爆炸”。
这时,Mamba 这个新架构带着线性复杂度和强大的全局建模能力出现了,大有“天下英雄,唯使君与操耳”的架势。它基于状态空间模型 (SSM, State Space Model),能用线性的计算量处理长序列,理论上对于PolSAR这种大块头图像是绝配。
可惜,理想很丰满,现实很骨感。现有的Mamba方法在PolSAR上遇到了两个“致命伤”:
第一,只处理空间域,丢失了边缘细节。 纯空间域的Mamba在处理图像时,会把图像压成一维序列。这个过程就像把一张精美的水墨画卷成一个纸卷,随着“卷”的动作,画面中的飞白、纹理、边缘这些精妙的结构信息,全部被搅碎了。对于PolSAR这种依赖精细纹理和边界来区分不同地物(比如农田和建设用地)的场景,这简直是灾难性的。
第二,固定扫描模式,难以应对各向异性散射。 PolSAR地物的散射特征往往具有很强的各向异性 ,也就是在不同方向上的散射特性差异巨大。比如一栋楼的边缘,它在一个方向上的信号急剧变化,而在另一个方向上则相对稳定。传统的Mamba采用的是固定的、机械的扫描路径(比如左右、上下),它无法感知这种方向性变化,导致模型在处理那些方向性很强的边界和结构时,就像用一把直尺去量一个曲曲折折的海岸线,精度自然大打折扣。
这两个问题结合起来,就导致了一个非常直观的后果:分类结果图上,物体的边缘区域经常出现大片大片的误分类,看起来模模糊糊、支离破碎的,好像得了“白内障”。
下面这张图(图1)很直观地展示了这个问题。左边是普通的2D-Mamba,在空间域处理;中间是直接把Mamba用在频率域;右边就是本文提出的方法。可以明显看到,本文的方法在提取边缘和纹理细节上,效果要显著得多。这就像给一个近视眼患者配了一副度数精准的眼镜,世界瞬间清晰了。
双域协同框架:NSCT分解与方向自适应Mamba
那么,这篇名为《Direction-adaptive Mamba: Spatial-Frequency Dual-Domain Collaborative Learning for PolSAR Image Classification》的论文是如何力挽狂澜的呢?
一句话概括:它设计了一个空间-频率双域协同学习框架 ,并配了一个定制的方向自适应Mamba (DA-Mamba)模块。
这就像是给老中医配上了一台能看清人体经络的高清CT机。让我们拆解一下这个神奇的“诊疗方案”——NSCT (非下采样轮廓波变换 ,Non-Subsampled Contourlet Transform)非下采样轮廓波变换。
NSCT就像一个高超的“信号分离器”。它能把原始PolSAR图像(Xori)分解成两个部分:
低频全局分量(Xlf) :可以看作是图像的“骨架”和“大色块”,代表的是场景的整体结构和语义信息,比如一大片森林或一整块湖泊。这些信息比较稳定,受噪声影响小。
多方向高频子带(Xhf(k)) :这部分包含了图像精细的结构信息,比如边缘、纹理和轮廓。关键是,NSCT还能把这些信息按照不同的方向(比如0°、45°、90°等)彻底分开,得到K个方向子带。在本文中,K取8,意味着NSCT将图像中的高频信息,按照8个不同的方向,整整齐齐地陈列好了。
有了这些“分离”好的信号,DA-Mamba-DDCL框架就搭建了一个“多兵种”协同作战体系:
1. 空间域主力部队:散射2D-Mamba 。这个分支直接处理原始的PolSAR数据,利用标准的2D-Mamba模块,从四个方向(前/后/上/下)扫描,捕获全局的、整体的散射特征和上下文依赖关系。这支部队负责把握宏观大局。
2. 频率域侦察兵:低频结构分支 。这个分支处理NSCT分解出的低频分量。通过一个轻量级的卷积模块,它会进一步提炼出稳定、可靠的全局场景结构,抵抗雷达固有的椒盐噪声(斑噪 )的干扰。
3. 频率域特种部队:高频方向分支 。这是本论文最核心的创新点所在。它专门处理NSCT分解出的多方向高频子带,而执行任务的正是我们刚刚提到的——方向自适应Mamba (DA-Mamba)模块。这个模块的核心,就是要去理解和建模所有方向的边缘和纹理信息。
最后,通过一个优雅的门控自适应融合模块 ,这三个分支提取的特征会智能地“拧”在一起。模型会学习为不同空间区域的不同特征通道分配权重,比如在一条道路的边缘,高频方向的纹理特征就会被重点强调;而在一个大型湖泊的中央,低频结构和空间全局特征则会占据上风。这种动态的、自适应的融合,确保了系统在任何复杂场景下都能做出最优判断。
边缘引导+方向感知:精准捕获各向异性散射
现在我们深入到核心——DA-Mamba模块内部,看看它到底是怎么做到“精准捕获”的。这个模块的设计分为两个关键的、环环相扣的步骤。
在将高频子带送入方向自适应Mamba之前,作者先给它们做了一次“预处理”——用原始图像的边缘信息“开小灶”。
具体来说,利用旋转的Sobel算子,从原始PolSAR图像(Xori)中提取出明确的方向性边缘线索(Sobel滤波器 是一种经典的边缘检测算子,通过旋转它,可以检测不同方向的边缘)。然后,将这些边缘信息以一种可学习的方式(通过tanh函数和可学习参数α来调整增益)注入到NSCT分解出的高频子带中。公式可以简化为:
X′hf = Xhf + α · tanh(Sobel(Xori))
这步操作非常巧妙。虽然NSCT已经分解出了高频信息,但它可能还不够纯净和强烈。通过用原始的边缘特征进行“强化”,相当于告诉模型:“看,这些方向的位置有锐利的变化,你们要重点注意这里的纹理结构!”这直接解决了第一个痛点——丢失边缘细节。
这才是真正的“大招”,它由一个二阶段流程构成:方向感知序列化 和方向一致性状态空间建模 。
方向感知序列化 :这是解决“固定扫描模式”问题的关键。
Mamba本质上是一个序列模型,它需要1D的序列作为输入。如何将2D图像变成1D序列,传统方法是按行或按列扫描。这就像看一幅画,只能从上到下或从左到右去理解。
DA-Mamba则不然。它拿着NSCT分解出的第k个高频子带(Xhf(k)),这个子带对应着一个确定的方向θk。然后,它为每一个像素坐标(i, j)计算一个“方向排序分数”:
ζk(i, j) = i cos θk + j sin θk
这个公式意味着什么?很简单,它计算的是每个像素点在方向θk上的投影值。如果θk是水平方向(0°),ζk就是y轴坐标i;如果θk是垂直方向(90°),ζk就是x轴坐标j;如果θk是45°方向,那么ζk就是i和j的加权和。
然后,对所有像素按照ζk值从小到大进行排序。这样一来,原本在θk方向上具有空间邻接关系的像素,在生成的1D序列Sk中,也会被串联在一起!
“顺着纹理的走向去读” 。就像一个画家,在画山川的脉络时,他的笔触一定是顺着地势起伏的。DA-Mamba的序列化就是这个道理,它“读懂”了高频子带的内在方向,并生成了一种“定向序列”。这也就完美解决了第二个痛点——无法建模方向各向异性。
方向一致性状态空间建模 :有了“定向序列”Sk,接下来的工作就清晰多了。将这个序列输入到一个共享的Mamba块(M(·))中进行长距离依赖建模。因为序列已经是“顺理成章”地沿着主方向排列的,Mamba在处理时,上下文信息就能更高效地沿结构方向传递。处理完之后,再通过逆置换操作(Πk-1),将序列恢复成2D的特征图。
最终,通过一个空间选择性融合模块 (SSF),将8个方向子带处理完的特征进行加权融合,提取出最具有区分力的方向性特征。
四数据集验证:全面超越现有方法
口说无凭,实验见真章。作者在四个高难度的真实PolSAR数据集上进行了验证:西安、旧金山、奥伯普法芬霍芬和弗莱福兰。这些数据集代表着不同的地形、气候和地物类型,能很好地检验模型的泛化能力。
对比的方法也都是近年来的SOTA(State-of-the-Art,即最优方法),包括基于GCN的DFGCN、混合复数网络的HybridCVNet、复数注意力Transformer的CV-MsAtViT,以及同样是Mamba架构的S2Mamba等。
在西安数据集(表1)上,DA-Mamba-DDCL的总体精度(OA)达到了97.17% ,把最强的扩散模型方法NGDiffSM(96.99%)都甩在了身后。最关键的是,它在人 们最容易搞错的水体和建筑边缘表现非常出色。
从图4的可视化结果来看,这种优势更加直观。DFGCN和S2Mamba的结果图上充满了散落的椒盐噪声,而HybridCVNet和CV-MsAtViT虽然平滑一些,但边缘区域依然模糊。反观DA-Mamba-DDCL的结果(图4h),无论是大型水体(图中右上部分)还是细长的道路和建筑边界,都保持得非常干净、锐利,几乎还原了真实的地物分布。
在更复杂的奥伯普法芬霍芬数据集(表2)上,DA-Mamba-DDCL的OA达到了95.52% ,比NGDiffSM(95.14%)又高了0.38%。这个提升看似不大,但注意看这一行:农用地(Farmland) 。这类地物分布极其碎片化,散射特性复杂,是公认的难啃骨头。在农用地的分类上,DA-Mamba达到了96.28% ,直接比NGDiffSM(94.34%)提高了接近2个百分点!这说明DA-Mamba在捕捉不规则、复杂地块边界方面,优势非常明显。
在旧金山和弗莱福兰数据集上,所有方法由于数据本身质量较好,绝对精度都很高,但DA-Mamba-DDCL依然保持了全面领先或齐平的水平,比如在弗莱福兰数据集上取得了99.97% 的恐怖OA。
消融实验解析:每个组件都不可或缺
如果说上面的实验证明了DA-Mamba行不行,那消融实验就是揭示了它“为什么行”。作者设计了一组精密的控制变量实验,来检验框架中每个模块的必要性。
基线(仅有原始极化分支 Ori.) :只用标准的2D-Mamba处理原始数据,在西安数据集上OA为93.58%,表现已经不错,但边缘区域问题明显。
+低频+高频 作者先测试了不加入任何增强和方向自适应,直接加入低频和高频分支。OA从93.58%提升到了95.45%,直接证明了双域信息融合的有效性。
去掉方向引导增强 :将Ori-Guided Enhancement(边缘引导增强)去掉,OA直接下降了近0.6个百分点。这说明用原始图像提取的边缘信息去“开小灶”对高频特征的细化是至关重要的。
将方向mamba替换为普通2D-Mamba :这个对比是决定性的一刀。在西安数据集上,把DA-Mamba换成普通2D-Mamba处理高频子带,OA从95.73%掉到了96.39%(最终的完整模型是97.17%)。这赤裸裸地证明了:1) 方向感知的扫描策略确实比固定扫描更适合处理NSCT的高频子带;2) 每个精心设计的组件——双域融合、边缘引导、方向自适应——都是系统工程中不可或缺的一环,缺了一个,整体精度都会受到明显的拖累。
此外,还考察了分解方向数的影响。8个方向 是最佳选择:4个方向信息不够,16个方向会引入冗余噪声。Mamba的状态维度设为32是一个兼顾性能和效率的甜点值。在训练比例实验中,用5%的标签数据效果就几乎饱和,证明了其强大的小样本学习潜力。
龙迷三问
这篇论文主要解决了什么问题? 主要解决了现有PolSAR图像分类方法(主要是Mamba架构)在处理时面临的两个核心问题:一是只关注空间域导致对边缘和纹理等精细结构信息捕捉不足;二是使用固定的扫描路径,无法有效建模PolSAR地物固有的各向异性散射特性,导致边界模糊误分类。论文通过提出方向自适应Mamba和空间-频率双域协同学习框架,显著提升了分类精度和边界清晰度。
文中的NSCT和Sobel算子具体是做什么用的? NSCT(非下采样轮廓波变换)是一种强大的多尺度、多方向图像分析工具。它能够在保留图像所有像素分辨率的同时,将图像分解为一个低频全局分量和多个不同方向的高频子带,从而分离出整体的轮廓信息与不同方向的纹理、边缘细节。Sobel算子是经典的边缘检测算子。文中使用了旋转的Sobel滤波器 ,通过对Sobel算子进行不同角度的旋转,来定向增强NSCT分解出的对应方向的高频子带,以此强化“边缘”信号,方便后续处理。
这个方法有没有明显的局限性? 有。原文在结论中也明确提到,该方法在“少样本”场景下的泛化能力有限,即在只有极少标注数据时,性能下降会比较明显。此外,引入NSCT进行分解和重构会带来额外的计算开销,虽然论文中提到效率不错,但在对实时性要求极高的任务(比如快速灾害监测)中,这部分计算成本是需要被考量的。未来的研究方向应该聚焦于如何结合半监督学习等方法,在标注数据不足时依然保持强大性能。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 将方向自适应的思想引入Mamba架构,并与NSCT多方向分解结合以解决PolSAR边缘建模问题。这个思路新颖,设计干净,属于针对特定问题的优秀工程创新,极大提升了特征提取的方向敏感性。
实验合理度: ★★★★★ 实验设计非常扎实。在四个不同难度的真实数据集上均进行了验证,对比了6个不同时期的SOTA方法,包括GNSSM、Transformer和同类的Mamba方法。消融实验设计缜密,清晰证明了每个组件的贡献。实验结论令人信服。
学术研究价值: ★★★★☆ 为PolSAR遥感图像分类领域,特别是对如何处理各向异性散射和精细边界问题,提供了一种新的有效范式。方向自适应扫描的思路对非欧图像、雷达信号处理等方向都有启发性,具有较高的学术参考价值。
稳定性: ★★★★☆ 方法在四个数据集上均表现稳定,没有出现性能大幅波动或过拟合现象。在复杂的奥伯普法芬霍芬场景下表现尤为出色。相比纯CNN或Transformer方法,其稳定性更强。但小样本场景下性能下降是已知局限。
适应性以及泛化能力: ★★★★☆ 模型设计基于NSCT分解,NSCT是一个通用工具,因此理论上能适应大多数遥感图像分类任务。从测试结果看,在包含城市、农村、水体、森林等多类场景的大型数据集上泛化性良好。但对未知地貌(如月球表面数据)的适应性尚未验证。
硬件需求及成本: ★★★☆☆ 模型结构包含三个分支,其中NSCT变换和8个方向的DA-Mamba会增加内存和计算消耗。虽然论文展示了其工作效率,但相比单一分支的轻量化模型,它的训练和推理成本仍然较高。在实际部署时,需要一块性能不错的GPU。对于资源受限的边缘设备可能不友好。
复现难度: ★★★☆☆ 论文详细描述了方法思想和公式,给了框架图。但典型的深度学习论文的通病是,复现论文中所有细节(比如NSCT的具体参数配置、Sobel滤波器的精确方向角度等)仍需要一定的工程经验。不开源的代码和数据处理流程(如预处理、数据划分)是主要障碍。
产品化成熟度: ★★☆☆☆ 这项研究目前仍处于学术探索阶段。虽然精度很高,但要真正产品落地,还需要解决:1) 对小样本场景的鲁棒性;2) 模型推理效率的优化;3) 边缘设备上的部署适配。目前距离一个开箱即用的遥感图像分类软件还有一定距离。
可能的问题: 对小样本数据的泛化能力较弱,是论文自己明确指出的不足。NSCT分解虽然有效,但也带来了额外的计算复杂度和处理延迟,这在大规模业务化部署中是必须克服的问题。同时,在极低分辨率或严重噪声场景下的表现未在文中展开讨论。
主要参考文献
本文主要参考了以下文献(仅列核心方法): 1. Gu, A., & Dao, T. (2023). Mamba: Linear-time sequence modeling with selective state spaces. (Mamba架构原始论文) 2. da Cunha, A. L., Zhou, J., & Do, M. N. (2006). The nonsubsampled contourlet transform: theory, design, and applications. (NSCT理论) 3. Freeman, A., & Durden, S. L. (1998). A three-component scattering model for polarimetric SAR data. (PolSAR基础知识) 更多对比方法文献请参见原论文参考文献部分。
看完DA-Mamba对地物边缘的精准刻画,是不是也想动手复现一下?🌍 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 PolSAR+西安+西电+小明) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。