← 返回 PaperDaily 视觉与图像

高光谱分类破局者:青岛理工最新MSCM-net,0.2M参数实现94.35%精度

高光谱分类就像拿着“放大镜”找茬:CNN只看得到眼前一亩三分地,Transformer倒是看得远,但算力账单吓人。青岛理工团队把多尺度CNN和Mamba塞进一个框架,0.2M参数直接干到94.35%精度,这波混搭真有东西。

高光谱分类破局者:青岛理工最新MSCM-net,0.2M参数实现94.35%精度
原论文信息如下:
论文标题:
MSCM-net: A hyperspectral image classification method based on multi-scale convolution and Mamba
发表日期:
2026年07月
发表单位:
青岛理工大学(Qingdao University of Technology);南洋理工大学(Nanyang Technological University)
原文链接:
https://arxiv.org/pdf/2607.28277v1.pdf

高光谱分类困局:CNN太“短视”,Transformer太“昂贵”,Mamba能否破局?

高光谱图像(HSI)通过数百个波段捕捉地物的独特光谱“指纹”,在农业、环保、城市规划等领域价值巨大。然而,海量数据对像素级分类提出了挑战:传统机器学习方法(如SVM、RF)难以充分挖掘光谱-空间联合特征,精度受限。
深度学习时代,CNN凭借局部感受野成为主流,但其短板在于难以捕捉长距离依赖——如同用放大镜看图,细节清晰却缺乏全局关联。Transformer的自注意力机制能建模全局关系,但计算复杂度随序列长度呈二次方增长,在数据量巨大的遥感场景中算力成本过高。
在此“既要看得远、又要算得快”的困境中,Mamba架构应运而生。它基于选择性状态空间模型(SSSM),既能捕捉长距离依赖,又保持接近线性的计算复杂度。青岛理工大学与南洋理工大学团队据此提出MSCM-net,融合多尺度卷积与Mamba,在仅0.2M参数下于Indian Pines数据集取得94.35%的总体精度(OA),实现了低成本高性能的分类。
封面
图1:MSCM-net模型的整体架构图

MSCM-net核心拆解:多尺度卷积+SENet如何炼就“精细特征”?

MSCM-net架构包含三部分:多尺度卷积特征提取模块(MCSE)、Mamba特征提取模块和双分支特征聚合模块。流程可概括为:先用多尺度CNN提取局部精细特征,再让Mamba进行长序列建模,最后通过中心+全局双分支聚合完成分类。
预处理阶段,首先使用PCA对原始三维高光谱数据降维,然后以每个像素为中心切取15×15的图像块(边缘零填充),得到C×15×15的样本。模型先通过光谱压缩将波段降至64维,再用3×3卷积初步捕获局部空间信息。
公式1
公式(1):原始高光谱图像的三维表示
核心的MCSE模块采用三支路并行策略:1×1卷积负责通道交互,3×3和5×5深度可分离卷积分别捕捉局部纹理与更大感受野的上下文信息。深度可分离卷积将标准卷积分解为逐通道与逐点两步,大幅降低参数量。三支路输出拼接后得到192维特征。
公式2
公式(2):1×1卷积分支计算
公式3
公式(3):3×3深度可分离卷积的深度卷积部分
公式4
公式(4):3×3深度可分离卷积的逐点卷积部分
拼接后的特征引入SENet通道注意力机制:先通过全局平均池化压缩每个通道为统计量,再经两个全连接层学习权重,并用Sigmoid归一化。最终将学习到的权重与原始特征逐通道相乘,突出关键通道、抑制无关信息。MCSE输出还通过残差连接与初始Conv2d特征合并,形成互补表达。
公式5
公式(5):SENet压缩阶段
公式6
公式(6):SENet激励阶段

Mamba的用武之地:长序列建模如何捕捉光谱-空间远程依赖?

Mamba基于状态空间模型(SSM),其核心创新在于“选择性”机制:模型根据当前输入动态决定保留或丢弃哪些信息,而非一视同仁地处理所有输入。这使其在捕捉长期依赖的同时保持线性计算复杂度。
在MSCM-net中,MCSE输出的13×13空间特征图被展开为169个位置的序列,每个位置对应128维特征向量。原始压缩后的64维特征也经投影至128维,通过残差连接与序列特征融合,并加入可学习位置编码,使Mamba能感知空间位置关系。
公式7
公式(7):空间特征图重排为序列形式
公式8
公式(8):原始特征投影变换
模型使用4个堆叠的Mamba编码器块进行深度序列建模,每块包含选择性状态空间层、层归一化、SiLU激活和残差连接。Mamba的离散化状态空间方程(公式9、10)中,参数Δ、A、B_t、C_t均为输入x_t的函数,实现了动态的状态转移调整。
公式9
公式(9):Mamba状态更新方程
公式10
公式(10):Mamba输出计算方程
在高光谱分类中,Mamba的长期建模能力能建立中心像素与大量邻域像素间的依赖关系,充分利用空间上下文信息,提升分类准确性。

中心+全局双分支聚合:分类精度提升的秘密武器

Mamba输出序列特征后,双分支特征聚合模块被用于生成最终分类结果。该模块的设计动机在于:中心像素通常包含最全面的类别信息,而周围像素提供宝贵的上下文,有助于消除“同物异谱”或“异物同谱”歧义。
第一个分支提取中心特征:从序列中取出中心位置(L/2)的特征向量,经小型全连接网络(FC+ReLU+Dropout)增强判别信息。第二个分支进行全局特征提取:沿序列维度对所有位置特征求平均,获得整个图像块的全局统计特征,有效平滑局部噪声。
公式11
公式(11):计算序列中心位置索引
公式12
公式(12):提取中心位置特征向量
公式13
公式(13):全局平均池化
两条支路的特征通过逐元素相加融合,得到兼顾局部细节与全局上下文的综合表示。该特征随后送入分类MLP,经批归一化、Dropout和ReLU激活后映射到类别空间,输出分类预测。
公式14
公式(14):中心与全局特征融合

实验说话:三个数据集全面验证,参数量仅0.2M

论文在Indian Pines、WHU-Hi-HongHu和Salinas三个公开基准数据集上验证模型。Indian Pines包含145×145像素、200个有效波段和16类地物;WHU-Hi-HongHu规模最大,含940×475像素、270波段和22类;Salinas含512×217像素、224波段和16类,类别分布较均衡。
数据集_IndianPines
图2:(a) Indian Pines数据集信息
数据集_WHUHiHongHu
图2:(b) WHU-Hi-HongHu数据集信息
数据集_Salinas
图2:(c) Salinas数据集信息
训练采用PyTorch框架,NVIDIA GTX 4090 GPU,Adam优化器(学习率1e-3),批次大小64,训练100轮,Mamba块深度4层,图像块大小15×15。对比方法涵盖SVM、3DCNN、SSRN、SSFTT、MASSFormer等,评价指标为OA、AA和Kappa系数。
实验结果表明,MSCM-net在三个数据集上均实现先进性能,且参数量仅约0.2M,相比SSFTT(1.1M)等模型少一个量级。需指出,论文结果来自单次实验报告,具体精度在不同设置下或有波动,但综合指标上MSCM-net优势稳定。消融实验证实了MCSE模块、残差连接和双分支聚合各自的有效性。

总结与启发:CNN+Mamba混合架构的可迁移价值

MSCM-net的核心价值在于用简洁方式解决了高光谱分类中“局部精细”与“全局长远”的矛盾。其设计思路值得借鉴:多尺度卷积与Mamba各司其职,CNN精雕局部,Mamba把控全局;SENet让特征融合更智能;中心+全局双分支聚合以极简方式获得鲁棒特征。
这种CNN+Mamba混合架构对医学图像分割、视频理解等领域同样具有参考价值,验证了“组合现有模型长处”的朴素真理。当然,MSCM-net仍有改进空间,如处理更大范围上下文、采用更复杂的融合方式、探索极少量样本下的性能等。但瑕不掩瑜,它为Mamba在高光谱分类中的应用提供了有竞争力的基线。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Mamba和Transformer的本质区别是什么?Mamba基于状态空间模型,计算复杂度与序列长度线性相关;Transformer基于自注意力,复杂度与序列长度平方成正比。Mamba通过“选择性”机制动态决定信息保留或丢弃,在处理超长序列时更高效。

为什么要用深度可分离卷积,而不是标准卷积?深度可分离卷积将标准卷积拆分为逐通道和逐点两步,在保持效果的同时大幅减少参数量。MSCM-net的MCSE模块中,3×3和5×5分支均采用此设计,是控制总参数量(0.2M)的关键。

SENet在这里起什么作用?可以去掉吗?SENet通过学习通道权重自动增强重要特征、抑制无关特征。消融实验表明去掉SENet后精度下降,它相当于给多尺度融合特征加了一个“智能音量调节器”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

SENet+多尺度CNN+Mamba的组合方式新颖,但组件均为成熟技术,核心创新在于组合与适配设计。

实验合理度:★★★★☆

三个数据集、六种以上对比方法、充分消融实验,评价指标覆盖OA、AA、Kappa,设计较完整。

学术研究价值:★★★★☆

为Mamba在遥感领域的应用提供了简洁有效的基线,对后续研究有参考价值。

稳定性:★★★★☆

模型设计简洁,残差连接和层归一化保证训练稳定,三个数据集上表现稳定。

适应性以及泛化能力:★★★★☆

三个数据集涵盖不同地物和传感器,泛化能力良好,但大规模场景表现待验证。

硬件需求及成本:★★★★★

0.2M参数量,训练100轮收敛,推理开销极低,部署门槛亲民。

复现难度:★★☆☆☆

论文未提供开源代码,但Mamba官方实现公开,模型结构描述清晰,复现难度不大。

产品化成熟度:★★★☆☆

模型体量小、推理快,适合嵌入遥感软件,但需更大规模验证和工程优化。

可能的问题:论文未开源代码,影响可复现性;缺少与最新Mamba变体的比较;Mamba超参数敏感性分析不足;训练样本划分协议未明确说明。


主要参考文献

[1] Gu A, Dao T. Mamba: Linear-time sequence modeling with selective state spaces[J]. arXiv preprint arXiv:2312.00752, 2023.
[2] Hu J, Shen L, Sun G. Squeeze-and-excitation networks[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018: 7132-7141.
[3] Zhong Z, Li J, Luo Z, et al. Spectral-spatial residual network for hyperspectral image classification: A 3-D deep learning framework[J]. IEEE Transactions on Geoscience and Remote Sensing, 2018, 56(2): 847-858.
[4] Sun L, Zhao G, Zheng Y, et al. Spectral-spatial feature tokenization transformer for hyperspectral image classification[J]. IEEE Transactions on Geoscience and Remote Sensing, 2022, 60: 1-14.
[5] 论文原文链接: https://arxiv.org/pdf/2607.28277v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
听说你也想用20万参数吊打百万大模型?先别急着调参,高光谱分类的光谱维和空间维怎么平衡、Mamba序列长度怎么设、多尺度卷积核怎么配,这群里都已经聊出花儿了。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。来这里,一起把遥感分类的细节抠明白~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。