论文标题:
SAMBA: A Scatter-Guided Masked Bidirectional Mamba Foundation Model for SAR Target Recognition
发表日期:
2026年06月
发表单位:
国防科技大学
原文链接:
https://arxiv.org/pdf/2606.31668v1.pdf
开源代码链接:
https://github.com/mynswkk/SAMBA
项目链接:
无
打破Transformer壁垒:Mamba架构如何拯救高计算量困境?
SAR 图像这类任务最烦人的地方,不是“看不见”,而是“看得见但太贵”。高分辨率 SAR 一旦进到模型里,序列长度立刻膨胀,Transformer 的自注意力就开始疯狂烧算力,显存和延迟一起起飞,最后把工程师逼回原点:模型是能跑,但跑不动。SAMBA 的第一刀,砍的就是这个老毛病。它没有继续把 Transformer 往大里堆,而是改用 Mamba 作为编码器骨架。这里的 Mamba 指的是基于 Selective State Space Model,选择性状态空间模型 的序列建模结构,核心优势很直白:线性复杂度。序列再长,计算也不会像注意力那样按平方爆炸。图2:SAMBA 方法整体框架图。输入 SAR 图像先经过重叠式 patch embedding,再进入双向 Mamba 编码器;中间位置的 class token 负责汇聚全局信息;解码端则用轻量的 SpatialMix 做重建。整套流程的思路很像“把重活交给高效骨架,把细活交给物理先验”。这里还有个很关键的设计:双向 Mamba。普通 Mamba 更像单向读句子,适合语言;但 SAR 图像不是一句话,它是二维场景,目标散射点可能在任意方向形成关联。于是 SAMBA 让序列正向、反向都扫一遍,再把两边信息合并,避免模型只看到“左半边故事”就下结论。图1:光学图像与 SAR 图像的成像原理对比。光学图像看的是颜色和纹理,SAR 看的是电磁波回波;前者像拍照,后者像“听回声”。也正因为这套成像机制不同,SAR 里的强散射点往往比普通像素更像“主角”。为了让读者更直观地理解这里的差别,可以把 Transformer 想成“每个词都要跟全句所有词握手一次”,而 Mamba 更像“按顺序传话”,信息流动更省力。对于高分辨率 SAR 这种动不动就几千个 token 的输入,前者是豪华宴席,后者才是正经干活。SAMBA 选后者,不是省小钱,是直接把大规模预训练的门槛压下来了。
散射引导掩码:让SAR自监督学习告别“盲人摸象”
如果说 Mamba 解决的是“算得太贵”,那 SG-MAE 解决的就是“学得太瞎”。这里的 SG-MAE 是 Scatter-Guided Masked Autoencoder,散射引导掩码自编码器。它的核心思想很简单:SAR 图像里真正有用的信息,不是均匀撒在每个 patch 上的,而是集中在少数强散射点和其周边结构中。既然如此,随机遮一通就太浪费了。图3:不同掩码策略在密集目标 SAR 场景中的对比。左边那种随机掩码看起来很“公平”,实际上把大量背景也一并遮掉了,目标却没被有效逼出来;右边的 SG-MAE 则更偏向强散射区域,逼着模型去学真正有判别力的地方。这套掩码不是拍脑袋定的,而是分成了三层。最外层是区域密度调节:先用滑窗统计局部散射密度,密度高的地方多遮一点,密度低的地方少遮一点。道理很朴素,目标密集区本来就信息多,不多考它几道题,模型很容易偷懒。第二层是多尺度块掩码。普通 MAE 按单个 patch 遮,太容易让模型靠邻域插值蒙混过关。SAMBA 把若干 patch 组成不规则块,一旦块被遮,就整块一起遮。这样一来,模型没法靠“隔壁邻居提示答案”,只能真正去理解散射结构之间的关系。第三层最细,叫散射点对比概率掩码。论文里先做强散射点检测,再根据局部对比度和散射标签动态调整每个 patch 的被遮概率。换句话说,“越重要,越要遮”,因为只有把关键部分藏起来,模型才会认真学而不是走捷径。这部分设计最值得肯定的地方,不是它“更复杂”,而是它真的把 SAR 的物理成像特性拉进了训练目标。很多自监督方法最大的问题不是不够强,而是任务设计和数据本性八字不合。SAMBA 这次算是把“盲人摸象”改成了“摸象前先知道大象在哪儿”。
轻量级SpatialMix:如何在无自注意力下实现高效特征融合?
编码器负责“看懂”,解码器负责“补全”。很多方法在解码器这里又偷偷把自注意力搬回来,结果前面省下来的算力,后面全花掉。SAMBA 的做法更干脆:不用自注意力,直接上 SpatialMix。它本质上是 空间混合模块,用深度可分离的一维卷积做局部交互,再用通道级 MLP 做跨通道融合。这里的逻辑很像修房子:卷积负责把隔壁房间的墙敲开一点,让信息能串起来;MLP 负责把不同房间里的东西重新整理。它不追求“全局都看一眼”,而是追求“足够便宜地把该连的连上”。对 SAR 重建来说,这种设计已经够用了。表1:代表性 SAR 自监督学习方法综述。可以看出,早期方法多是对比学习或手工预文本任务,后来逐渐转向掩码建模。SAMBA 的位置很清楚:它不是简单接着 MAE 往下堆,而是把骨架换成了更适合长序列的 Mamba,再把掩码策略换成更懂 SAR 物理的 SG-MAE。如果把这部分再说得更直白一点:SAMBA 的解码器不是“花里胡哨地重建全部细节”,而是“用更轻的结构把该融合的信息融合好”。这对工程落地很重要。因为真正上线时,大家最怕的从来不是模型名字不够长,而是推理时 CPU、GPU、显存一起哭。
性能超越大模型:27M参数如何实现SOTA?
这篇论文最有意思的地方,是它没有把“更大”当成答案。按照原文的复杂度对比,SAMBA 在参数量和计算代价上都明显更轻,但在多个下游任务上仍然能打出很强的结果。这里的关键不只是“模型小”,而是小模型把资源花在了更该花的地方:编码器用线性复杂度处理长序列,掩码用物理先验聚焦强散射,解码器用轻量融合减少冗余。图4:SAMBA 与六种代表性骨干网络的复杂度和效率对比。图中同时比较了参数量、推理延迟、吞吐量、不同分辨率下的计算开销。这个图的信息量很大,但结论很统一:SAMBA 在高分辨率和大批量场景下更稳,且不会像部分 Transformer 那样很快撞上显存墙。原文里还给了一个很直接的对比:在 5/10/20-shot 分类设置下,不同骨干和预训练策略的效果被系统比较。这里最重要的不是某一个数字“赢了多少”,而是 SAMBA 的优势并不依赖某个单独数据集的偶然性,而是在不同预训练配置下都能保持较强表现。这个特征对基础模型来说很关键,因为基础模型最怕“只在一个地方灵”。表2:不同骨干与预训练策略的参数量和少样本分类精度对比。这里可以看出,SAMBA 并不是靠堆参数硬撑结果,而是在更轻的规模下维持了更强的少样本迁移能力。对 SAR 这种标注稀缺场景来说,少样本性能往往比“训练集上再高一点点”更有现实价值。更值得注意的是,SG-MAE 不是单纯做“更难的遮挡”,而是让遮挡和 SAR 的信息分布对齐。这样训练出来的特征,不容易只记住背景纹理,而更容易抓住目标散射结构。少样本场景里,模型最需要的就是这种“少看废话,多看重点”的能力。
七个数据集全面验证:SAMBA的泛化能力到底有多强?
基础模型最怕什么?不是单点成绩不好,而是“换个数据集就露馅”。SAMBA 这次的验证覆盖了 7 个下游数据集,既有分类,也有检测。这个设计比较像真正的压力测试:不是只在熟悉环境里跑分,而是看它换场景后还能不能站住。表3:三个 SAR 数据集上的少样本分类性能对比。这里的结果说明,SAMBA 在分类任务上具备较强的迁移能力,尤其在样本很少时仍能保持稳定表现。少样本不是“测试集缩水版”,而是对表征质量的硬考核。表4:四个 SAR 数据集上的检测性能对比。检测比分类更难,因为它不仅要认出是什么,还要找出在哪儿。SAMBA 在检测任务上也能维持较强竞争力,说明它学到的不只是“类别标签”,还有更通用的空间结构信息。图5:SIVED 数据集上的检测可视化结果。可视化最能暴露模型是否真的学懂了目标:框得准不准、漏检多不多、背景干扰会不会把模型带偏。SAMBA 的结果说明,它在复杂背景下对目标定位并不虚。这组实验还有一个隐藏信息:SAMBA 的优势不是单靠某一个模块“爆种”,而是架构、掩码和解码器三者一起配合后的结果。Mamba 负责把长序列算得起,SG-MAE 负责把预训练目标定对,SpatialMix 负责把重建做轻。三件事各管一段,少一个都不完整。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底解决了什么问题?它主要解决 SAR 自监督预训练里两个老大难:一是 Transformer 在高分辨率输入下计算太贵,二是随机掩码不懂 SAR 的散射规律,容易把训练重点带偏。SAMBA 用 Mamba 降复杂度,用 SG-MAE 对齐物理先验。
SG-MAE 是什么意思?SG-MAE 是 Scatter-Guided Masked Autoencoder,中文就是“散射引导掩码自编码器”。它不是随便遮图,而是根据 SAR 中强散射点、局部密度和块结构来决定遮哪里、怎么遮。
为什么不用 Transformer 也能做得不错?因为 SAR 的序列很长,Transformer 的自注意力是平方复杂度,越大越贵;Mamba 采用线性复杂度状态空间建模,更适合高分辨率长序列。再加上双向扫描和重叠 patch embedding,信息并没有因为不用注意力就丢掉。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把 Mamba、散射先验和掩码自监督结合起来,思路不算“从零发明宇宙”,但组合得很对路,尤其是 SG-MAE 这一步,确实有 SAR 味道。
[1] https://arxiv.org/pdf/2606.31668v1.pdf[2] https://github.com/mynswkk/SAMBA[3] He et al., Masked Autoencoders Are Scalable Vision Learners, CVPR 2022.[4] Gu and Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, 2023.