← 返回 PaperDaily 视觉与图像

国防科大SAMBA:散射引导Mamba,7个数据集领跑

SAMBA这篇很对路:它没跟着Transformer继续堆算力,而是直接把SAR的物理散射特性拉进自监督预训练里。结果就是,参数更轻,识别和检测还更稳,属于“懂雷达的人写出来的雷达基础模型”。

国防科大SAMBA:散射引导Mamba,7个数据集领跑
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
SAMBA这篇很对路:它没跟着Transformer继续堆算力,而是直接把SAR的物理散射特性拉进自监督预训练里。结果就是,参数更轻,识别和检测还更稳,属于“懂雷达的人写出来的雷达基础模型”。


原论文信息如下:
论文标题:
SAMBA: A Scatter-Guided Masked Bidirectional Mamba Foundation Model for SAR Target Recognition
发表日期:
2026年06月
发表单位:
国防科技大学
原文链接:
https://arxiv.org/pdf/2606.31668v1.pdf
开源代码链接:
https://github.com/mynswkk/SAMBA
项目链接:

打破Transformer壁垒:Mamba架构如何拯救高计算量困境?

SAR 图像这类任务最烦人的地方,不是“看不见”,而是“看得见但太贵”。高分辨率 SAR 一旦进到模型里,序列长度立刻膨胀,Transformer 的自注意力就开始疯狂烧算力,显存和延迟一起起飞,最后把工程师逼回原点:模型是能跑,但跑不动。
SAMBA 的第一刀,砍的就是这个老毛病。它没有继续把 Transformer 往大里堆,而是改用 Mamba 作为编码器骨架。这里的 Mamba 指的是基于 Selective State Space Model,选择性状态空间模型 的序列建模结构,核心优势很直白:线性复杂度。序列再长,计算也不会像注意力那样按平方爆炸。
图2:SAMBA方法整体框架图
图2:SAMBA 方法整体框架图。输入 SAR 图像先经过重叠式 patch embedding,再进入双向 Mamba 编码器;中间位置的 class token 负责汇聚全局信息;解码端则用轻量的 SpatialMix 做重建。整套流程的思路很像“把重活交给高效骨架,把细活交给物理先验”。
这里还有个很关键的设计:双向 Mamba。普通 Mamba 更像单向读句子,适合语言;但 SAR 图像不是一句话,它是二维场景,目标散射点可能在任意方向形成关联。于是 SAMBA 让序列正向、反向都扫一遍,再把两边信息合并,避免模型只看到“左半边故事”就下结论。
图1:光学图像与SAR图像的成像原理对比
图1:光学图像与 SAR 图像的成像原理对比。光学图像看的是颜色和纹理,SAR 看的是电磁波回波;前者像拍照,后者像“听回声”。也正因为这套成像机制不同,SAR 里的强散射点往往比普通像素更像“主角”。
为了让读者更直观地理解这里的差别,可以把 Transformer 想成“每个词都要跟全句所有词握手一次”,而 Mamba 更像“按顺序传话”,信息流动更省力。对于高分辨率 SAR 这种动不动就几千个 token 的输入,前者是豪华宴席,后者才是正经干活。SAMBA 选后者,不是省小钱,是直接把大规模预训练的门槛压下来了。

散射引导掩码:让SAR自监督学习告别“盲人摸象”

如果说 Mamba 解决的是“算得太贵”,那 SG-MAE 解决的就是“学得太瞎”。这里的 SG-MAE 是 Scatter-Guided Masked Autoencoder,散射引导掩码自编码器。它的核心思想很简单:SAR 图像里真正有用的信息,不是均匀撒在每个 patch 上的,而是集中在少数强散射点和其周边结构中。既然如此,随机遮一通就太浪费了。
图3:不同掩码策略在密集目标SAR场景中的对比
图3:不同掩码策略在密集目标 SAR 场景中的对比。左边那种随机掩码看起来很“公平”,实际上把大量背景也一并遮掉了,目标却没被有效逼出来;右边的 SG-MAE 则更偏向强散射区域,逼着模型去学真正有判别力的地方。
这套掩码不是拍脑袋定的,而是分成了三层。最外层是区域密度调节:先用滑窗统计局部散射密度,密度高的地方多遮一点,密度低的地方少遮一点。道理很朴素,目标密集区本来就信息多,不多考它几道题,模型很容易偷懒。
第二层是多尺度块掩码。普通 MAE 按单个 patch 遮,太容易让模型靠邻域插值蒙混过关。SAMBA 把若干 patch 组成不规则块,一旦块被遮,就整块一起遮。这样一来,模型没法靠“隔壁邻居提示答案”,只能真正去理解散射结构之间的关系。
第三层最细,叫散射点对比概率掩码。论文里先做强散射点检测,再根据局部对比度和散射标签动态调整每个 patch 的被遮概率。换句话说,“越重要,越要遮”,因为只有把关键部分藏起来,模型才会认真学而不是走捷径。
这部分设计最值得肯定的地方,不是它“更复杂”,而是它真的把 SAR 的物理成像特性拉进了训练目标。很多自监督方法最大的问题不是不够强,而是任务设计和数据本性八字不合。SAMBA 这次算是把“盲人摸象”改成了“摸象前先知道大象在哪儿”。

轻量级SpatialMix:如何在无自注意力下实现高效特征融合?

编码器负责“看懂”,解码器负责“补全”。很多方法在解码器这里又偷偷把自注意力搬回来,结果前面省下来的算力,后面全花掉。SAMBA 的做法更干脆:不用自注意力,直接上 SpatialMix。它本质上是 空间混合模块,用深度可分离的一维卷积做局部交互,再用通道级 MLP 做跨通道融合。
这里的逻辑很像修房子:卷积负责把隔壁房间的墙敲开一点,让信息能串起来;MLP 负责把不同房间里的东西重新整理。它不追求“全局都看一眼”,而是追求“足够便宜地把该连的连上”。对 SAR 重建来说,这种设计已经够用了。
表1:代表性SAR自监督学习方法综述
表1:代表性 SAR 自监督学习方法综述。可以看出,早期方法多是对比学习或手工预文本任务,后来逐渐转向掩码建模。SAMBA 的位置很清楚:它不是简单接着 MAE 往下堆,而是把骨架换成了更适合长序列的 Mamba,再把掩码策略换成更懂 SAR 物理的 SG-MAE。
如果把这部分再说得更直白一点:SAMBA 的解码器不是“花里胡哨地重建全部细节”,而是“用更轻的结构把该融合的信息融合好”。这对工程落地很重要。因为真正上线时,大家最怕的从来不是模型名字不够长,而是推理时 CPU、GPU、显存一起哭。

性能超越大模型:27M参数如何实现SOTA?

这篇论文最有意思的地方,是它没有把“更大”当成答案。按照原文的复杂度对比,SAMBA 在参数量和计算代价上都明显更轻,但在多个下游任务上仍然能打出很强的结果。这里的关键不只是“模型小”,而是小模型把资源花在了更该花的地方:编码器用线性复杂度处理长序列,掩码用物理先验聚焦强散射,解码器用轻量融合减少冗余。
图4:SAMBA与六种代表性骨干网络的复杂度和效率对比
图4:SAMBA 与六种代表性骨干网络的复杂度和效率对比。图中同时比较了参数量、推理延迟、吞吐量、不同分辨率下的计算开销。这个图的信息量很大,但结论很统一:SAMBA 在高分辨率和大批量场景下更稳,且不会像部分 Transformer 那样很快撞上显存墙。
原文里还给了一个很直接的对比:在 5/10/20-shot 分类设置下,不同骨干和预训练策略的效果被系统比较。这里最重要的不是某一个数字“赢了多少”,而是 SAMBA 的优势并不依赖某个单独数据集的偶然性,而是在不同预训练配置下都能保持较强表现。这个特征对基础模型来说很关键,因为基础模型最怕“只在一个地方灵”。
表2:不同骨干与预训练策略的参数量和少样本分类精度对比
表2:不同骨干与预训练策略的参数量和少样本分类精度对比。这里可以看出,SAMBA 并不是靠堆参数硬撑结果,而是在更轻的规模下维持了更强的少样本迁移能力。对 SAR 这种标注稀缺场景来说,少样本性能往往比“训练集上再高一点点”更有现实价值。
更值得注意的是,SG-MAE 不是单纯做“更难的遮挡”,而是让遮挡和 SAR 的信息分布对齐。这样训练出来的特征,不容易只记住背景纹理,而更容易抓住目标散射结构。少样本场景里,模型最需要的就是这种“少看废话,多看重点”的能力。

七个数据集全面验证:SAMBA的泛化能力到底有多强?

基础模型最怕什么?不是单点成绩不好,而是“换个数据集就露馅”。SAMBA 这次的验证覆盖了 7 个下游数据集,既有分类,也有检测。这个设计比较像真正的压力测试:不是只在熟悉环境里跑分,而是看它换场景后还能不能站住。
表3:三个SAR数据集上的少样本分类性能对比
表3:三个 SAR 数据集上的少样本分类性能对比。这里的结果说明,SAMBA 在分类任务上具备较强的迁移能力,尤其在样本很少时仍能保持稳定表现。少样本不是“测试集缩水版”,而是对表征质量的硬考核。
表4:四个SAR数据集上的检测性能对比
表4:四个 SAR 数据集上的检测性能对比。检测比分类更难,因为它不仅要认出是什么,还要找出在哪儿。SAMBA 在检测任务上也能维持较强竞争力,说明它学到的不只是“类别标签”,还有更通用的空间结构信息。
图5:SIVED数据集上的检测可视化结果
图5:SIVED 数据集上的检测可视化结果。可视化最能暴露模型是否真的学懂了目标:框得准不准、漏检多不多、背景干扰会不会把模型带偏。SAMBA 的结果说明,它在复杂背景下对目标定位并不虚。
这组实验还有一个隐藏信息:SAMBA 的优势不是单靠某一个模块“爆种”,而是架构、掩码和解码器三者一起配合后的结果。Mamba 负责把长序列算得起,SG-MAE 负责把预训练目标定对,SpatialMix 负责把重建做轻。三件事各管一段,少一个都不完整。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决 SAR 自监督预训练里两个老大难:一是 Transformer 在高分辨率输入下计算太贵,二是随机掩码不懂 SAR 的散射规律,容易把训练重点带偏。SAMBA 用 Mamba 降复杂度,用 SG-MAE 对齐物理先验。

SG-MAE 是什么意思?SG-MAE 是 Scatter-Guided Masked Autoencoder,中文就是“散射引导掩码自编码器”。它不是随便遮图,而是根据 SAR 中强散射点、局部密度和块结构来决定遮哪里、怎么遮。

为什么不用 Transformer 也能做得不错?因为 SAR 的序列很长,Transformer 的自注意力是平方复杂度,越大越贵;Mamba 采用线性复杂度状态空间建模,更适合高分辨率长序列。再加上双向扫描和重叠 patch embedding,信息并没有因为不用注意力就丢掉。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把 Mamba、散射先验和掩码自监督结合起来,思路不算“从零发明宇宙”,但组合得很对路,尤其是 SG-MAE 这一步,确实有 SAR 味道。

实验合理度:★★★★☆

对比了不同骨干、不同预训练策略、不同任务和多个数据集,验证链条比较完整。若能再补充更多跨传感器或跨分辨率设置,会更有说服力。

学术研究价值:★★★★☆

它给 SAR 基础模型提供了一个明确方向:别照搬光学图像套路,先尊重雷达物理。这个判断很有研究价值。

稳定性:★★★☆☆

从结果看是稳的,但双向 Mamba、散射检测和多层掩码叠在一起,工程实现仍有一定复杂度,实际部署前还得看不同传感器上的鲁棒性。

适应性以及泛化能力:★★★★☆

七个数据集的结果说明泛化能力不差,分类和检测都覆盖了,说明它不是只会在一个小圈子里表演。

硬件需求及成本:★★★★☆

相比 Transformer 明显友好,线性复杂度是实打实的优势;但 Mamba 和掩码策略并不等于“零成本”,训练端依然需要较强算力做大规模预训练。

复现难度:★★★☆☆

代码计划开源是加分项,但多层掩码、散射检测和双向 Mamba 的组合,复现时对细节要求不会低,尤其是预训练流程和数据处理。

产品化成熟度:★★★☆☆

适合 SAR 目标识别和检测的研究型场景,离大规模稳定产品化还差一层跨域验证和部署优化,但作为基础模型底座已经很像样。

可能的问题:亮点在于物理先验和高效骨架结合,但对强散射检测质量、跨传感器泛化和真实在线部署的验证还可以更硬一点。


主要参考文献

[1] https://arxiv.org/pdf/2606.31668v1.pdf
[2] https://github.com/mynswkk/SAMBA
[3] He et al., Masked Autoencoders Are Scalable Vision Learners, CVPR 2022.
[4] Gu and Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
雷达、遥感、图像、Agent、机器人都能聊,别让好论文只停在收藏夹里,进群一起把方法掰开揉碎看明白。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。