← 返回 PaperDaily 视觉与图像

Mamba线性复杂度为何在L=196时反被Transformer反超

这篇论文把双时相卫星影像变化检索的“查询成本”算得明明白白——固定CLIP骨干、统一训练策略,系统对比注意力、Mamba、瓶颈压缩三类共八种融合方案,还用10个随机种子做了统计检验。结论很干脆:免训练级联检索能省10-15倍延迟而不损召回,Mamba的理论线性复杂度在L=196时没有带来实际速度优势。做遥感检索或高效多模态融合的朋友,这篇相当解渴。

原论文信息如下:
论文标题:
Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently
发表日期: 2026年7月
发表单位: 蒙特利尔理工学院(Polytechnique Montréal)
原文链接: https://arxiv.org/pdf/2607.28571v1.pdf
开源代码链接: https://github.com/SimonR99/bitemporal-fusion-benchmark
想象这样一个场景:台风刚刚过境,应急管理部门需要在几个小时内,从覆盖数百平方公里的卫星影像存档中找出所有“新建的临时安置房”或者“被冲毁的桥梁”。人工一张张翻是不可能的,唯一靠谱的思路是让AI理解自然语言查询——直接输入一句“找出所有出现新建筑的地方”,让系统把整个卫星存档按照相关度排序。
这类任务在遥感领域有个专门的名字:基于文本的变化检索(text-based change retrieval)。它要把同一地点前后两个时刻拍摄的图像(即“双时相”图像对)与一句话建立匹配关系。理想状态下,用户不需要看任何图片,只需要给出语言描述,系统就能从海量存档中把符合条件的变化位置找出来。
思路虽然清晰,落地却有一个绕不开的工程痛点:每个图像对都需要经过一个“前后时相融合模块”来生成用于匹配文本的视觉表示,而存档里的候选对数量往往是成千上万。融合模块跑得慢,查询成本就居高不下。这篇来自蒙特利尔理工学院(Polytechnique Montréal)的论文,偏偏就要把这个成本问题掰开揉碎讲清楚。

从文本查询卫星影像中的变化:如何高效融合前后时相图像

先看任务定义。给定同一地点、两个不同时刻拍摄的配准图像对 (I₁, I₂),以及一句自然语言描述 T,模型要输出一个匹配分数 S(I₁, I₂, T)。分数越高,说明这对图像越符合这句描述所刻画的“变化”。比如“一座新建筑出现在道路旁”,如果某对图像里恰好出现了这个变化,它就该排在所有候选对的最前面。
当前主流做法依赖视觉-语言预训练模型,典型代表是OpenAI提出的CLIP(Contrastive Language-Image Pretraining,对比语言-图像预训练)。CLIP把图像和文本映射到同一个特征空间,于是“图像”和“描述它的句子”在空间里距离很近。遥感领域有RemoteCLIP等适配版本,但单个图像与文本的匹配只能感知“静态内容”,无法感知“变化”。双时相场景需要在编码器之后加一个融合模块,把“前时相”和“后时相”的特征合成一个整体表示,再拿去跟文本特征算相似度。
这里有一个容易被忽略的部署细节:在真实系统中,昂贵的视觉编码器可以在图像入库时离线跑一次,结果存起来;但融合模块是在查询时刻实时运行的,它对每一个候选图像对都要算一遍。这意味着,融合模块的延迟直接决定了整个检索系统的查询成本。如果存档里有5000个候选对,融合模块每对跑100毫秒,单次查询就要500秒,这对交互式应用来说几乎是灾难。
图1:级联变化检索(LEVIR-CC,G=1929,N=25)。图像帧离线经过CLIP编码;减法过滤器对所有候选对排序,然后TBF对前N个候选重新排名,将每次查询的融合延迟从907毫秒降到89毫秒,同时召回率与全量融合相当或更优。
论文的核心贡献不是提出一个全新的融合架构,而是做了一次严格的、控制变量的对照实验:固定同一个CLIP编码器、固定同一套训练策略,系统比较三类共八种融合设计,每个实验跑10个随机种子并给出统计检验。这种“不追新、只求真”的做法,在遥感+多模态检索这个方向里相当少见。

三大融合家族对决:注意力、Mamba与瓶颈压缩

论文把当前主流融合思路归纳为三个家族,另加两个简单基线,一共八种设计。
最简单的是两个基线。减法(Subtraction)直接把前后时相特征逐元素相减,再经过一个线性投影得到最终表示——它只关注差异,几乎没有多少可学习参数(0.35M),单次推理只要0.04毫秒。MLP融合(MLP Fusion)则是把前后特征在通道维度上拼起来,再用一个两层MLP做混合,相当于只做通道层面的信息混合,不处理图像块之间的空间交互。
第一个家族是注意力机制。代表性方案是拼接Transformer(Concatenation Transformer):把前后时相特征在通道方向拼接成 L×2D 的序列,再送入标准Transformer编码器。这个方案最简单直接,但通道翻倍意味着所有线性层和全连接层的计算量大约变成原来的4倍,参数量达到13.05M。另一个方案叫TFF(Transformer Feature Fusion,源自Text-ITSR模型),它用差分特征作为查询,对原始前后时相特征做交叉注意力,参数量是8.02M。
第二个家族是状态空间模型(State Space Model, SSM),具体指Mamba。Mamba以线性时间复杂度处理长序列著称,近年被引入遥感变化检测领域。论文设计了三种Mamba变体:拼接Mamba(Concatenation Mamba)把拼接得到的 L×2D 输入Mamba块;瓶颈Mamba(Bottleneck Mamba)先用压缩MLP把宽度降回D再进Mamba;交织Mamba(Interleaved Mamba)则把前后时相的时间token交错拼接成一个长度为2L的序列。
第三个家族是瓶颈压缩,代表方法是论文提出的时间瓶颈融合(Temporal Bottleneck Fusion,简称TBF)。它的思路来自多模态融合里经典的“先拼接再压缩”(concat-then-reduce):先把前后时相特征拼接成2D宽度,然后通过一个MLP(Linear 2D→D,ReLU,Linear D→D,LayerNorm)压缩回D,再送入标准Transformer编码器做全局交互。
为什么TBF值得关注?因为Transformer的线性层和全连接层计算量随宽度平方增长,TBF把宽度从2D降回D,意味着这部分参数和计算量直接降到原来的四分之一。论文数据证实,TBF参数量5.73M,比拼接Transformer的13.05M少了2.3倍;单次融合延迟0.47毫秒,比拼接Transformer的0.76毫秒快1.6倍。二者都保留了所有图像块之间的全局自注意力,所以理论上语义建模能力没有被削弱。

免训练级联检索:10倍加速且不损召回

既然融合模块是全检索流程的瓶颈,一个最直接的优化思路是:能不能不在所有候选对上跑昂贵的融合?
论文提出了一种免训练的级联检索方案,思想借鉴了信息检索中的经典两阶段排序:第一阶段用一个极廉价的减法模型扫描全部候选对,每对只需要0.04毫秒;第二阶段把得分最高的前N个候选对交给TBF或拼接Transformer做精细重排。整个过程不需要额外训练,直接复用已经训好的模型即可。
在LEVIR-CC数据集上(全测试库1929个候选对),只重排前25个候选时,用TBF做第二阶段的级联检索在R@1(2.33)、R@5(8.91)、R@10(15.17)上全部超过全量融合的TBF(2.06/8.29/14.41),单次查询成本从907毫秒降到89毫秒,加速10.2倍;如果第二阶段换成拼接Transformer,加速比达到15.2倍,召回率同样全面反超。
一个值得注意的细节:级联不仅没掉点,反而稳定涨点。论文给出的解释是“隐式集成效应”——候选对必须同时在差分信号和全融合模型上表现良好,才能进入最终排名。减法预过滤器相当于提前淘汰了那些融合模型容易误判的高分干扰项。这种解释在统计上是站得住脚的:10个随机种子的配对检验中,TBF级联在R@1和R@5上全部10个种子都优于全量融合。
在规模更小的Dubai-CC数据集上(全库150个候选对),级联虽然没能复现增益,但实现了质量持平,同时在N=50时以2.6倍的加速比完成检索。由于第一阶段的减法比第二阶段便宜12-19倍,存档越大,级联检索的收益越明显。

Mamba的线性复杂度为何在L=196时失效

这篇论文里最“反直觉”的实验结果,出现在Mamba家族身上。
理论上,自注意力的计算复杂度是序列长度的平方O(L²),而Mamba的选择性扫描是线性复杂度O(L)。在长序列场景下,Mamba应该碾压注意力。但在这项任务里,图像被切成196个patch(即L=196),Mamba的实测延迟完全不占优:参数量最少的交织Mamba(2.27M)延迟是0.60毫秒,比TBF(0.47毫秒)反而高出28%,甚至只比参数量是自己6倍的拼接Transformer(0.76毫秒)快21%。
原因出在硬件利用效率上。Mamba的选择性扫描本质上是顺序执行的,每一步都受内存带宽限制,很难并行;而自注意力可以完美映射到GPU上的张量核心矩阵乘法,高度并行。换句话说,在ViT常用的patch数量下(L=196),Mamba的理论复杂度优势被硬件适配劣势完全抵消了。
图2a:LEVIR-CC变化查询的Recall@1与融合延迟对比。虚线为Pareto前沿,只有简单基线、TBF和拼接Transformer落在前沿上。
论文还做了序列长度扫描实验,发现Mamba要等到序列长度超过约L=400(差不多是两帧图像)才能反超注意力;到了L=6272的时候,Mamba才真正展现出10倍的速度优势。这说明SSM更适合多时相长序列堆叠场景,而不是单对双时相图像的标准分块大小。
表情包:这个结论有点意思
这个结果对所有想把SSM塞进视觉任务的团队都是一个提醒:理论复杂度的优势必须放到实际硬件和序列长度下检验,否则很容易出现“论文里赢了复杂度、实际部署却输给注意力”的尴尬局面。

瓶颈压缩TBF:2.3倍参数缩减换来0.007精度代价

TBF的价值需要在精度维度上做一次认真审视。
在LEVIR-CC的change-only子集上,TBF的BLEU-1分数是0.648,而拼接Transformer是0.655,差距仅0.007个点。这个数字小到什么程度?论文用Welch检验(n=10)对七组对比做了统计检验,只有TBF与拼接Transformer之间的差异处于“勉强可检测”的边缘——非配对检验p=0.04,按种子配对检验p=0.08,已经不显著了。换言之,TBF用2.3倍的参数缩减和1.6倍的延迟降低,换来的精度损失几乎可以忽略。
为什么压缩几乎不损失精度?一个合理推测是:双时相场景中绝大多数区域并没有发生变化,前后时相特征拼接后存在大量冗余。压缩操作相当于把“没有变化的背景信息”先做一次提炼,保留真正与变化相关的线索。这和多模态融合中注意力瓶颈(Attention Bottleneck)的设计逻辑一脉相承。
但论文也给出了一个非常重要的警示:当瓶颈压缩过于激进时,变化相关的细节会被悄悄丢弃。团队做了一组宽度扫描实验,发现把压缩维度从D=320再往下压,全量测试集的指标可能只是略有波动,但change-only子集的质量会明显恶化。这说明只看“全量平均指标”会被大量无变化样本掩盖问题,评估这类系统必须单独看“真正发生变化”的那些查询。
表1:L=196时各融合机制的效率对比。延迟为单次融合前向传播(batch=1)在RTX 4070上1000次运行的平均值。加粗表示六个可学习模块中的最优值。
表2:全量测试集与change-only子集上的标题相似度指标(10次运行的均值±标准差)。B-1/B-4为BLEU-1/4,MET为METEOR,R-L为ROUGE-L。加粗表示每个数据集和场景下的最优值。

效率与精度的最优平衡点在哪里

综合全部实验结果,论文给出了非常清晰的三条工程结论。
第一,在标准ViT patch数量下,线性复杂度的SSM融合没有带来实际加速。自注意力高度适配GPU并行硬件,应该继续作为默认选项;SSM的真正价值在更长的多时相序列场景。
第二,注意力前的瓶颈压缩(TBF)能以几乎无损的精度换来确定性的效率收益。0.007的变化-only BLEU-1差异在统计上处于可忽略的边缘,而参数减少2.3倍、延迟降低1.6倍是实打实能落地的。
第三,融合模块不必在每一个候选对上运行。减法预过滤器加注意力重排的级联结构,在LEVIR-CC上以10-15倍的查询成本下降换来了召回率的全面提升。这个方案不需要任何额外训练,成本几乎为零,是论文里最值得直接抄走的工程技巧。
表3:全量测试库上针对变化描述查询的严格实例级检索精度(Recall@K,%)(去重为唯一图像对;10次运行均值±标准差)。加粗表示每个数据集下的最优值。
表4:LEVIR-CC上的级联检索结果(变化查询,全库G=1929,10个随机种子的均值±标准差)。单次查询成本为单流融合成本 G×t_sub + N×t_fuse,t值取自表1。
需要提醒的是,严格实例级的Recall@K绝对值并不高,LEVIR-CC上最好的拼接Transformer也只有2.28%的R@1。但如果看语义指标,BLEU-1可达0.655,METEOR为0.323,说明检索返回的结果即便不是严格匹配的那一对,也往往是语义上完全合理的“同类变化”。论文用图2b直观展示了这一现象:检索结果里那些被判错的样本,人工看起来也都像是发生了类似变化的区域。
图2b:TBF的Top-3检索结果。正确配对(绿色)排在第一(上图)和第三(下图),干扰项(棕色)在语义上是合理的。
论文还做了骨干网络稳健性验证,把CLIP换成GeoRSCLIP(遥感专用ViT-B/32骨干)和SigLIP 2(通用ViT-B/16,256像素输入),八种融合模块的相对排名基本不变(Spearman相关系数0.69和0.74)。也就是说,这些结论不是CLIP的特有产物,可以放心作为架构选型的依据。

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

级联检索为什么能保持甚至提升召回率?第一阶段的减法打分虽然粗糙,但它擅长捕捉“差分信号”,能有效排除大量背景高度相似、无明显变化的干扰候选;第二阶段的全融合模型再对幸存者做精细排序。两个阶段互补,相当于形成了隐式集成,所以召回率不降反升。另外减法模型极快(0.04毫秒),扫描全部1929个候选对只增加约77毫秒的开销,但第二阶段的融合调用次数从1929次降到了25次,总成本大幅下降。

TBF的“瓶颈”到底压掉了什么信息?TBF先用一个MLP把拼接后的2D维特征压缩到D维。压掉的主要是前后时相特征中高度冗余的背景信息。由于双时相图像中大部分区域没有变化,这部分冗余对变化检索的贡献极低。但论文也发现,如果压缩维度过小(低于D=320),变化细节会被误伤,所以在具体应用时需要做宽度扫描,找到精度和效率的拐点。

既然Mamba在L=196时没有优势,那它适合什么场景?论文的序列长度扫描实验显示,Mamba约在序列长度超过400时开始追平注意力,在L=6272时能达到约10倍的速度优势。所以它更适合多时相遥感影像堆叠(例如数十个时间步的长序列变化分析)、视频时序建模这类超长序列任务。对于单对双时相图像的标准分块(L=196),还是老老实实用注意力更靠谱。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

论文没有提出全新的融合范式,但把“融合模块效率”这个被忽视的问题做了系统化的严格对照,并给出了TBF和级联检索两个实用结论,定位上属于高价值的工程研究。

实验合理度:★★★★★

固定骨干、固定训练策略、统一超参数、10个随机种子、Welch检验与配对检验齐全,且对硬件延迟做了CUDA同步测量。对比公平性在同类论文中属于标杆水平。

学术研究价值:★★★★☆

关于Mamba在短序列视觉任务中无延迟优势的实测结论,对SSM的适用边界给出了重要参考,提醒研究者不要被理论复杂度误导。TBF的设计思路也可以迁移到其他双流融合任务。

稳定性:★★★☆☆

在LEVIR-CC上TBF与拼接Transformer的差距跨种子基本稳定;但在数据量更小的Dubai-CC上,所有模块的排名被噪声主导,稳定性有所下降,需要更大规模数据验证。

适应性以及泛化能力:★★★★☆

跨两个数据集、三种骨干网络的验证显示相对排名基本稳定,说明结论具备一定的泛化能力。但当前测试集均为RGB光学影像,对雷达、多光谱等数据尚未验证。

硬件需求及成本:★★★★★

训练只需单张RTX 4070,融合模块参数量最低2.27M,TBF单次推理0.47毫秒,级联检索单查询约89毫秒,对部署环境要求极低。

复现难度:★★★★☆

代码和数据集划分已在GitHub开源,训练细节完整。唯一的小门槛是mamba_ssm库的CUDA编译环境配置,需要在Linux+GPU环境下安装。

产品化成熟度:★★★☆☆

TBF和级联检索作为融合模块选型的参考方案已经具备落地条件,但整体检索系统的严格实例级R@1只有2%左右,直接面向用户的自动查询还有距离,建议先以“人工筛选辅助”的形态进入业务流程。

可能的问题:严格Recall@K绝对值低,论文缺少与现有Captioning方法的对比;Dubai-CC数据量过小导致统计功效不足;召回率指标未报告N=25到500之间的完整曲线,工程调优时需要自行补测。


主要参考文献

[1] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]. ICML, 2021.
[2] Gu A, Dao T. Mamba: Linear-time sequence modeling with selective state spaces[J]. arXiv preprint arXiv:2312.00752, 2024.
[3] Liu F, Chen D, Guan Z, et al. RemoteCLIP: A vision language foundation model for remote sensing[J]. IEEE Transactions on Geoscience and Remote Sensing, 2024.
[4] Hoxha G, Angyal O, Demir B. Self-supervised cross-modal text-image time series retrieval in remote sensing[J]. arXiv preprint arXiv:2501.19043, 2025.
[5] Chen H, Song J, Han C, et al. ChangeMamba: Remote sensing change detection with spatiotemporal state space model[J]. IEEE Transactions on Geoscience and Remote Sensing, 2024.
[6] Nagrani A, Yang S, Arnab A, et al. Attention bottlenecks for multimodal fusion[C]. NeurIPS, 2022.
[7] Liu C, Zhao R, Chen H, et al. Remote sensing image change captioning with dual-branch transformers: A new method and a large scale dataset[J]. IEEE Transactions on Geoscience and Remote Sensing, 2022.
[8] Roy S, Bong H M, Beltrame G. Finding change in satellite archives from text: How to combine before-and-after images efficiently[J]. arXiv preprint arXiv:2607.28571, 2026.

融会贯通

结合PaperDaily目前已收录的论文来看,可以观察到:在LEVIR-CC数据集上,本文的BLEU-1为0.655,目前论文库里暂时还没有足够的同基准同设置数值用于直接对比排名。因此本文的0.655只能作为参考基线,不宜外推成“明显领先”的结论。
更值得注意的是,这个数值是在检索导向的数据划分(倾向保留更多变化对)下得到的,与标准的字幕生成式划分不完全一致,直接比对分数可能失真。读者在引用或对比时,务必确认是否使用了相同的数据划分和评估协议。
如果把视野放宽,这篇论文的研究范式其实比具体数字更有借鉴意义:用控制变量的方式拆解“融合模块”的成本结构,把“查询时开销”作为一个一等公民指标来对待。在遥感检索之外,视频理解中的跨帧融合、多模态文档检索中的双流匹配,都可以借鉴同样的评测思路和级联加速骨架。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
卫星翻新装,查询不用忙;级联快十倍,TBF来帮忙。想跟龙哥一起追遥感新paper、聊多模态落地?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 遥感+上海+复旦+小遥),按格式备注,更快被通过并邀请进群~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。