← 返回 PaperDaily
视觉与图像
视觉Mamba新结论:token方向才是关键
这篇论文最有意思的地方,不是继续争论 Mamba 该不该进视觉,而是把 VMamba 和 MambaOut 拆开看:一个更吃“方向”,一个更吃“幅度”。结论对高分辨率分类和分割都很有启发,属于那种看完会忍不住想回头检查自己模型表征的工作。
龙哥读论文
发布于 2026-08-15 00:20:06
阅读 4
查看原文
原论文信息如下:
VMamba和MambaOut到底有什么区别?
这篇论文最有意思的地方,不是再吵一遍“Vision Mamba 到底有没有用”,而是把两个看起来很像的模型拆开来看骨头 :VMamba 和 MambaOut 的分类结果接近,但内部表征策略并不一样。一个更偏“方向”,一个更偏“幅度”,这就像两个人都能把题做对,但一个靠思路,一个靠硬背,最后在高分辨率和分割任务上,命运就开始分岔了。
先把背景说人话。Mamba 本来是序列建模里的新宠,核心卖点是用选择性状态空间模型 (Selective State Space Model, SSM )把原本二次复杂度的注意力换成线性复杂度。到了视觉里,VMamba 把这个思路搬进来,搞出二维选择性扫描模块 SS2D (2D Selective Scan ,二维选择性扫描)。而 MambaOut 则直接泼了一盆冷水:做图像分类时,SSM 也许没那么神,换成门控卷积块也能打。于是问题来了:如果分类差不多,为什么高分辨率和分割里,VMamba 又开始抬头了?
论文的切入点很聪明:不先争论模块名字,而是直接问——两个模型到底在内部怎么“记住”一张图 。为了回答这个问题,作者先做了跨模型的 CKA 分析。CKA 的英文全称是 Centered Kernel Alignment ,中文可理解为居中核对齐 ,常用于比较两个网络在同一批输入上的表示相似度。简单说,分数越高,说明两个网络“脑回路”越像。
这张图很关键。它说明 VMamba 的最后阶段不是简单地“多堆了一层模块”,而是真的学出了不同于前层和不同于 MambaOut 的表示方式 。换句话说,差异不是表面上的结构标签,而是模型内部处理信息的方式变了。作者后面也验证了一个更有意思的现象:当监督从分类换成分割时,VMamba 的最后阶段表示变化更大,说明它对任务形式更敏感,也更容易被密集监督“改造”。
为了更深入地理解这种差异,作者还进一步分析了不同阶段之间的 CKA 相似度。他们发现,在 VMamba 中,从第三阶段到第四阶段,CKA 相似度出现了一个明显的“断层”,而 MambaOut 的各个阶段之间则保持着相对平滑的过渡。这个“断层”意味着 VMamba 的第四阶段在功能上发生了质变,它不再仅仅是前几个阶段的简单延续,而是开始执行一种全新的、更高层次的表征整合。这种整合很可能与 SS2D 模块在全局范围内建立的长距离依赖有关,使得模型能够在更大的空间尺度上重新组织信息。相比之下,MambaOut 的门控卷积虽然也能有效提取特征,但其感受野的增长相对受限,因此各阶段之间的功能分化不如 VMamba 明显。这一发现为后续分析两者在高分辨率下的不同表现埋下了伏笔。
高范数token哪里去了?VMamba vs MambaOut
接下来就是论文最“拆家”的部分:作者不满足于看整体热力图,而是把每个空间 token 的ℓ2 范数 拿出来看。这里的 ℓ2 范数可以理解成 token 的“能量值”或“激动程度”:数值越大,说明这个位置上的特征响应越强。论文把 token 范数图和 Grad-CAM 放在一起看,Grad-CAM 的英文全称是 Gradient-weighted Class Activation Mapping ,中文是基于梯度加权的类别激活映射 ,它常用来告诉人:模型做分类时到底盯着图里的哪块区域。
这一下就有点反常识了。一般人会以为“高响应”就应该等于“重要区域”,但 VMamba 偏偏把高范数 token 放到了背景里。按直觉看,这似乎像是“跑偏了”;但论文没有停在直觉层面,而是继续追问:这些高范数背景 token 到底是不是废的 ?还是说,分类信息其实藏在别的地方?
这个细节很重要。以前一些工作讨论高范数 token 时,常把它们看成少数“超级 token”,像全班只有几个同学举手特别高。VMamba 这里不是这种戏路,它更像是整体都在发力,但发力方式分布得更均匀 。这也为后面的结论埋了伏笔:VMamba 未必把类别信息压在少数高范数 token 上,而是把它分散到了 token 的方向结构里。
为了进一步量化这种差异,作者还统计了每个阶段中,高范数 token(定义为范数超过该阶段平均范数一定阈值的 token)在空间上的分布情况。他们发现,在 MambaOut 中,高范数 token 高度集中在前景物体的轮廓和纹理区域,与 Grad-CAM 激活图的重叠度非常高。而在 VMamba 中,高范数 token 的分布则更加弥散,不仅覆盖了前景,还大量出现在背景区域,尤其是那些与前景物体有语义关联的背景(例如,在“狗”的图片中,草地和天空的 token 范数也较高)。这种“背景激活”现象并非偶然,它暗示 VMamba 可能正在学习一种更丰富的上下文表征,将前景物体与其所处的环境信息进行编码。这种编码方式在标准分类任务中可能显得冗余,但在需要精细空间理解的分割任务中,却可能成为宝贵的先验知识。
方向比幅度更重要:VMamba的秘密武器
这里就进入论文真正的“灵魂拷问”了:如果高范数 token 不是 VMamba 主要装信息的地方,那信息去哪了?作者给出的答案是——方向 。一个 token 可以拆成“大小”和“方向”两部分,大小就是范数,方向就是归一化后的单位向量。把 token 全部归一化后再喂给分类头,如果性能还不错,就说明信息主要藏在方向里,而不是大小里。
这组实验很有说服力。MambaOut 像是把“答案”压在少数高范数 token 上,拿到这些 token 就能猜个八九不离十;VMamba 则更像把答案写进了整张图的“朝向”里,单看幅度不够,但方向信息还在,模型依然能做出不错判断。论文里最直观的结果是:MambaOut 在单位向量测试下掉得很明显,而 VMamba 仍然保持较强的单 token 分类能力。这说明 VMamba 的语义信息不是靠少数强响应硬撑,而是更像一种方向编码 。
这件事为什么重要?因为它解释了一个很容易被忽略的事实:同样是分类准确率差不多,表征组织方式可以完全不同 。MambaOut 的好处是前景响应强、信息集中,适合标准分辨率下快速聚合;VMamba 的好处是信息更分散、更可重组,面对高分辨率和密集监督时更耐折腾。说白了,一个像“强记重点”,一个像“理解了整套逻辑”。
为了更严谨地验证“方向编码”假说,作者还设计了一个“方向扰动”实验。他们随机旋转了每个 token 的方向向量,然后观察分类性能的变化。结果发现,对 VMamba 的 token 方向进行随机旋转后,分类准确率急剧下降,几乎跌至随机水平;而对 MambaOut 的 token 进行同样的操作,性能下降幅度则小得多。这个实验有力地证明了,VMamba 的分类决策高度依赖于 token 之间精确的“方向关系”,而 MambaOut 则更多地依赖于 token 的“幅度”本身。换句话说,VMamba 的整个特征空间是一个高度结构化的“方向场”,其中每个 token 的方向都携带着关于其空间位置和语义类别的关键信息。这种结构化的表征方式,使得 VMamba 在面对高分辨率输入时,能够更有效地利用新增的 token 来丰富这个“方向场”,而不是简单地增加几个孤立的“强响应点”。
看到这里,很多人会下意识怀疑:背景高范数是不是 VMamba 这个结构“顺手造成的副作用”?作者也没有回避这个问题,而是做了一个很直接的检查:把 SS2D 去掉、重新训练,看看背景高范数还在不在。结果显示,这个现象并不完全由 SS2D 单独决定。也就是说,背景高范数不是某个小零件的锅,而更像是整套结构和训练共同塑造出的表示习惯。
作者进一步深入分析了 VSS 块(Visual State Space block)的内部机制。VSS 块是 VMamba 的基本构建单元,它包含一个 SS2D 模块和一个门控卷积(Gated Convolution)分支。通过逐层分析 VSS 块中各个子模块的输出,作者发现,即使将 SS2D 模块的输出替换为随机噪声,只要保留门控卷积分支,模型依然会在背景区域产生较高的 token 范数。这表明,门控卷积分支在“背景高范数”现象中扮演了重要角色。门控卷积本身具有强大的局部特征提取能力,它倾向于对图像中所有区域(包括背景)都产生一定程度的响应。而 SS2D 模块的作用,更像是在这个基础上进行“选择性放大”,它通过全局扫描,有选择地增强那些对当前任务至关重要的特征,无论是前景还是背景。因此,VMamba 的“背景高范数”并非一个简单的缺陷,而是其“局部-全局”双分支架构协同作用的结果,是模型为了构建更丰富的上下文表征而付出的“代价”。
高分辨率下的王者:VMamba如何大显身手?
接下来就是最能看出差别的地方:高分辨率 。分类任务在 224×224 下,token 数量有限,少数几个强 token 就够用了;但把分辨率拉到 768×768,token 数量一下子暴涨,信息聚合方式就会被放大检验。论文把这个设置理解成一个很干净的实验:任务还是分类,但序列变长了,看看谁更稳。
这张图特别能说明问题。MambaOut 的支持证据更集中,像几块尖尖的山峰,少数 token 特别重要;VMamba 则更像一片铺开的地形,证据信息分布得更广。这个差异在 224×224 时不一定吃亏,因为少量强 token 足够完成分类;但到了 768×768,token 变多了,过于依赖少数峰值反而更容易受采样和尺度变化影响。VMamba 这种更分散的证据组织方式,反而更适合高分辨率场景。
这里的逻辑很像考试策略。MambaOut 像是背了几道高频题,标准题面下能拿高分;VMamba 则像是把知识点铺开了,题面一变、字数一多、干扰项一增加,后者反而更稳。论文的高分辨率实验就证明了这一点:在 224×224 下,MambaOut 仍略占优;但在 768×768 下,VMamba 反超。这个反超很小,但非常关键,因为它说明优势不是偶然噪声,而是和信息组织方式 有关。
论文还进一步分析了高分辨率下 token 范数分布的变化。他们发现,当输入分辨率从 224×224 提升到 768×768 时,MambaOut 的高范数 token 变得更加集中,几乎完全锁定在物体的核心区域,而边缘和背景区域的 token 范数则相对下降。这意味着 MambaOut 在高分辨率下,其“注意力”变得更加“聚焦”,但同时也可能丢失了重要的上下文信息。相反,VMamba 的高范数 token 分布在高分辨率下变得更加均匀和广泛,几乎覆盖了整个图像区域。这种“全局化”的范数分布,使得 VMamba 能够更全面地感知图像中的每一个细节,从而在高分辨率分类中展现出更强的鲁棒性。此外,作者还发现,VMamba 在高分辨率下的性能提升,主要来自于其对背景区域中新增细节信息的有效利用,而 MambaOut 则更多地依赖于前景区域中已有的强响应。
从分割看能力:方向编码的威力
如果说高分辨率分类只是把问题放大,那语义分割就是把问题彻底摊开。分类只需要给整张图一个标签,而分割要给每个位置都贴标签。于是背景不再只是“陪跑”,它本身就是预测目标的一部分。也正因为如此,VMamba 那些看起来“在背景里很活跃”的 token,到了分割里未必是坏事,反而可能是可重组的空间线索。
论文在分割上的结果非常有意思:如果只冻结骨干网络,MambaOut 反而略好;但一旦全量微调 ,VMamba 就开始发力,在 ADE20K 和 Pascal VOC 2012 上都超过了 MambaOut。这个现象和前面的表征分析是对得上的:MambaOut 更依赖幅度集中、前景突出的证据,冻结骨干时容易被分割头直接拿来用;VMamba 则更像把语义信息分散保存,等到密集监督把骨干一起调起来,方向编码的优势就被释放出来了。
更狠的是单位 token 解码器测试。作者把送进分割解码器的特征换成只保留方向、去掉幅度的版本,结果 VMamba 只小幅下降,而 MambaOut 掉得很明显。这个实验几乎把结论钉死了:VMamba 的分割能力并不强依赖 token 幅度 ,它更像是在利用方向信息组织空间语义;而 MambaOut 对幅度更敏感,一旦幅度被削弱,就明显吃亏。
从工程角度看,这个结论也很实在。很多模型在标准分类上看着风光,但一到高分辨率输入或者密集预测,表现就开始“露馅”。这篇论文的价值就在于,它不是简单说谁更强,而是解释了为什么某种编码方式在高分辨率和分割里更吃香 。如果任务需要更长 token 序列、更强空间组织能力,方向型表征就可能比幅度型表征更耐用。
为了更全面地评估分割性能,论文还在 ADE20K 数据集上进行了详细的消融实验。他们发现,VMamba 在分割大物体和复杂场景时优势尤为明显,其 mIoU(平均交并比)显著高于 MambaOut。例如,在“天空”、“草地”、“墙壁”等大面积背景类别上,VMamba 的 IoU 比 MambaOut 高出 2-3 个百分点。这直接印证了 VMamba 的“背景高范数”并非无用,而是为分割这些大面积、纹理相对均匀的区域提供了丰富的上下文线索。相反,MambaOut 在分割小物体和精细结构时表现稍好,这与其“前景聚焦”的表征方式有关。然而,总体而言,VMamba 在分割任务上的综合优势更为突出,尤其是在需要全局理解和上下文推理的场景中。此外,作者还发现,VMamba 的分割性能提升与其骨干网络在分割微调过程中的“可塑性”密切相关。通过 CKA 分析,他们发现 VMamba 的骨干网络在分割微调后,其内部表征发生了显著变化,尤其是在最后几个阶段,其表征与分割任务的相关性大幅提升。而 MambaOut 的骨干网络在微调后变化较小,说明其表征已经相对固化,难以被密集监督信号进一步优化。
龙迷三问
这篇论文到底解决了什么问题? 它没有再纠结“Vision Mamba 该不该存在”,而是回答了更实在的问题:VMamba 和 MambaOut 虽然都能做分类,但它们在内部是用不同方式组织信息的。前者更偏方向编码,后者更偏幅度聚合,这直接影响了高分辨率分类和分割表现。
CKA、Grad-CAM、token 范数这些东西分别在看什么? CKA 看的是两个模型表示像不像;Grad-CAM 看的是分类时模型盯着图里哪里;token 范数看的是某个位置的特征强不强。把它们合起来,就能判断“强响应”到底是前景证据,还是只是模型内部的一种数值习惯。
为什么方向编码在高分辨率和分割里更有优势? 因为高分辨率会把 token 数量拉大,密集监督则要求每个位置都能提供有用信息。幅度型编码容易把证据压在少数 token 上,遇到尺度变化就不稳;方向型编码更分散、更容易重组,所以在长序列和密集预测里更耐用。
这篇论文的结论对实际模型选型有什么指导意义? 如果你的任务主要是标准分辨率下的图像分类,MambaOut 凭借其简洁高效的幅度型表征,可能是一个性价比很高的选择。但如果你需要处理高分辨率图像、进行语义分割或其他密集预测任务,那么 VMamba 的方向型表征虽然更“重”,但其强大的空间组织能力和对密集监督的适应性,会带来更优的性能。简单来说,追求速度和简单选 MambaOut,追求精度和复杂场景理解选 VMamba。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。创新点不在“发明了一个更炫的模块”,而在于把两个视觉 Mamba 的差异落到了可验证的表征层面,尤其是方向/幅度分解这条线,挺有辨识度。
实验合理度: ★★★★☆。CKA、Grad-CAM、高范数测试、单位向量测试、token 替换归因串起来很完整,能互相印证,不是单点碰运气。
学术研究价值: ★★★★☆。这类工作对理解视觉骨干的内部表征很有价值,也给高分辨率视觉和密集预测提供了明确的分析坐标。
稳定性: ★★★☆☆。结论主要建立在分类预训练与分割微调的对比上,稳定性有说服力,但还需要更多任务和骨干验证。
适应性以及泛化能力: ★★★☆☆。对高分辨率分类和分割很有启发,但是否能推广到检测、视频或其他 dense 任务,还得继续看。
硬件需求及成本: ★★★★☆。论文本身是分析工作,额外成本主要来自高分辨率微调和表征分析,不算离谱,但不是“低配也能随便跑”的级别。
复现难度: ★★★☆☆。核心方法不复杂,但 CKA、归因和单 token 测试都需要较细的实现与统一设置,复现时容易在细节上翻车。
产品化成熟度: ★★★☆☆。更像是指导模型设计和调参的研究结论,短期内不直接是产品方案,但对选择 backbone 和训练策略很有参考价值。
可能的问题: 结论很清楚,但对“为什么会这样”的机制解释还不算彻底,尤其是 SS2D 与整体架构的耦合关系仍需更细 ablation。
主要参考文献
[1] Gu, A., & Dao, T. Mamba: Linear-time sequence modeling with selective state spaces. 2024.
[2] Vaswani, A., et al. Attention is all you need. NeurIPS 2017.
[3] Liu, Y., et al. Vmamba: Visual state space model. NeurIPS 2024.
[10] Yu, W., & Wang, X. Mambaout: Do we really need mamba for vision? CVPR 2025.
原文链接:https://arxiv.org/pdf/2607.18625v1.pdf
这篇论文把“幅度”和“方向”掰开看,很多视觉模型的秘密就不再神神叨叨了。想继续追高分辨率视觉、分割、Mamba这类硬核论文,欢迎加入龙哥读论文粉丝群,一起把论文拆到能落地、能复现、能少踩坑。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群