← 返回 PaperDaily
视觉与图像
即插即用提升1.89dB,Mamba类模型秒变自适应
Mamba火了,但在图像恢复领域,它一直有个“单速”的先天不足——所有退化类型都用同一套状态演化节奏,这就像让法拉利和拖拉机跑同一条赛道,肯定出问题。上海交大团队看准了这个痛点,给Mamba注入了“液态大脑”,让模型可以根据图像内容自主选择多个时间尺度来演化。结果很惊艳:全一体化任务平均PSNR达34.23dB,狂甩各种SOTA方法。最关键的是,它是个即插即
龙哥读论文
发布于 2026-08-22 00:20:07
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: Mamba火了,但在图像恢复领域,它一直有个“单速”的先天不足——所有退化类型都用同一套状态演化节奏,这就像让法拉利和拖拉机跑同一条赛道,肯定出问题。上海交大团队看准了这个痛点,给Mamba注入了“液态大脑”,让模型可以根据图像内容自主选择多个时间尺度来演化。结果很惊艳:全一体化任务平均PSNR达34.23dB,狂甩各种SOTA方法。最关键的是,它是个即插即用的模块,随手一换就能让现有模型原地起飞。
原论文信息如下:
Mamba模型遇到"时间尺度困境":如何用一个模型驾驭所有图像退化?
图像恢复这个老问题,这么多年了,大家一直在折腾。从早期的稀疏先验、全变分正则化,到后来的CNN、Transformer,再到最近火得一塌糊涂的Mamba(一种基于状态空间模型SSM的高效长程依赖建模架构),技术路线越来越高级,但核心痛点却始终没变:现实世界的图像退化太杂了——噪点、模糊、雨雾、雪痕、去霾……每一种都有不同的脾气。传统的做法是给每种退化单独训练一个模型,成本高得离谱。于是"全一体化图像恢复"(All-in-one Image Restoration)成了香饽饽:一个模型处理所有退化。但困难在于,模型得同时具备"看清全局结构"和"抠出局部细节"的能力,还要对不同退化类型自动切换策略。
Mamba在图像恢复领域之所以受宠,是因为它用选择性状态空间模型(Selective State Space Model)实现了线性复杂度的长程依赖建模,比Transformer的平方复杂度香多了。但上海交大这篇新论文发现了一个关键缺陷:现有Mamba模型的隐藏状态演化只依赖单一时间尺度(Single Timescale) 。无论图像区域是平滑的、有纹理的,还是被严重遮挡的,所有位置的隐藏状态都按照同一个离散化步长Δ来更新。这就像是给一辆卡车、一辆跑车和一台拖拉机统一配上相同的变速箱,怎么可能都舒服?结果就是:模型要么偏向长程结构恢复(适合去模糊),要么偏向局部细节保持(适合去噪),很难同时兼顾多种退化 。
这还不是最要命的。在面对全一体化恢复时,模型还需要根据输入特征自动调整演化动力学 ,而不是用一个固定的状态转移矩阵去套所有退化。但现有Mamba架构只对输入依赖的B和C矩阵做了自适应,核心的状态转移矩阵A仍然是固定的,这就导致模型在面对不同退化时,无法灵活地改变"记忆长度"和"信息更新速度"。
核心创新:Multi-τ Liquid-Mamba——给状态空间模型装上"多时间尺度的液体大脑"
要解决"单一时间尺度"的困境,最直接的想法就是引入多个时间常数(τ),让模型能同时以快慢不同的速度演化隐藏状态。但问题在于,Mamba的离散化步长Δ是全局统一的,如果简单地增加几个不同的Δ分支,会破坏Mamba原有的高效硬件友好型扫描机制。上海交大团队从液体时间常数网络(Liquid Time-Constant Networks, LTC)中获得了灵感——LTC 提出输入依赖的时间常数来控制微分方程的解速度,但直接将其移植到Mamba会破坏已经学习好的状态转移矩阵结构。
于是论文提出了一种优雅的解耦方案:保留原始Mamba的状态转移矩阵A₀作为共享基座,然后引入一个输入条件的低秩扰动 ,让多个分支各自学习一个偏移量,从而在不改变整体扫描流程的前提下实现多时间尺度演化。
具体来说,Multi-τ Liquid-Mamba 的数学核心是这样的:
其中 A_m(u) = A₀ + T_m(u),T_m(u) 是通过一个低秩分解生成的输入依赖扰动:
每个分支都有自己的时间常数 τ_m,它由输入特征通过一个 Softplus 激活函数预测得到(方程15)。然后,每个分支使用自己独特的状态转移矩阵 A_m 和有效时间步长 Δ·τ_m 进行离散化:
这样一来,不同的分支就可以模拟不同速率的演变:时间常数小(τ小)的分支更新快,适合捕捉边缘和纹理等快速变化;时间常数大(τ大)的分支更新慢,适合保持平滑区域的长程结构 。最后,通过一个轻量级的门控网络,根据输入特征自适应地融合这些分支的输出,得到最终的隐藏状态更新。
整个网络遵循类似 NAFNet 的 U 形设计,但在每个 NAFBlock 中嵌入了 Multi-τ Liquid-Mamba 模块。网络有4个编码阶段、1个瓶颈阶段和4个解码阶段,通道数逐渐增加再对称下降。值得注意的是,模型采用了多输入多输出的跨阶段特征交互机制,进一步增强了不同尺度信息的融合。
无需修改现有架构,即插即用:如何用多分支门控融合实现1.89dB的PSNR提升?
很多新方法虽然效果好,但往往需要改动整个网络架构,导致复现和集成很麻烦。Multi-τ Liquid-Mamba 最大的亮点就是其即插即用(Plug-and-Play)特性 。论文明确指出:Multi-τ Liquid-Mamba 只改变了状态转移的动态过程,完全没有修改原始的选择性扫描(Selective Scan)算子,也没有改变扫描顺序、硬件实现方式。这意味着,你只需要把现有Mamba架构中的Mamba块替换成Multi-τ Liquid-Mamba块,其他部分都不用动,就能立即获得多时间尺度自适应的能力。
论文在Table XIII中展示了这种即插即用的威力:将MambaIRv2中的Mamba块替换为Multi-τ Liquid-Mamba,PSNR平均提升1.89dB!
如果直接把MLMIR(基于NAFNet骨干)和基线NAFNet做对比,提升更加显著。这说明多时间尺度动态机制确实给模型带来了额外的表达能力,而且这种提升是纯粹的架构红利,不需要任何额外的退化识别模块或外部先验。
即插即用的秘密在于:引入的低秩扰动仅增加少量参数,但通过门控融合(方程20-22)实现了多种演化动力学的自适应组合。融合权重 α_m 由输入特征通过 Softmax 归一化得到,意味着对不同退化类型,网络可以自动选择不同的动态分支组合,甚至可以为不同空间位置分配不同的融合权重。这种细粒度的自适应是传统单一分支Mamba完全做不到的。
实验结果揭秘:全一体化设置PSNR达34.23dB,超越所有强基线,泛化能力同样惊艳
论文在多个主流基准上进行了全一体化(All-in-one)实验,对比了任务特定、任务对齐和全一体化的多种方法。Table I展示了核心结果:在PSNR指标上,MLMIR以平均34.23dB的成绩碾压所有方法,比第二名的AllRestore(33.92dB)高出0.31dB,比基线MambaIRv2(32.34dB)高出1.89dB。
在任务对齐(Task-aligned)设置下(即已知退化类型),MLMIR同样表现亮眼。Table II至Table VI分别展示了去雨、去雪、去雾、去模糊、去噪的详细对比,MLMIR在大部分任务上超越了此前的最佳方法。
不仅如此,论文还测试了真实世界图像、未见过的退化类型和未见过的退化严重程度,MLMIR全都表现出了极强的泛化能力。特别地,在混合退化(如雨+霾+噪声)的复杂场景下,MLMIR也能保持稳定的恢复质量(见图9、图10)。
从可视化结果(图3)来看,MLMIR恢复的图像纹理更清晰、轮廓更锐利,在细节丰富区域和低对比度区域都能获得更令人满意的视觉效果。
在消融实验(Table XI)中,论文逐一验证了每个组件的有效性。多时间尺度设计(Multi-τ)是提升最显著的部分,单分支液体时间常数(Single-τ)虽然也有提升,但远不如多分支融合来得彻底。
可以说,MLMIR不仅在全一体化设置下做到了SOTA,还在任务对齐、真实场景、未见退化等场景下展现了优秀的泛化能力,证明了其核心机制的有效性。
深入分析:自适应时间尺度如何根据退化类型和图像区域自主学习?
光看指标还不够,龙哥带大家扒一扒这张图(Fig.13),看看多时间尺度到底是如何自动适应退化类型和图像区域的。
从图13(a)可以看出,不同退化类型下,三个动态分支(M=3)的融合权重分布截然不同。比如,去雾任务(Haze)更依赖第一个分支(权重接近0.5),而第二个分支权重很低;去雨任务(Rain)则三个分支的权重相对均匀。这说明网络确实学会了针对不同退化调用不同的动力学组合。图13(b)进一步展示了空间维度上的自适应:在平滑区域,时间常数τ整体偏大(更新慢),有利于保持长程结构;而在边缘和纹理区域,τ明显变小(更新快),能快速捕获局部细节。更厉害的是,在霾区域(Haze Region),τ值出现极端分化,某个分支的τ极高(超过1.0),可能是为了应对大面积的均匀退化。
论文还通过T-SNE可视化(Fig.12)对比了不同时间尺度设计下学习到的特征分布。无τ设计(基线)、单τ设计和多τ设计中,多τ设计的特征分布在不同退化之间区分度更高、聚类更紧,说明多元化的时间尺度有助于模型更好地区分和适应不同的退化模式。
这些结果强有力地证明了Multi-τ Liquid-Mamba确实实现了退化感知和空间自适应的多时间尺度动态 ,而不是一个简单的黑盒子。其中的机制可以被解释为:通过轻量级的门控网络和低秩扰动,模型隐式地学习了退化类型和空间位置的隐含特征,从而调节各分支的权重和时间常数。
龙迷三问
论文中提到的“液体时间常数网络”(LTC)是什么? LTC(Liquid Time-Constant Network)是由MIT研究人员提出的一种连续时间神经网络,其核心思想是让神经元的时间常数也变成输入依赖的,从而让网络具有更强的动态适应性。Multi-τ Liquid-Mamba借鉴了这个概念,但并不是直接照搬,而是将液体动力学融入了Mamba的状态空间模型中,通过低秩扰动的方式保持了原有结构的完整性。
Multi-τ Liquid-Mamba相比现有Mamba变体(如MambaIRv2)具体改进了什么? MambaIRv2等模型虽然对B和C矩阵做了输入依赖,但核心的状态转移矩阵A仍然是固定的。Multi-τ Liquid-Mamba引入了多个分支,每个分支都有一个输入依赖的低秩扰动加到A上,从而实现了真正的“自适应状态过渡”。此外,通过门控融合实现了分支间的动态选择,这是现有方法所没有的。
论文中提到的“即插即用”具体怎么操作?我需要修改训练代码吗? 完全不需要修改训练流程。你只需要将原有模型中的Mamba块替换为Multi-τ Liquid-Mamba块即可。论文中已经将这种替换应用到MambaIRv2上并展示了效果提升。替换后,模型的输入输出接口、训练损失函数、优化器都不需要改变。但要注意,替换后参数量会略有增加(主要是低秩投影和门控网络的参数),需要适当调整学习率或训练步数。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
从Mamba的局限性出发,引入液态动力学和多时间尺度,思路新颖且有效。虽然不是完全从零起步(有LTC的启发),但在SSM领域的应用是首创,属于重要增量创新。
实验合理度: ★★★★★
在多个benchmark上进行了充分对比,包括全一体化、任务对齐、真实世界、未见退化、混合退化等场景。消融实验也完整,对比了不同τ数量、融合策略等,分析透彻。实验设置非常合理。
学术研究价值: ★★★★✰
为Mamba类模型在图像恢复中的动态适应性提供了新的思路,将连续时间系统与离散SSM结合,对后续研究有启发意义。
稳定性: ★★★★✰
消融实验中各组件在不同设置下都保持正向贡献,未见剧烈波动。但在极端退化组合下表现如何尚未充分验证,略有扣分。
适应性以及泛化能力: ★★★★★
在多种退化类型和未见过的场景下都表现优异,尤其是在真实图像和混合退化上保持高水平,泛化能力很强。
硬件需求及成本: ★★★✰✰
相比原始Mamba增加了多分支计算和低秩投影,参数量和计算量有所增加。论文参数显示FLOPs约为原始Mamba的1.5倍,但仍在可接受范围内。推理速度中等,不适合移动端。
复现难度: ★★★✰✰
论文提供了详细的算法伪代码和公式,但未直接提供开源代码。由于涉及低秩扰动和门控网络的实现细节,复现有一定门槛。但整体难度不算太高,熟悉Mamba的团队应该可以复现。
产品化成熟度: ★★✰✰✰
目前还是纯学术研究,离产品落地有距离。计算量较大、依赖Mamba框架,需要进行模型压缩和量化才能部署到实际产品中。
可能的问题:
论文未讨论分支数M的最优选择,不同任务可能需不同M值。低秩扰动的秩r对性能的影响也未充分实验。增加多分支会导致训练收敛速度变慢,论文缺乏收敛性分析。整体而言是一篇高质量论文,但这些细节可以进一步完善。
主要参考文献
[1] Chen et al., “Learning Adaptive Dynamical Features via Multi-τ Liquid-Mamba for All-in-one Image Restoration,” arXiv:2606.22801, 2026.
[2] Gu & Dao, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces,” 2023.
[3] Hasani et al., “Liquid Time-constant Networks,” AAAI 2021.
[4] Le et al., “MambaIRv2: Improved Selective State Space Model for Image Restoration,” 2025.
[5] Zhang et al., “AllRestore: All-in-one Image Restoration with Composite Scene Embeddings,” 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
还想看更多这种化腐朽为神奇的“开挂”模型拆解吗?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗、AI金融5个群