← 返回 PaperDaily 视觉与图像

多模态检测也能减肥?Qwen2.5-VL当裁判,剪掉70%参数依然能打

多模态目标检测要落地,先把“双分支胖模型”瘦下来。InterPruner首次把结构化剪枝搬到RGB-红外检测上:剪掉一半通道,FLIR精度反而涨0.6%,70%剪枝率下依然稳得住。轻量化的正确姿势,这篇给了一个参考答案。

多模态检测也能减肥?Qwen2.5-VL当裁判,剪掉70%参数依然能打
原论文信息如下:
论文标题:
InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection
发表日期:
2026年08月
发表单位:
北京工业大学、西南大学、中国地质大学(武汉)、清华大学、北京理工大学、云南师范大学、北京林业大学、根特大学
原文链接:
https://arxiv.org/pdf/2608.10724v1.pdf
龙哥导读:多模态目标检测这两年有多火,不用龙哥再多说。RGB加红外这对“黄金搭档”,白天靠纹理、晚上靠温度,无论黑天白夜都能把目标看得明明白白。但代价也很实在——模型胖了一圈,双分支并行提取特征,计算量直接翻倍。这就像每天通勤明明11路公交就能到,非要开一辆双引擎大越野,油表蹭蹭往下掉。剪枝就是给模型“瘦身减脂”,可关键问题是:这肥肉到底该怎么减?剪哪儿才不会伤筋动骨?这篇由北京工业大学、清华大学、根特大学等多家单位联合提出的InterPruner,刚好给了个参考答案。
图1:P4阶段RGB和红外分支在单模态剪枝前后的特征可视化。相比未剪枝基线(上图),对RGB分支进行剪枝(下图)对RGB特征影响很小,但会导致红外分支的特征对齐错乱。
图1:P4阶段RGB和红外分支在单模态剪枝前后的特征可视化。相比未剪枝基线(上图),对RGB分支进行剪枝(下图)对RGB特征影响很小,但会导致红外分支的特征对齐错乱。

多模态检测的“瘦身”难题:为什么现有剪枝方法失效?

先把背景说清楚。多模态目标检测,指的是把可见光(RGB)和红外(Infrared,简称IR)等多种传感器的信息融合起来做检测。RGB图像提供丰富的纹理和语义,红外图像则对光照变化“免疫”,能稳定给出温度线索。两者的结合在自动驾驶、无人机巡检、遥感侦察这些场景里非常实用。但代价同样明显:这类检测器通常使用两条并行的特征提取分支,每条分支都是一个完整的卷积神经网络(CNN)骨干网络,参数量和计算量直接翻倍。
更麻烦的是,两个分支之间存在大量的跨模态冗余:很多通道在RGB里学到的特征,在红外分支里能“找到亲戚”——两边的特征高度相关,留着它们对最后的检测精度贡献甚微,却白白烧着算力。这种冗余在双分支架构里几乎是必然的。要在无人机、车载边缘设备上部署,就必须给模型“瘦身”。
模型压缩里最常用的手段之一是结构化剪枝,简单说就是直接删掉网络里不重要的完整通道(Channel),得到规整且紧凑的模型。但问题来了:现有的剪枝方法几乎都是给单模态CNN设计的,直接搬到RGB-红外双分支结构上,效果会大打折扣。论文里把原因归结为两点。
第一,通道重要性跨模态耦合。两个分支通过特征融合模块互相纠缠,单独看某个通道可能“不重要”,但它在另一个分支中的对应通道可能非常依赖它。图1很直观地展示了这一点:只对RGB分支做剪枝,RGB特征看起来没啥变化,但红外分支的特征对齐却乱了套。
第二,通道重要性随场景动态变化。白天可见光信息丰富,RGB分支更可靠;到了夜间或浓雾天气,红外分支就成了主角。环境一变,冗余分布也跟着变——某个通道在晴天时可能是“废柴”,到了雨天却成了“大腿”。固定的剪枝准则根本跟不上这种变化。
所以这篇论文的核心思路就很明确了:要让剪枝同时考虑跨模态交互和场景动态差异,而不是简单沿用单模态的思路。RGB-红外联合检测器可以形式化地写成下面的公式:
检测器表达式
其中x_rgb和x_ir分别表示已对齐的RGB图像和红外图像,y是检测标注,W是模型权重,M是通道级的二进制掩码,掩码取值0或1代表该通道是否被剪掉。
在此基础上,InterPruner要做的就是在满足剪枝率ρ的前提下,找到一个最优的紧凑掩码,让剪枝后的检测损失尽可能小。这个优化问题里还嵌套了一个“重训最优”的子问题,公式细节不用逐项深究,核心目标就是——在尽量不损害精度的前提下把通道减下来。

三大创新模块:TIC、MIRA与SPCA如何协同工作?

InterPruner的完整流程如图2所示。它由三个模块组成:TIC负责衡量每个通道对检测损失的“真实贡献”,MIRA负责找出跨模态的冗余通道,SPCA则根据图像场景动态调整剪枝决策。三个模块产出的分数融合成最终的统一重要性得分,指导通道排序和剪枝。下面逐个拆解。
图2:InterPruner总览
图2:InterPruner总览。给定RGB和红外骨干网络的多尺度通道,TIC通过损失变化评估每个通道的贡献C_q;MIRA通过交替掩码和补偿性评估暴露跨模态冗余R_q;SPCA利用RGB-IR图像对和提示词从VLM中提取场景语义并生成语义权重w(x);三路线索聚合成S_q用于通道排序和剪枝,最终得到紧凑检测器。
TIC:泰勒展开加隐函数定理,算出通道的真实身价。剪枝的本质是回答一个问题:删掉这个通道后,检测损失会涨多少?最理想的做法是把每个通道都删一遍再重新训练,在大模型上这显然不现实。TIC提供了一种近似估计方法:把剪枝引起的损失变化拆成“立即损失变化”和“重训后损失变化”两部分,再用高阶泰勒展开和隐函数定理(Implicit Function Theorem)推导出重训后损失的解析近似。
这里的数学推导比较长,龙哥直接说结论:TIC把最终通道重要性C_q表示为“立即损失变化”减去“重训恢复效应”的组合,公式为:
TIC准则公式
其中g是损失函数对权重的一阶梯度,H是海森矩阵(二阶导数矩阵),T是三阶导数张量。简单理解:这个公式既考虑了删通道后立刻造成的损失,又考虑了参数重训后损失被“修复”的程度。C_q越小的通道,说明它对最终检测结果越“可有可无”,优先剪掉。
MIRA:交替遮住一个模态,看另一个模态的反应。TIC解决的是“单通道重不重要”的问题,但跨模态冗余没法靠单边判断。MIRA的想法很妙:先把RGB分支整个mask掉,让红外分支独自短适应几步;然后再反过来,把红外分支mask掉,让RGB分支独自适应。如果某个通道在另一个模态消失后“被激活”、贡献突然变大,就说明它原来是被另一个模态“压着”的冗余通道——它的功能可以被对方补偿,剪掉它损失不大。
由于原始的掩码是离散的0/1,没法直接做梯度优化,MIRA引入了可微的连续门控值z_q∈[0,1]来近似“通道开关”。短适应过程用几轮梯度更新来完成:
短适应更新公式
其中η是短适应学习率。经过B步适应后,MIRA计算每个通道方向导数G_q在适应前后的变化幅度,作为冗余度指标R_q:R_q越大,说明这个通道适应性越强、越容易在另一个模态缺席时“救场”,也就越适合被剪掉。
冗余测量公式
R_q的计算本质上衡量的是“通道在单模态环境下的适应能力增量”。一个在缺失对侧模态时表现活跃的通道,说明它编码的信息并非模态专属,冗余度较高。
SPCA:用语言先验给剪枝装上“场景雷达”。前面两个模块都在静态图上做文章,SPCA则是为了让剪枝决策“看天气行事”。它借助冻结的Qwen2.5-VL视觉语言模型,为每个RGB-红外图像对生成结构化的场景描述,内容涵盖光照环境、场景上下文、物体证据和热属性四类信息。这些文本描述再经CLIP文本编码器编码成768维的场景语义向量z_i,最后通过一个轻量级MLP网络映射成每个通道的语义权重w_i,b,取值范围在[1-γ, 1+γ]之间。
简单说,就是让模型“看”一眼当前场景,然后告诉剪枝器:这个场景里RGB通道更重要还是红外通道更重要。夜晚场景下,红外相关通道的冗余惩罚会被调低,从而保留更多温度特征通道;白天场景则相反。这一机制使得剪枝不再是“一刀切”,而是变成“量体裁衣”。
图3:剪枝方法对比
图3展示了SPCA带来的核心差异:已有方法在不同光照条件下表现脆弱且次优,而SPCA能根据场景上下文自适应调整剪枝决策。
最后,三个模块的输出统一成一个重要性分数:C_q代表贡献度(越高越该保留),R_q代表冗余度(越高越该剪掉),w是场景权重(调节冗余惩罚的强弱),最终的通道排序公式为:
统一重要性分数公式
其中α和β是固定权重,C和R均做了归一化。按这个分数升序排序,优先剪掉分数最低的通道。剪枝时还设置了一个保护机制:贡献分数最高的前10%通道被列入“免剪名单”,确保核心特征永远保留。

实验结果:50%剪枝率下精度反升0.6%的奥秘

实验部分最亮眼的结论藏在FLIR数据集上:当剪掉50%的通道时,模型的mAP(平均精度均值)从40.8%上升到41.4%,不降反升0.6个百分点。这个数字看着不大,但在“剪枝必然掉点”的行业认知里,已经有点反常识了。值得注意的是,这里提升的0.6%是mAP指标,不是mAP_50。表2中可以看到,mAP_50在50%剪枝率时基本持平(76.7% vs 76.8%),而mAP却逆势上涨,说明剪枝后的模型在更严格的匹配阈值下反而表现得更好——这很可能是剪枝起到了“正则化”作用,把冗余通道去掉后,模型在中等难度样本上的定位精度反而改善了。
表1:DroneVehicle和FLIR数据集上不同通道重要性准则与剪枝率的mAP50对比
表1展示了InterPruner与多种现有剪枝方法在DroneVehicle和FLIR两个数据集上的对比结果。在DroneVehicle上,InterPruner在30%/50%/70%剪枝率下分别达到81.0%、80.3%、79.0%,大幅领先所有基线,尤其是70%剪枝率下比第二名的HOT-MKS(73.4%)高出5.6个百分点。
表1中还有一个值得注意的细节:L1范数剪枝和Network Slimming这类基于权重大小的准则表现非常差,尤其在FLIR的50%剪枝率时只有49.2%,比原始模型低了近28个百分点——说明单通道权重的大小根本判别不了跨模态的互补性。而BilevelPruning、CSP这类更精细的单模态方法虽然在中低剪枝率下尚可一战,但在70%剪枝率下也明显吃力,因为它们完全没考虑跨模态依赖。
图4:DroneVehicle数据集上与其他剪枝方法的mAP50和模型大小对比
图4可视化了DroneVehicle上各方法的mAP_50和模型大小关系。InterPruner的散点落在左上角——精度最高,模型最小,几乎没有其他方法能同时做到这两点。
表2:不同剪枝率下的性能对比;表3:各组件在FLIR上的消融研究
表2给出了InterPruner在不同剪枝率下与原始模型的性能对比。可以看到,FLIR上30%/50%剪枝率时mAP_50分别为77.5%和76.7%,与原模型的76.8%基本持平,而mAP则比原始模型更高(41.5%/41.4% vs 40.8%);70%剪枝时参数量从6.580M降到2.767M,FLOPs从14.6G降到7.9G,mAP_50仍然保持72.6%,仅下降4.2个百分点。DroneVehicle上70%剪枝时mAP_50更是只掉了1.2个百分点。表3的消融研究则验证了三个模块各自的贡献——去掉任何一个模块,精度都会明显下降,证明它们不是“锦上添花”,而是“缺一不可”。
图5:极端暗光环境下RGB和红外分支剪枝前后的特征可视化
图5展示了极端暗光环境下剪枝前后的特征可视化。剪枝后的模型在两个模态上都能聚焦到更显著的目标区域,说明InterPruner不仅没有破坏跨模态互补性,反而帮模型去掉了噪声通道,让注意力更集中。

深入分析:泰勒展开阶数与超参数的影响

论文在方法之外还做了细致的敏感性分析,帮助理解各设计选择为何成立。
表4:TIC中泰勒展开阶数在FLIR不同剪枝率下的影响(mAP%)
表4对比了TIC中采用不同泰勒展开阶数的效果。只保留一阶项(相当于只看梯度的一阶近似)在30%剪枝率时表现尚可,但到了70%剪枝率就明显掉链子;引入二阶项后性能显著提升;继续加入三阶项的性能增益已经很小。这说明二阶项是TIC的主力,它在“近似精度”和“计算开销”之间找到了平衡点——三阶项的计算复杂度高不少,但换来的是微弱的精度提升,性价比偏低。
表5:FLIR数据集上β/α在三种剪枝率下的消融研究
表5针对统一重要性分数中α和β的相对比例做了消融。α控制“通道贡献”的权重,β控制“跨模态冗余惩罚”的权重。结果表明,α=β=1是最佳配置;β过大(比如β=2)意味着冗余惩罚过猛,很多贡献度不错但稍有冗余的通道被误杀;β过小(比如β=0.5)则冗余惩罚不足,跨模态冗余通道又“溜”了回来。
图6:β/α消融研究的可视化
图6是β/α消融结果的可视化。可以看到,当α和β相等时,两个数据集、三种剪枝率下的性能都处于高位,说明这两个权重对数据集和剪枝率的变化不敏感,设置为1是稳健的选择。
这些消融实验给后续研究者比较大的信心:InterPruner没有引入需要精细调参的“易碎超参数”,主要超参数在合理范围内都能保持不错的效果,这在工程落地时是很重要的加分项。

总结与展望:轻量化多模态感知的新范式

InterPruner的核心贡献在于把“剪枝”从单模态的“独舞”变成了跨模态的“双人舞”。通过TIC精确衡量通道贡献、MIRA识别跨模态冗余、SPCA引入场景先验,三者协同完成了对RGB-红外检测器的结构化瘦身,并且在高剪枝率下依然保持了令人满意的性能。
展望未来,这个框架还有几个可以延伸的方向。第一是拓展到更多模态组合(比如可见光-深度、可见光-雷达),不同模态间的冗余模式可能完全不同,需要更通用的交互建模。第二是结合硬件感知的自适应剪枝率,当前方法是全局统一剪枝率,未来也许可以让不同层、不同分支按实际部署预算动态分配剪枝率。第三是探索端到端联合训练剪枝后的紧凑模型,目前是先剪枝再微调的流程,如果能把剪枝决策和后续微调放在同一个优化循环里,可能有更优的效率-精度权衡。
需要注意的是,SPCA依赖Qwen2.5-VL和CLIP这两个冻结的视觉语言模型来生成场景语义,虽然离线完成了一次性编码,但在实际部署时仍然需要额外的存储和推理开销来获得场景先验。此外,论文实验主要基于YOLOv8框架和C2DFF检测器,在其他架构(比如基于Transformer或Mamba的检测器)上的适用性还需要进一步验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?InterPruner提出首个面向RGB-红外多模态目标检测的交互式结构化剪枝框架,结合泰勒隐式准则、跨模态冗余分析和语言先验场景调制。FLIR数据集剪枝50%通道时精度反升0.6%,计算量显著下降。
这篇工作最值得看的点是什么?在所有剪枝率和数据集上均取得最优性能。在DroneVehicle数据集上,30%剪枝率mAP50达81.0%,50%为80.3%,70%为79.0%;在FLIR数据集上,30%剪枝率mAP50达77.5%,50%为76.7%,70%为72.6%。特别在FLIR数据集50%剪枝率下,mAP50甚至比原始模型提升0.6%。
这篇工作的边界或风险在哪里?优点:(1)首次提出面向RGB-红外双模态检测的结构化剪枝框架,填补了该领域空白;(2)TIC通过高阶泰勒展开和隐函数定理提供了更精确的通道重要性估计;(3)MIRA有效识别跨模态冗余通道;(4)SPCA利用语言先验实现场景自适应剪枝。缺点:(1)框架复杂度较高,包含多个模块需要联合优化;(2)SPCA依赖VLM生成场景描述,增加了额外计算开销;(3)对超参数α和β的敏感性需要进一步分析。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

首次将结构化剪枝系统性地引入RGB-红外双模态检测,TIC的泰勒-隐函数准则和MIRA的跨模态补偿性分析都有新颖性,SPCA引入语言先验的思路也相当有想象力。扣一星是因为三个模块更多是“组合式创新”,每个模块单独看都能找到前作的影子。

实验合理度:★★★★☆

对比方法覆盖了范数剪枝、特征重建、双层优化、梯度敏感度等主流范式,且在不同剪枝率和两个数据集上做了全面验证。消融实验设计也比较完整(模块消融、泰勒阶数、超参数敏感性)。扣一星是因为对比基线主要来自单模态剪枝方法,缺少其他多模态剪枝方案的参照(该方向确实很少,可以做但论文没做)。

学术研究价值:★★★★☆

开辟了“多模态结构化剪枝”这个此前少有人触碰的方向,TIC中的泰勒-隐函数推导对后续通道重要性建模有借鉴意义,MIRA的交互冗余评估思路也可以迁移到其他多模态压缩任务。研究价值明确,但尚未形成统一的理论框架来回答“什么是最优的多模态剪枝策略”。

稳定性:★★★★☆

在30%/50%/70%三种剪枝率、两个数据集上均保持了较高的精度水平,没有出现“高剪枝率下崩盘”的情况(DroneVehicle上70%剪枝仅掉1.2个百分点)。但SPCA依赖VLM生成场景描述这一环节可能引入不确定性,不同VLM版本或提示词可能带来结果波动。

适应性以及泛化能力:★★★☆☆

在FLIR(自动驾驶场景)和DroneVehicle(无人机航拍场景)上验证有效,覆盖了两种典型应用场景,值得肯定。但目前仅在CNN骨干(YOLOv8+C2DFF)上做了实验,对Transformer/Mamba类检测器的适用性未知;此外数据集的模态组合仅限于RGB-红外,扩展到RGB-深度、RGB-雷达等组合时,跨模态冗余的特征模式可能完全不同。

硬件需求及成本:★★★★☆

剪枝后的模型参数量和FLOPs大幅降低,70%剪枝率下FLOPs从14.6G降到7.9G,对边缘设备相当友好。剪枝前的准备阶段需要跑一次TIC的梯度统计和MIRA的短适应,加上SPCA的VLM推理,这部分离线成本并不低,但由于是一次性开销,可以接受。在线推理阶段没有增加额外负担。

复现难度:★★★☆☆

论文承诺开源代码,但目前尚未放出。TIC的泰勒展开和隐函数推导部分需要较深的数学背景才能准确实现;SPCA还依赖Qwen2.5-VL和CLIP的调用,需要额外搭建VLM推理环境。对于一般研究者来说,复现门槛偏高。

产品化成熟度:★★★☆☆

方法本身在算法层面已经比较成熟,剪枝后的模型可以直接部署到边缘设备。但产品落地还需要考虑几个现实问题:SPCA依赖的Qwen2.5-VL是外部模型,离线生成场景描述需要额外的数据准备流水线;剪枝后的模型需要针对具体硬件(如TensorRT、RKNN等)做适配量化;此外论文的FLIR数据集标注的类别只有3类,实际产品中类别更多、场景更复杂,效果能否保持还有待验证。

可能的问题:论文的对比基线虽然覆盖广,但缺少与其他多模态剪枝方法的直接比较(这个方向论文确实少,但仍有IRPruneDeXt等);SPCA引入VLM增加了系统复杂度,论文没有给出这一模块带来的额外计算依赖对整体效率的影响分析;高剪枝率下FLIR数据集的mAP_50仍然下降了4.2%,虽然可以接受,但和摘要强调的“ negligible degradation”有些出入。


主要参考文献

[1] Multimodal object detection in remote sensing: A survey. IEEE TGRS, 2023.
[2] Influence function based channel pruning. ICLR, 2024.
[3] Bi-level optimization for unified static and dynamic pruning. NeurIPS, 2023.
[4] Probabilistic channel pruning for deep networks. CVPR, 2022.
[5] Pruning filters for efficient convnets. ICLR, 2017.
[6] Network slimming via BN scaling factors. ICCV, 2017.
[7] IRPruneDeXt: Wavelet-regularized channel pruning for infrared small target detection. AAAI, 2024.
[8] CSP: Joint channel and space pruning for general CNNs. ECCV, 2024.

融会贯通

结合PaperDaily已收录的论文可以观察到,当前多模态检测领域的剪枝研究确实比较稀少,多数工作仍停留在单模态主干压缩层面,而针对跨模态交互冗余的建模更是寥寥无几。InterPruner的贡献在方向上具备“从0到1”的价值,但需要提醒的是,目前这种领先更多是定性意义上的——由于数据集划分、基线设定和评估指标存在差异,不同论文之间的数值并不能直接横比,本文与PaperDaily已收录论文的对比也仅供参考,不宜解读为绝对的全领域领先。
从更广的视角看,这篇论文传递出一个重要的信号:轻量化不该只发生在训练完成之后的“事后剪枝”,而应该与多模态交互特性深度融合。未来如果能把SPCA的场景感知能力从一次性剪枝扩展到持续学习框架中,让模型在部署后也能根据新场景动态调整通道配置,那么“剪枝”这个概念本身也就会升级为“多模态感知资源的动态调度”。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
模型瘦身=技术活!InterPruner告诉我们,剪掉一半通道还能涨点,AI轻量化也能这么酷。想知道更多前沿论文解读和落地干货?扫描下方二维码或添加龙哥助手微信号kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,加入龙哥读论文粉丝群,一起拆解更多论文套路!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。