InterPruner的完整流程如图2所示。它由三个模块组成:TIC负责衡量每个通道对检测损失的“真实贡献”,MIRA负责找出跨模态的冗余通道,SPCA则根据图像场景动态调整剪枝决策。三个模块产出的分数融合成最终的统一重要性得分,指导通道排序和剪枝。下面逐个拆解。图2:InterPruner总览。给定RGB和红外骨干网络的多尺度通道,TIC通过损失变化评估每个通道的贡献C_q;MIRA通过交替掩码和补偿性评估暴露跨模态冗余R_q;SPCA利用RGB-IR图像对和提示词从VLM中提取场景语义并生成语义权重w(x);三路线索聚合成S_q用于通道排序和剪枝,最终得到紧凑检测器。TIC:泰勒展开加隐函数定理,算出通道的真实身价。剪枝的本质是回答一个问题:删掉这个通道后,检测损失会涨多少?最理想的做法是把每个通道都删一遍再重新训练,在大模型上这显然不现实。TIC提供了一种近似估计方法:把剪枝引起的损失变化拆成“立即损失变化”和“重训后损失变化”两部分,再用高阶泰勒展开和隐函数定理(Implicit Function Theorem)推导出重训后损失的解析近似。这里的数学推导比较长,龙哥直接说结论:TIC把最终通道重要性C_q表示为“立即损失变化”减去“重训恢复效应”的组合,公式为:其中g是损失函数对权重的一阶梯度,H是海森矩阵(二阶导数矩阵),T是三阶导数张量。简单理解:这个公式既考虑了删通道后立刻造成的损失,又考虑了参数重训后损失被“修复”的程度。C_q越小的通道,说明它对最终检测结果越“可有可无”,优先剪掉。MIRA:交替遮住一个模态,看另一个模态的反应。TIC解决的是“单通道重不重要”的问题,但跨模态冗余没法靠单边判断。MIRA的想法很妙:先把RGB分支整个mask掉,让红外分支独自短适应几步;然后再反过来,把红外分支mask掉,让RGB分支独自适应。如果某个通道在另一个模态消失后“被激活”、贡献突然变大,就说明它原来是被另一个模态“压着”的冗余通道——它的功能可以被对方补偿,剪掉它损失不大。由于原始的掩码是离散的0/1,没法直接做梯度优化,MIRA引入了可微的连续门控值z_q∈[0,1]来近似“通道开关”。短适应过程用几轮梯度更新来完成:其中η是短适应学习率。经过B步适应后,MIRA计算每个通道方向导数G_q在适应前后的变化幅度,作为冗余度指标R_q:R_q越大,说明这个通道适应性越强、越容易在另一个模态缺席时“救场”,也就越适合被剪掉。R_q的计算本质上衡量的是“通道在单模态环境下的适应能力增量”。一个在缺失对侧模态时表现活跃的通道,说明它编码的信息并非模态专属,冗余度较高。SPCA:用语言先验给剪枝装上“场景雷达”。前面两个模块都在静态图上做文章,SPCA则是为了让剪枝决策“看天气行事”。它借助冻结的Qwen2.5-VL视觉语言模型,为每个RGB-红外图像对生成结构化的场景描述,内容涵盖光照环境、场景上下文、物体证据和热属性四类信息。这些文本描述再经CLIP文本编码器编码成768维的场景语义向量z_i,最后通过一个轻量级MLP网络映射成每个通道的语义权重w_i,b,取值范围在[1-γ, 1+γ]之间。简单说,就是让模型“看”一眼当前场景,然后告诉剪枝器:这个场景里RGB通道更重要还是红外通道更重要。夜晚场景下,红外相关通道的冗余惩罚会被调低,从而保留更多温度特征通道;白天场景则相反。这一机制使得剪枝不再是“一刀切”,而是变成“量体裁衣”。图3展示了SPCA带来的核心差异:已有方法在不同光照条件下表现脆弱且次优,而SPCA能根据场景上下文自适应调整剪枝决策。最后,三个模块的输出统一成一个重要性分数:C_q代表贡献度(越高越该保留),R_q代表冗余度(越高越该剪掉),w是场景权重(调节冗余惩罚的强弱),最终的通道排序公式为:其中α和β是固定权重,C和R均做了归一化。按这个分数升序排序,优先剪掉分数最低的通道。剪枝时还设置了一个保护机制:贡献分数最高的前10%通道被列入“免剪名单”,确保核心特征永远保留。
实验结果:50%剪枝率下精度反升0.6%的奥秘
实验部分最亮眼的结论藏在FLIR数据集上:当剪掉50%的通道时,模型的mAP(平均精度均值)从40.8%上升到41.4%,不降反升0.6个百分点。这个数字看着不大,但在“剪枝必然掉点”的行业认知里,已经有点反常识了。值得注意的是,这里提升的0.6%是mAP指标,不是mAP_50。表2中可以看到,mAP_50在50%剪枝率时基本持平(76.7% vs 76.8%),而mAP却逆势上涨,说明剪枝后的模型在更严格的匹配阈值下反而表现得更好——这很可能是剪枝起到了“正则化”作用,把冗余通道去掉后,模型在中等难度样本上的定位精度反而改善了。表1展示了InterPruner与多种现有剪枝方法在DroneVehicle和FLIR两个数据集上的对比结果。在DroneVehicle上,InterPruner在30%/50%/70%剪枝率下分别达到81.0%、80.3%、79.0%,大幅领先所有基线,尤其是70%剪枝率下比第二名的HOT-MKS(73.4%)高出5.6个百分点。表1中还有一个值得注意的细节:L1范数剪枝和Network Slimming这类基于权重大小的准则表现非常差,尤其在FLIR的50%剪枝率时只有49.2%,比原始模型低了近28个百分点——说明单通道权重的大小根本判别不了跨模态的互补性。而BilevelPruning、CSP这类更精细的单模态方法虽然在中低剪枝率下尚可一战,但在70%剪枝率下也明显吃力,因为它们完全没考虑跨模态依赖。图4可视化了DroneVehicle上各方法的mAP_50和模型大小关系。InterPruner的散点落在左上角——精度最高,模型最小,几乎没有其他方法能同时做到这两点。表2给出了InterPruner在不同剪枝率下与原始模型的性能对比。可以看到,FLIR上30%/50%剪枝率时mAP_50分别为77.5%和76.7%,与原模型的76.8%基本持平,而mAP则比原始模型更高(41.5%/41.4% vs 40.8%);70%剪枝时参数量从6.580M降到2.767M,FLOPs从14.6G降到7.9G,mAP_50仍然保持72.6%,仅下降4.2个百分点。DroneVehicle上70%剪枝时mAP_50更是只掉了1.2个百分点。表3的消融研究则验证了三个模块各自的贡献——去掉任何一个模块,精度都会明显下降,证明它们不是“锦上添花”,而是“缺一不可”。图5展示了极端暗光环境下剪枝前后的特征可视化。剪枝后的模型在两个模态上都能聚焦到更显著的目标区域,说明InterPruner不仅没有破坏跨模态互补性,反而帮模型去掉了噪声通道,让注意力更集中。
[1] Multimodal object detection in remote sensing: A survey. IEEE TGRS, 2023.[2] Influence function based channel pruning. ICLR, 2024.[3] Bi-level optimization for unified static and dynamic pruning. NeurIPS, 2023.[4] Probabilistic channel pruning for deep networks. CVPR, 2022.[5] Pruning filters for efficient convnets. ICLR, 2017.[6] Network slimming via BN scaling factors. ICCV, 2017.[7] IRPruneDeXt: Wavelet-regularized channel pruning for infrared small target detection. AAAI, 2024.[8] CSP: Joint channel and space pruning for general CNNs. ECCV, 2024.