← 返回 PaperDaily
视觉与图像
ECCV 2026新作:AMG-Fuse让恶劣天气融合更稳了
这篇 AMG-Fuse 很会“借力打力”:不死磕把退化图硬修到完美,而是先用伪真值把训练方向扶正,再用掩码把每个模态该出力的地方分清楚。雪、雨、雾都能一起照顾到,还顺手把下游检测也拉了一把,属于很实用的那种新方法。
龙哥读论文
发布于 2026-08-18 00:20:06
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇 AMG-Fuse 很会“借力打力”:不死磕把退化图硬修到完美,而是先用伪真值把训练方向扶正,再用掩码把每个模态该出力的地方分清楚。雪、雨、雾都能一起照顾到,还顺手把下游检测也拉了一把,属于很实用的那种新方法。
原论文信息如下:
恶劣天气下的多模态图像融合,为何传统方法在复杂场景中失效?
多模态图像融合这件事,听起来像“把两张图拼得更聪明一点”,但真到雪、雨、雾里,就不是简单拼图了。可见光图像会被雨丝、雾气、低照度搞得一脸懵,红外图像虽然更稳,却也不是万能补丁。于是问题就来了:到底该先修图,还是先融合? 这篇 AMG-Fuse 的思路很有意思,它不打算在“修得像不像原图”这件事上死磕,而是先想办法让网络知道:哪些信息该保留,哪些退化该压下去,哪些模态该多出力。
先把背景说人话:多模态图像融合(MMIF,Multi-modality Image Fusion ,多模态图像融合)就是把不同传感器拍到的信息合在一起,让结果比单张图更“会看”。在红外与可见光融合里,红外更擅长找目标,可见光更擅长保纹理;两者合体,才像“既能认人又能看路”。但一旦遇到恶劣天气,输入图像本身就带着脏东西,网络学到的就不只是场景,还顺手学了一堆退化噪声。于是传统方法常常出现一个很尴尬的局面:修复不干净,融合不彻底,最后两头都不讨好。
传统做法大致分两派。第一派是“先修复,再融合”,流程很直白:先把可见光去雨去雾,再拿修复后的图去和红外图融合。问题也很直白:修复和融合的目标不一样,前者盯着单模态清洁度,后者盯着跨模态互补性,中间就像两个性格不同的同事硬搭班,容易互相拖后腿。第二派是用“伪真值 ”做监督,也就是把已有融合方法在干净图上生成的结果当作训练目标。这样训练更稳、收敛更快,但也有副作用:伪真值本身不是完美答案,里面带着已有方法的偏好和信息损失,模型很容易学成“照着抄作业”,却没学会真正的动态融合逻辑。
这篇论文的核心判断很明确:伪真值能当“老师”,但不能当“真相本身” 。因此,AMG-Fuse 不是简单地把伪真值拿来蒸馏,而是进一步挖出它背后的“模态分配规律”,再用掩膜去引导特征恢复和交互。换句话说,它不是只看答案,还想看出答案为什么这么写。这个思路,多少有点“老师批卷子时顺手把解题逻辑也学了”的味道。🤨
AMG-Fuse:一招解耦伪真值的“静态陷阱”
AMG-Fuse 的第一步,不是直接让网络“学融合”,而是先从融合结果里反推一个模态贡献掩膜 。这个掩膜可以理解成一张“责任分配表”:在某个区域里,到底是可见光贡献更多,还是红外更该站出来。论文里把这个掩膜写成由融合结果与源图之间的关系推导出来的形式,本质上是在告诉网络:别只记住最终图长什么样,更要记住每个模态在里面扮演了什么角色。
为了让这个掩膜更稳定,论文还处理了一个很现实的问题:直接拿可见光减红外,或者拿融合图去做简单比值,遇到夜间、雾天、过曝区域时很容易数值飘掉。于是作者把融合结果也放进分母里,避免可见光亮度偏差把掩膜“撑爆”。这个小改动看起来朴素,实则挺关键,因为它让掩膜不再被退化表面的亮度牵着鼻子走,而是更接近真实的模态分配。
更妙的是,论文没有把掩膜当成“后处理装饰品”,而是把它真正塞进训练过程里,让它成为监督信号的一部分。这样一来,伪真值就不再只是静态目标,而是被拆成了“哪部分来自可见光、哪部分来自红外”的动态描述。模型学的也不再是死记结果,而是学习如何分配信息。这个转变很重要,因为融合任务最怕的不是不会拼,而是拼得很像,却不知道自己为什么这么拼。
掩膜引导特征提取模块,如何让网络学会“动态互动”?
AMG-Fuse 的主干结构可以概括成一个多尺度的编码器—解码器框架,外加几个很会“管事”的模块:先提取特征,再生成初始融合表示,然后用直方图 transformer 处理显著信息,最后用掩膜引导的跨模态交叉注意力完成精修。这里的关键不在于堆了多少模块,而在于每个模块都围绕同一个目标服务:让恢复和交互同时发生,而不是先后割裂。
其中有两个部件值得单独拎出来说。一个是Histogram Transformer Block(HTB,直方图 transformer 块) 。它不是普通的自注意力,而是先按像素强度把空间特征分段,再在不同强度范围里做注意力建模。这样做的好处是,面对雨雪雾这种“成片退化”的情况,网络能更容易捕捉到远距离但同类的退化模式,而不是在局部纹理里打转。
另一个是Mask-Guided Cross-Modal Cross-Attention(MCCA,掩膜引导跨模态交叉注意力) 。名字很长,作用很朴实:让可见光和红外特征别各说各话,而是在掩膜的指挥下有选择地互相看一眼。这里的查询、键和值都带着掩膜提示,外加深度可分离卷积扩大局部感受野,既照顾全局互补,也不丢局部细节。说白了,就是让网络别“瞎聊天”,而是“带着重点沟通”。
这一套设计最有意思的地方在于,它不是把模态交互当成固定模板,而是随着掩膜变化动态调整。哪个区域更像可见光贡献,哪个区域更该借红外补强,网络都能在训练中学到。于是“融合”就不再只是简单叠加,而更像一个会分工的协作系统。
任务耦合退化感知学习,借助两阶段“降质感知”实现强恢复
如果说 MGLS(Mask Guided Learning Strategy ,掩膜引导学习策略)解决的是“伪真值怎么学”,那么 TDAS(Task-Coupled Degradation-Aware Learning Strategy ,任务耦合退化感知学习策略)解决的就是“退化怎么认”。论文的想法很巧:把恢复任务拉进来当辅助监督,让融合网络知道什么叫“清晰图应该长什么样”。这相当于给融合任务加了一个参照系,避免它一头扎进退化纹理里出不来。
TDAS 的逻辑可以简单理解成“两阶段对照”。第一阶段,先用退化输入走恢复网络,得到一个更干净的中间结果;第二阶段,把融合网络输出与这个恢复结果对齐。由于恢复网络更擅长描述“退化被抹掉后应当是什么样”,融合网络就能借此学会把退化区域往更合理的方向拉。这样做的好处是,融合不再只追求视觉好看,还会顺带学会识别和压制退化。
这部分最值得注意的是,它并没有把恢复任务和融合任务硬拆开,而是让两者“绑在一起训练”。这就是“任务耦合”的含义:恢复不是单独做一遍就完事,而是作为融合过程里的一个约束信号,持续提醒网络别忘了退化长什么样、清晰结构又该长什么样。对恶劣天气来说,这种提醒很重要,因为网络最容易犯的错,就是把天气噪声当成场景内容给保留下来。
再加上论文还用了梯度损失和颜色一致性损失,整体训练目标就不只是“像”,还包括“结构稳”和“颜色别跑偏”。这里的梯度损失主要保边缘,颜色一致性损失则负责让融合图别把可见光的颜色搞得像调色盘翻车。最终总损失里,除 MGLS 外其他项权重都设为 1,并且衰减系数会随训练轮次下降,算是让不同约束各司其职,避免训练时某个信号过强把模型带偏。
雪雨雾统统拿下:AMG-Fuse全方位性能碾压
实验部分先说结论:AMG-Fuse 在雪、雨、雾三种恶劣天气下,基本都能稳稳排进前列,而且不是只在某一个指标上刷存在感,而是多个指标一起往上走。更难得的是,它在真实退化场景中也没有“纸面强、实战弱”,说明这套掩膜引导的恢复与交互机制不是只会在实验室打光,而是真的能扛一点现实世界的脏活累活。
从定量结果看,AMG-Fuse 在雪、雨、雾场景中相对次优方法分别提升了 3.67%、3.86% 和 3.56%。这个幅度不算“离谱式暴涨”,但放在融合任务里已经很有分量了,因为融合指标往往不是单一维度冲高就行,而是要兼顾结构、信息量、感知一致性和整体自然度。换句话说,这不是某一项突然起飞,而是整体都更均衡了。
真实场景实验更能说明问题。合成天气里跑得好,不稀奇;真雾真雨真雪里还能稳住,才算有点本事。AMG-Fuse 在真实退化数据上仍能保持前二表现,说明它学到的不是某种固定天气模板,而是更通用的模态分配和退化抑制规律。这一点对实际部署很重要,因为现实世界不会乖乖按照训练集剧本出牌。
定性图也很有说服力。雪天里,别的方法要么细节糊掉,要么去雪后过度平滑;雨天里,有的方法能压住雨丝,却把纹理一并抹平;雾天里,有的方法虽然看着“清楚”了,颜色却开始跑偏。AMG-Fuse 的结果则更像是把这几个问题一起照顾到了:退化伪影少了,目标轮廓还在,纹理也没有被过度磨掉。尤其在清洁场景中,它也没有明显崩掉,这说明方法并不是“只会处理脏图”,而是具备一定泛化能力。
消融实验把事情讲得很明白。去掉 TDAS 后,模型对严重退化的恢复能力变弱,说明“恢复任务”确实在帮融合任务找方向;去掉 MGLS 后,模型更容易依赖静态伪真值分布,说明掩膜引导学习确实在避免模型偷懒;去掉 MCCA 后,跨模态交互明显变弱,说明真正的互补信息交换少不了这个桥梁。三项各有分工,缺一块都不太顺手。
下游检测实验也很加分。AMG-Fuse 在 M3FD 上的 mAP@0.5 和 mAP@[0.5:0.95] 都拿到了最优结果,说明融合后的图像确实更利于目标检测器识别。这个结果很关键,因为很多融合方法看着挺漂亮,一接检测就露馅;而 AMG-Fuse 至少在这个环节证明了自己不是“只会做视觉美颜”,而是能把信息整理得更适合机器理解。
龙迷三问
这篇论文到底解决什么问题? 它解决的是恶劣天气下多模态图像融合“既要修复退化、又要保留模态互补”的矛盾。核心办法是用伪真值引导训练,再用掩膜把不同模态的贡献拆清楚,避免网络只会照着静态目标抄答案。
伪真值是什么意思? 这里的“伪真值”不是人工标注的真实答案,而是用已有融合方法在干净图像上生成的融合结果。它能让训练更容易,但也可能带来偏差,所以论文才进一步设计了掩膜引导学习来解耦这种静态陷阱。
MGLS 和 TDAS 分别在干什么? MGLS 是掩膜引导学习策略,主要让网络学会伪真值里的模态分配规律;TDAS 是任务耦合退化感知学习策略,主要借助恢复任务提醒网络识别并压制退化。一个管“怎么学”,一个管“学什么才不跑偏”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 伪真值监督本身不新,但把伪真值拆成模态分配掩膜,再把恢复、交互、退化感知绑成一条链,这个组合拳挺完整。
实验合理度: ★★★★☆ 合成天气、真实退化、消融和下游检测都做了,验证链条比较完整;不过部分对比依赖“先修复再融合”范式,公平性上仍有讨论空间。
学术研究价值: ★★★★☆ 对复杂场景下的融合训练范式有启发,尤其是“伪真值不只是目标,还能反推模态分配”这一点,值得后续方法借鉴。
稳定性: ★★★★☆ 从真实场景和清洁场景的结果看,鲁棒性不错;但方法里模块较多,训练稳定性和超参敏感性还需要更多公开复现来确认。
适应性以及泛化能力: ★★★★☆ 在雪、雨、雾和清洁场景都能工作,泛化性比很多“只会一种天气”的方法更好,但极端退化下仍可能受限于输入质量。
硬件需求及成本: ★★★☆☆ 训练需要多张 3090,模块也不算轻量;推理成本未见特别夸张,但显然不是“边缘设备随手跑”的类型。
复现难度: ★★★★☆ 代码开源是加分项,训练设置也给得比较清楚;不过多模块联动会让调参和复现细节更费点功夫。
产品化成熟度: ★★★☆☆ 在自动驾驶、安防、夜间侦察等场景有应用潜力,但离稳定大规模部署还差数据适配、算力压缩和真实复杂环境的进一步验证。
可能的问题: 方法链路较长,模块堆叠带来解释和部署成本;伪真值仍是间接监督,若生成偏差较大,性能上限可能被卡住。
主要参考文献
[1] Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang. Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction. arXiv:2606.26812v1, 2026.
[2] AMG-Fuse 开源代码:https://github.com/ixilai/AMG-Fuse
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群