← 返回 PaperDaily
视觉与图像
TPAMI 2026最新:一个扩散模型搞定无标定红外超分与融合,下游检测率涨超5%!
红外与可见光双摄设备如今很常见,可两个摄像头总有‘视角差’,导致图像对不齐。以往要么手动校准,要么用复杂的配准网络。而这篇BeyondFusion另辟蹊径——直接在扩散模型的潜空间里让两个模态‘自对齐’,还能同时输出红外超分辨率图和融合图,手机实拍效果惊艳。一篇方法干净、结果扎实的工作,值得细读。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
1. 移动双摄无校准?红外与可见光如何“对话”
想象一个场景:深夜你拿着手机拍摄,主摄(可见光)只能拍到黑乎乎一片,但旁边的红外摄像头却能捕捉到热源轮廓——一个潜在的夜视小助手。然而,麻烦来了:两个摄像头的镜头位置不同、视角不同、分辨率不同、曝光时间也不同。哪怕你把手机固定在三脚架上,拍出来的红外图和可见光图也天然对不齐。传统方案要么手动做几何校准,要么用复杂的配准网络把两幅图强行“扭”到一起,但每次换场景或换设备,这套流程就得重来。有没有一种办法,让红外和可见光直接在“脑海里”自行对齐,不需要任何预校准,还能同时产出超分辨率红外图和融合图?
这就是今天要介绍的 BeyondFusion 给出的答案。这篇来自上海交通大学、清华大学、南开大学的论文,刚刚被 TPAMI 接收。它提出一个统一潜空间扩散框架,让红外和可见光两路信号在扩散模型的“大脑”(潜空间自注意力层)中自动建立联系,完全不依赖像素级的显式配准。更妙的是,同一套网络既能输出高分辨率红外图像(红外超分),又能输出一幅热二合一的风采融合图。下面龙哥就来带大家看看它的设计思路和实际表现。
图2:移动红外-可见光成像系统。红外摄像头(64×64)附加在手机背面,可见光主摄(512×512)独立工作,两者无任何硬件同步。
2. 方法核心:潜空间自对齐——让两个模态自行匹配
BeyondFusion 的核心思想非常干脆:不要试图在像素空间把红外和可见光“掰正”,而是把它们一起放到扩散模型的潜空间里,让自注意力机制自己学会哪些区域应该对应起来。这一思路的灵感来源于一个观察:尽管红外和可见光在像素层面存在明显的几何错位(平移、旋转、尺度差异),但在高层语义特征空间中,两者描述的是同一场景——热辐射轮廓与可见光纹理本质上是对同一物理世界的不同编码。因此,与其在像素空间费力地求解一个变形场,不如在潜空间中让两个模态的特征通过注意力机制自由交互,让模型自己发现跨模态的对应关系。
具体做法是:首先用一个预训练的 VAE 编码器把红外图像和可见光图像分别转成潜特征,然后将这两个潜特征沿着批次维度“折叠”在一起,形成一个形状为 (B×2)×C×H×W 的张量(B 是批次大小,2 代表两个模态)。这样一来,原本为单张图像设计的扩散 U-Net 可以直接处理这个折叠后的输入,不需要修改网络维度。在 U-Net 的大部分层里,两路信号各自独立处理;但在每个自注意力(Self-Attention, SA)层上,跨模态自对齐模块(Cross-Modal Self-Aligning, CMSA) 发挥作用——它将红外和可见光的潜 tokens 重新排列成一个共享的注意力序列,让两个模态的 tokens 在同一个 attention 空间里交互,而不是各自为政。
图1:BeyondFusion 架构概览。(a) 整体框架;(b) CMSA 模块;(c) 错位增强模块。
这个过程可以形式化描述为:给定第 l 层自注意力的输入特征 z_l(折叠后的形状),先恢复模态维度,将红外和可见光的空间 tokens 展平并串联成一个长为 (M×H_l×W_l) 的序列,送入原始的自注意力层(SA)计算,然后再把输出 reshape 回原形状。整个过程不需要新增任何可学习投影或额外的注意力头,完全复用原有的自注意力参数,仅通过 LoRA 微调进行适配。这样,跨模态对应关系就通过软注意力隐式地建立起来,而不是通过预测一个显式的对齐矩阵或变形场。值得注意的是,CMSA 的设计非常轻量——它只是在数据流层面做了重新编排,没有引入任何额外的计算瓶颈。在训练时,由于自注意力层的计算复杂度与序列长度的平方成正比,将两个模态的 tokens 串联会使序列长度翻倍,但 U-Net 中特征图的分辨率在深层已经大幅降低(例如从 64×64 降至 8×8),因此实际增加的计算开销是可控的。论文通过实验验证,CMSA 模块仅使单次前向传播的时间增加了约 12%,但带来的性能提升非常显著。
此外,为了让模型在真实无校准条件下依然鲁棒,论文还设计了一个 错位增强模块(Misalignment Augmentation, MA)。在训练时,对输入的红外和可见光图像分别施加随机的平移、旋转、缩放和透视变换。由于 CMSA 并不要求像素级对准,这些合成扰动就足以防止模型过拟合到固定邻域,从而学到更加鲁棒的跨模态交互。具体来说,MA 模块在每次训练迭代中独立地对红外和可见光图像应用不同的几何变换参数。平移的范围设置为图像尺寸的 ±10%,旋转角度在 ±10° 内随机采样,缩放因子在 0.9 到 1.1 之间变化,透视变换的扰动强度也做了合理限制。这种“各自独立扰动”的策略非常关键——它模拟了真实场景中两个摄像头由于物理位置不同而产生的视差变化,迫使 CMSA 模块学习到对错位不敏感的跨模态特征对应关系。论文通过消融实验证明,移除 MA 模块后,模型在真实错位数据上的 LPIPS 指标从 0.1658 恶化到 0.1820,MANIQA 从 0.4536 下降到 0.4154,充分说明了错位增强的必要性。
3. 一石二鸟:同一模型同时输出超分和融合
BeyondFusion 的另一个亮点是任务统一。红外超分(Infrared Super-Resolution, SR)和红外-可见光融合(Infrared-Visible Fusion, IVF)看起来很不同:一个输出单通道红外高分辨率图像,另一个输出三通道红绿蓝(RGB)融合图。但本文认为它们本质上是同一组传感器数据的两种“解读”——一个增强热辐射细节,另一个将热信息与可见光结构合并。因此,可以用同一个潜空间生成过程同时完成两个任务。这种任务统一的设计不仅节省了计算资源,更重要的是让两个任务在训练过程中相互促进:超分任务迫使模型学习精细的红外纹理结构,而融合任务则要求模型理解红外与可见光之间的语义对应关系,两者共享的潜空间编码器能够同时受益于这两种监督信号。
具体实现上,经过 CMSA 增强的去噪 U-Net 输出仍然是折叠后的潜张量,但在解码前需要将这个张量拆分成两个流:一个用于超分(z*_sr),一个用于融合(z*_fusion)。这两个流共享同一个 VAE 解码器,但解码时分别注入不同的条件特征(超分注入红外条件特征,融合注入可见光条件特征),从而得到不同的输出图像。这种“共享解码器+条件注入”的设计非常巧妙:VAE 解码器学习的是从潜空间到像素空间的通用映射,而条件特征则引导解码器关注不同的信息源。对于超分任务,条件特征来自红外图像的 VAE 编码特征,确保解码器优先恢复热辐射信息;对于融合任务,条件特征来自可见光图像的 VAE 编码特征,帮助解码器在保持红外热响应的同时融入可见光的色彩和纹理。
训练时,论文为两个任务分别设计了损失函数。超分任务使用 L2 损失和 LPIPS(Learned Perceptual Image Patch Similarity,学习感知图像块相似度)损失;融合任务则额外引入了强度保真损失(在 YUV 空间的 Y 通道上保持红外热响应)和颜色保真损失(让融合图像的 U、V 通道与可见光的色彩一致)。通过联合优化一个总损失,模型同时学会两个任务。具体地,总损失函数可以写为:L_total = λ_sr * (L2_sr + LPIPS_sr) + λ_fusion * (L2_fusion + LPIPS_fusion + λ_int * L_int + λ_col * L_col),其中 λ 系数通过网格搜索确定(λ_sr=1.0, λ_fusion=1.0, λ_int=0.5, λ_col=0.3)。强度保真损失 L_int 计算融合图像 Y 通道与红外图像 Y 通道之间的 L1 距离,确保热辐射信息不被丢失;颜色保真损失 L_col 计算融合图像 UV 通道与可见光图像 UV 通道之间的余弦相似度,保证色彩自然。在推理时,还可以启用 classifier-free guidance(无分类器引导,CFG)来进一步提升质量,只需一个前向传播即可同时输出超分图像和融合图像。CFG 的实现方式是在训练时以一定概率(10%)丢弃条件特征,让模型学会无条件生成;推理时则通过外推公式 (1+w)*conditional_prediction - w*unconditional_prediction 来增强条件信号的强度,w 取 1.1 时效果最佳。
图3:红外超分定性对比。从左到右:输入红外、参考可见光、CoReFusion、SwinFuSR、SwinPaste、SeeSR、OSEDiff、BeyondFusion、真值。BeyondFusion 保留了更清晰的钢架、道路箭头和电线杆,没有模糊或幻觉。
4. 实验验证:从公开基准到真实手机拍摄全面领先
论文的实验做得非常扎实,覆盖了多个公开数据集和一套自建的真实移动采集系统。下面我们主要看红外超分和融合的结果。实验设计遵循了严格的评估协议:对于红外超分任务,所有方法都在相同的 64×64 输入分辨率下进行测试,输出为 512×512 的高分辨率图像;对于融合任务,红外输入同样降采样到 64×64,可见光保持 512×512,以模拟真实移动设备的低分辨率红外传感器。评估指标涵盖了保真度(PSNR、SSIM)和感知质量(LPIPS、MANIQA、CLIPIQA)两个维度,确保评价的全面性。
红外超分实验结果分析
首先,在四个公开数据集组成的测试集上(包含IRVI、LLVIP、M3FD、PBVS 2025 TISR Challenge),BeyondFusion 在感知质量指标 LPIPS 上取得了最佳(0.1658),远低于第二名 SeeSR(0.1828),并且在无参考质量指标 MANIQA 上同样最高(0.4536)。PSNR 和 SSIM 并非最优,但非常接近最强保真度基线 CoRPLE(30.38 vs 30.47 dB)。这说明 BeyondFusion 在保持结构保真的同时,大幅提升了视觉真实性。从定性图(图3)可以清楚看到:非扩散方法(如 CoReFusion、SwinFuSR)重建的热图像非常模糊,扩散方法(如 SeeSR、OSEDiff)虽然更锐利但常常产生错误的纹理,而 BeyondFusion 的细节更干净且与真值更一致。特别值得注意的是,在 PBVS 2025 TISR Challenge 这个专门针对红外超分的竞赛数据集上,BeyondFusion 的 LPIPS 达到了 0.1521,比第二名低了 0.031,优势尤为明显。这表明该方法在处理真实红外图像特有的噪声和模糊退化时具有更强的鲁棒性。
有意思的是,论文还测试了“错位增强”的有效性。对大多数基线方法(CoReFusion、SwinFuSR、SwinPaste)加同样的几何扰动后,效果提升很小甚至下降;但 BeyondFusion 在添加增强后 LPIPS 从0.1820降至0.1658,MANIQA 从0.4154升至0.4536,说明其自对齐机制确实能受益于这样的训练策略。进一步的分析显示,CMSA 模块在错位增强训练后,注意力图变得更加分散和均匀——这意味着模型不再依赖固定的空间位置对应关系,而是学会了根据内容语义进行跨模态匹配。例如,在红外图像中一个模糊的热斑可能与可见光图像中一个清晰的物体边缘对应,CMSA 能够通过注意力权重自动建立这种非刚性的对应关系。
表I:红外图像超分定量对比。灰色为最佳,浅灰为次佳。BeyondFusion 在 LPIPS 和 MANIQA 上大幅领先,同时 PSNR/SSIM 接近最强保真度方法。
红外-可见光融合实验结果分析
融合任务在 MSRS、M3FD、LLVIP、M3SVD 四个数据集上测试。BeyondFusion 在熵(EN)、标准差(SD)、空间频率(SF)、结构内容差异(SCD)、平均梯度(AG)等五项常用指标上均超过三个强基线:CDDFuse、Mask-Difuser、C-OPDR。尤其在高频细节(SF和AG)上优势明显,这得益于扩散生成模型对结构信息的恢复能力。更关键的是,当红外输入分辨率降低(从512×512降到64×64)时,BeyondFusion 的性能下降比其他方法更平缓,说明其对红外退化具有更强的鲁棒性。具体来说,当红外分辨率从 512×512 降至 64×64 时,CDDFuse 的 SF 指标下降了 42%,Mask-Difuser 下降了 38%,而 BeyondFusion 仅下降了 19%。这种鲁棒性来源于 CMSA 模块的跨模态交互——即使红外图像非常模糊,可见光图像的高频信息也能通过注意力机制帮助引导红外特征的恢复。此外,论文还进行了下游行人检测任务的验证:在 LLVIP 数据集上,使用 BeyondFusion 融合图像训练的 YOLOv8 检测器在 mAP@0.5 指标上达到了 78.3%,比使用原始低分辨率红外图像(62.1%)和 CDDFuse 融合图像(74.5%)都有显著提升,证明了融合图像在实际应用中的价值。
真实移动系统验证
作者搭建了一个小米15手机 + 紧凑红外摄像头的系统(图2),采集了200个夜间室外场景的真买无校准图像。在这些数据上,BeyondFusion 产生的超分红外图像和融合图像在视觉上明显优于对比方法。例如,传统方法会导致伪影或模糊,而 BeyondFusion 能保留清晰的物体轮廓和热辐射特征。这项验证直接证明了该方法从实验室到真实硬件的迁移能力。在真实系统测试中,作者还发现了一个有趣的现象:由于手机摄像头和红外摄像头之间存在约 2cm 的基线距离,近处物体(如 1-2 米内的行人)的视差可达 30-50 像素,而远处物体(如 10 米外的建筑)的视差则小于 5 像素。BeyondFusion 的 CMSA 模块能够自动适应这种变化的视差,在近处建立大范围的注意力连接,在远处则建立更局部的连接,这种自适应行为是传统显式配准方法难以实现的。
5. 总结与启发
BeyondFusion 提出的“潜空间自对齐”思路,为多模态无校准成像提供了一个干净且高效的解决方案。它的核心洞察是:与其在像素层面纠结错位,不如在扩散模型的潜空间中利用自注意力机制让两个模态自然对话。这种做法不仅避免了显式配准的脆弱性,还自然地将多个任务(超分、融合)统一到了同一个生成框架下。对实际产品来说,这意味着在手机上可以省去一个昂贵的校准步骤,直接拍出更清晰的红外图和融合图——对安防、自动驾驶、机器人等场景都是好消息。从更广阔的视角来看,BeyondFusion 的设计哲学——“在潜空间中解决模态差异”——可能对更广泛的多模态学习任务具有启发意义,例如多光谱遥感图像融合、医学影像(CT-MRI)配准与融合、以及跨模态图像翻译等。
当然,该方法也有局限:它依赖预训练的 SD-Turbo 作为骨干,计算开销仍高于轻量级 CNN 方法;而且对极端错位(如完全不同的视野)可能效果有限。不过,整体的设计思路——用潜空间交互代替像素对齐——对多模态融合领域很有启发价值。未来的改进方向可能包括:探索更轻量的扩散骨干网络以降低计算成本;引入显式的深度信息或光流先验来辅助极端错位情况下的对齐;以及将方法扩展到更多模态(如近红外、短波红外、热红外与可见光的组合)。此外,论文中 CMSA 模块的设计非常通用,理论上可以移植到任何基于 Transformer 的多模态模型中,这为后续研究提供了丰富的想象空间。
龙迷三问
问:CMSA 模块为什么能在不改变网络结构的情况下实现跨模态交互?答:CMSA 只是在原有自注意力层前后添加了 reshape 操作。原始自注意力层在输入形状 (B×2)×C×H×W 时会独立处理每个样本,看不到另一个模态。CMSA 把同一批次内的红外和可见光 tokens 重新排列成一个长度为 (2×H×W) 的单一序列,再送入原始自注意力。这样 queries、keys、values 就同时来自两个模态,attention 矩阵自然包含了跨模态对应关系,而网络参数本身没有增加。这种设计的精妙之处在于,它完全复用了预训练模型已经学到的注意力模式——SD-Turbo 的自注意力层原本就擅长捕捉长距离依赖关系,CMSA 只是将这种能力扩展到跨模态场景。实验表明,即使只微调少量 LoRA 参数(秩为 4,仅占模型总参数的 0.1%),CMSA 也能有效建立跨模态对应。
问:论文中提到的“无分类器引导(CFG)”在这里怎么用?答:CFG 是扩散模型常用的提频技术。本文在训练时分别构造了正向分支(用正常超分/融合目标监督)和负向分支(去掉部分损失,如用低分辨率红外代替高分辨率真值,融合目标用可见图代替)。推理时,将正负分支的预测按比例混合(正分支权重 1.1,负分支权重 1.0),得到更锐利的结果。由于是两步后输出两个任务,CFG 同样同时作用在超分和融合流上。值得注意的是,论文发现 CFG 的权重对两个任务的影响不同:超分任务在 w=1.1 时效果最佳,而融合任务在 w=1.3 时细节更丰富但可能引入轻微伪影。最终选择 w=1.1 作为折中方案,在保持融合质量的同时确保超分结果的稳定性。
问:如果红外和可见光视角差太大(比如拍摄不同场景),模型会怎么表现?答:论文测试了合成错位(最大平移10%图像大小、旋转10度等)和真实手机系统(视角自然偏移),证明在此范围内鲁棒。但若两幅图完全没有重叠区域,CMSA 的注意力很难建立有效对应,此时模型可能退化为对可见光结构的盲目借用,产生不一致的结果。这是该方法的固有局限性——它依赖内容重叠来实现对准,而不是强制配准。不过,论文通过注意力可视化分析发现,即使在重叠区域较小的情况下(例如只有 30% 的场景重叠),CMSA 仍然能够将注意力集中在重叠区域,对非重叠区域的特征进行抑制,表现出一定的智能性。对于完全无重叠的极端情况,一个可能的改进方向是引入全局场景先验或深度估计来辅助注意力计算。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★★
用潜空间自注意力替代显式配准,同时统一了超分和融合任务,思路巧妙且高度实用,创新性强。
实验合理度:★★★★★
基准选择全面,包含公开数据集和真实硬件测试,错位增强对比和下游行人检测验证扎实,结论可信。
学术研究价值:★★★★☆
潜空间交互设计有普适性,可扩展到其他多模态任务(如红外-事件相机、热-深度),但骨干依赖 SD-Turbo,限制了纯学术贡献的独立性。
稳定性:★★★★☆
在标准测试集和真实硬件上表现稳定,但极端错位(无重叠区域)时可靠性下降,建议进一步测试。
适应性以及泛化能力:★★★★☆
对红外分辨率降质鲁棒,对不同数据集泛化好,但仅验证了白天/夜间室外场景,室内/复杂光照未覆盖。
硬件需求及成本:★★★☆☆
需 A800 80GB GPU 训练(单卡,batch=4),推理可一步生成,但 SD-Turbo + VAE 仍比轻量 CNN 重,不适合嵌入式端。
复现难度:★★★★☆
使用公开 backbone(SD-Turbo、LoRA),训练流程描述清晰,代码预期将开源,复现较容易。
产品化成熟度:★★★★☆
已在真实手机系统上验证,输出效果可用,但推理需要 GPU 加速手机暂未支持,可先部署到云端。
可能的问题:对完全无重叠视野的跨模态对束手无策;当前仅验证了可见光引导红外这一方向,反向(红外引导可见光)未涉及;扩散模型在低功耗设备上的部署仍是挑战。
主要参考文献
[15] CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for Multi-Modality Image Fusion, CVPR 2023.
[16] Mask-DiFuser: Masked Diffusion Models for Unsupervised Infrared-Visible Image Fusion, AAAI 2024.
[20] C-OPDR: Cross-Modal Optical Flow with Deformable Registration for Infrared-Visible Fusion, ECCV 2024.
[22] SD-Turbo: One-Step Latent Diffusion for Image Super-Resolution, 2024.
[23] 3M-TI: Calibration-Free Mobile Infrared Super-Resolution via Cross-Modal Diffusion, conference version.
[46] DifIISR: Diffusion-based Infrared Image Super-Resolution with Gradient Priors, CVPR 2025.
[49] LoRA: Low-Rank Adaptation of Large Language Models, ICLR 2022.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!