← 返回 PaperDaily 视觉与图像

IR275K:中科院为红外超分立新规,594序列27万帧严苛压力测试

红外多帧超分领域终于等来一个像样的专属标准答案。中科院联合团队放了594个序列、27万帧的大招,关键还精心挖了三个坑——低对比高噪声、测试集故意加噪声、运动幅度整得很大,专门治各种花架子模型。顺便送了个轻量级Mamba模型CGMamba,112G FLOPs就把SISR方法打出33dB,还顺手拆穿了RoPE和跨帧融合的连带关系。

IR275K:中科院为红外超分立新规,594序列27万帧严苛压力测试
原论文信息如下:
论文标题:
IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing
发表日期:
2026年07月

发表单位:
中国科学院上海技术物理研究所、杭州高等研究院、中国科学院大学

原文链接:
https://arxiv.org/pdf/2607.22380v1.pdf

开源代码链接:
https://github.com/InfraRecon7/IR275K


引言:红外遥感超分,缺的不只是模型,是标准尺子

红外遥感正在经历一场“爆发式增长”。卫星、飞机、无人机甚至低空平台纷纷装上红外载荷,从海上监视到应急响应,应用需求巨大。但问题在于,这些平台受限于探测器分辨率、功率预算和下行链路带宽,获取到的图像常常又糊又噪,特别是热对比度低、传感器噪声大、纹理稀疏——这些恰恰是红外成像的先天痛点。
多帧超分辨率技术正好派上用场。运动平台拍到的连续帧里藏着互补的空间信息,利用好这些冗余信息,可以在不升级探测器或增加下行数据量的前提下,大幅提升图像质量。
但这回龙哥要说点大实话:别看多帧超分在可见光领域做得风生水起,在红外遥感这个方向上,长期处于“各家各说各话”的状态。大家用的评估基准要么是REDS、Vimeo-90K这样的可见光数据集,要么是自建的小视频库,协议乱得像一锅粥。红外图像特有的 弱热对比度、高噪声、稀疏纹理,以及平台运动导致的帧间位移,这些核心约束在现有基准里根本没有被好好建模。
换句话说,你拿红外方法跑到可见光基准上刷分,刷得再高也不敢说在真实红外部署中能用。中科院团队的这篇工作,目的就是给这个领域搭好一个可以复现的“尺子”。顺便还测试了一个轻量级的Mamba模型,看看有没有戏。

Fig. 1. IR275K中的代表性场景
图1:IR275K中的代表性场景,包括陆地遥感、海洋遥感、城市遥感和低空城市遥感。这些示例展示了基准所覆盖的热外观、目标结构和成像背景的多样性。

红外多帧超分为何需要专用基准?——IR275K的三大压力测试

现有超分基准的一个惯常操作是随机划分训练/测试集。这在可见光领域或许勉强能用,但在红外遥感场景下,这种策略可能隐藏大问题。举个例子,如果随机划分别把同类低对比度场景均匀分布在数据集中,模型训练时早就见过类似样本了——测试时完全测不出抵抗低对比度的鲁棒性。
IR275K的设计哲学恰恰相反:通过有意的训练-评测难度偏移,专门暴露出红外部署中可能遇到的失败模式。具体来说,IR275K在划分训练/验证/测试集时,针对以下三个维度进行了压力测试设计:

压力测试一:对比度-噪声耦合

在红外图像里,信号强度由目标与背景的温度差决定。热对比度低和噪声高往往会同时出现——弱的热信号很容易被噪声淹没。IR275K中全局热对比度的跨度达一个数量级以上(0.009到0.32),但训练、验证、测试三组的平均对比度几乎一致(0.105、0.116、0.122),这意味着划分保留了原始的热对比特性,并且去耦合了对比度与噪声的关系。
此外,自然红外场景中对比度与噪声天然耦合——这也就避免了方法去利用“低压高噪下的合成样本”。

压力测试二:噪声域差距

时序噪声(逐像素标准偏差)在IR275K中范围为0.006到0.26。更关键的是,测试集的噪声分布刻意比训练集偏大(均值为0.082 vs 0.074,且上尾更重)。这意味着模型在训练时见到的是相对干净的样本,测试时却要面对更嘈杂的条件——这正是红外载荷在轨工作中常见的场景(探测器温度漂移、积分时间变化等)。

压力测试三:运动鲁棒性

帧间位移为多帧超分提供了物理基础,但也是它最脆弱之处。训练集主要集中在小位移区间(均值0.91像素、95%序列低于4.4像素、中位数0.36像素),而验证和测试集覆盖了更大的运动包络(均值2.57和2.86像素,最大值超过25像素)。这样的设计可以检验,当帧间位移显著超出训练范围时,模型究竟能否稳住。
一句话总结:IR275K不只是给一个数据集,而是给了一套内置“摸底考试”的评测环境。这个方法设计比单纯堆叠更大的数据集有说服力得多。
Fig. 2. IR275K分区设计在两种红外特定特征上的表现
图2:IR275K分区设计在两种红外特定特征上的表现。(a) 全局热对比度分布,带有每个序列的散点覆盖,显示划分保留了对比度特征(黑色菱形表示每个分区的均值)。(b) 时序噪声分布,显示测试集携带了更重的上尾噪声(均值菱形与中位数柱之间的分离反映了分布偏斜)。

Fig. 3. 三个划分中的帧间位移分布
图3:三个IR275K划分中的帧间位移分布。训练集集中在亚像素区间,而验证和测试集覆盖了更宽的运动包络,用于探测对更大帧间位移的鲁棒性。

IR275K数据集详解:594个序列、27万帧与可控划分

IR275K数据集从三个公共红外来源(AnyTSR++以及Science Data Bank的两个资源)中精心挑选,最终保留了594条序列、共计275,196帧。每条序列保持640×512像素的空间分辨率。
筛选时去除了三类序列:完全静止的场景(无法提供亚像素变化)、严重模糊的序列(噪声压过信号)以及极端帧间位移(场景切割或非连续运动)。过滤后的594个序列涵盖了陆地、海洋、城市和低空城市四大场景,每种场景都对重建能力提出了不同要求。

序列级划分与评估协议

划分在序列级完成——保证来自同一原始序列的帧不会出现在两个不同的分区中。训练集拿到261个序列(192,776帧,平均长度738.6帧),验证集111个序列(27,576帧),测试集222个序列(54,844帧)。值得一提的是,测试集中噪声更大、帧间位移更大,这正是IR275K的核心设计哲学:让测试集比训练集更难,才能测出模型的真实鲁棒性。
评估协议明确规定:任务为4倍放大(×4),低分辨率输入由双三次下采样生成,使用PSNR和SSIM作为指标,计算前裁剪掉图像边界10像素。运行时在单块NVIDIA RTX 4090上测量,参数、FLOPs和推理时间必须一并报告。这个协议让不同方法的横向对比有了公平基础。
Fig. 4. IR275K数据集统计
图4:IR275K数据集统计,包括各划分的序列数、帧数、序列长度趋势和总体基准设定。

CGMamba:轻量级隐式融合模型,2D RoPE+中心引导Mamba

在红外多帧超分场景下,弱纹理和大位移让显式的对齐步骤(比如光流和可变形卷积)风险极高。对齐一旦出问题,会引入伪影甚至结构错乱。所以,CGMamba绕开显式对齐,采用隐式帧间融合策略,让模型自己从相邻帧中学习如何融合。但在隐式融合时,还有个“保持空间对应性”的陷阱需要解决,否则来自相邻帧的信息可能被错误地门控到别的位置。
讲完这三个压力测试的设计思想,龙哥觉得有必要多说一句:IR275K 不是那种“把数据扔进一个篮子,然后随机划拉一下”的懒惰基准。它内置了三道“安检”,专门用来揪出那些在对齐、去噪和纹理恢复方面外强中干的模型。

IR275K数据集详解:594个序列、27万帧与可控划分

数据集的原材料来自三个公开红外数据源:AnyTSR++ 和 Science Data Bank 上的两个资源。经过严格筛选——排除静止场景、严重模糊和极端跳变序列——最终得到 594 个序列,共 275,196 帧,全部统一为 640×512 像素空间分辨率。
序列长度从 16 帧到 5,625 帧不等,覆盖陆地、海洋、城市和低空城市四大类场景。下面这个表格是 IR275K 的总体统计:
表I IR275K 的汇总统计。所有序列的空间分辨率为 640×512,所有 LR-HR 对均遵循统一的 ×4 缩放比例。
表I:IR275K 的汇总统计。所有序列的空间分辨率为 640×512 像素,所有 LR-HR 对均遵循统一的 ×4 缩放比例。
训练集包含 261 个序列(192,776 帧),平均长度 738.6 帧;验证集 111 个序列(27,576 帧);测试集 222 个序列(54,844 帧)。这里的划分是序列级别的——同一原始序列的帧绝不会出现在两个分区中。更重要的是,测试集被有意安排了更重的噪声上尾和更大的帧间位移,这种“训练友好、测试严苛”的设计,正是 IR275K 最宝贵的价值:它不让你躺在训练集上舒舒服服地刷分。

CGMamba:轻量级隐式融合模型,2D RoPE + 中心引导Mamba

既然 IR275K 已经在“对齐不靠谱”的红外条件下给模型挖了坑,那么什么样的架构才能爬出来?CGMamba 给出了一个轻量级但极其巧妙的答案。
先看整体架构。CGMamba 只有 10.90M 参数和 112.14G FLOPs,却能在 IR275K 测试集上达到 33.19 dB PSNR。它的设计遵循两个原则:不依赖显式对齐保持空间对应性
图5 CGMamba 的整体架构。
图5:CGMamba 的整体架构。输入三帧低分辨率红外图像,经过卷积层和 SS4D 模块提取帧内特征,再通过多个中心引导交叉Mamba组(CGCM)进行隐式融合,最后用轻量级通道注意力块和像素混洗层上采样到目标分辨率。
核心创新有两处:2D 旋转位置编码(2D RoPE)中心引导交叉Mamba(CGCM)。我们先看 2D RoPE。
图6 2D 旋转位置编码。
图6:2D 旋转位置编码。对于每个像素坐标 (i,j),沿 X 和 Y 方向计算相位角,形成二维空间角度矩阵 θ₂D,再与 Mamba 投影层学习到的内容相关位置信号可学习混合,最终注入 Mamba-3 内核的旋转机制中,使每个 token 携带绝对坐标信息。
为什么一定要加 2D RoPE?因为原生的 Mamba 将 2D 图像展平成一维序列进行扫描,天然丢失了空间邻接关系。在红外遥感中,水面、地面、建筑物这类热均匀区域,仅仅依靠像素值的区分性很差。2D RoPE 相当于给每个 token 发了一张“身份证”,告诉 SSM 模型哪些 token 是近邻、哪些是远亲。消融实验证明,去掉 2D RoPE 会导致严重的网格状伪影(后面会展示)。
接下来是 CGCM——中心引导交叉 Mamba。传统的多帧超分依赖光流或可变形卷积做显式对齐,但在弱纹理、大位移的红外视频中,这些对齐器很容易“翻车”。CGMamba 的做法是:用中心帧的特征作为查询(Query)来门控相邻帧的特征提取,完全绕开显式运动估计。
图7 中心引导交叉Mamba(CGCM)的架构。
图7:中心引导交叉Mamba(CGCM)的架构。它基于结构化状态空间对偶性(SSD)理论,将输入解耦为当前分支(来自相邻帧,生成 K、V 和步长 Δ)和支持分支(来自中心帧,生成 Q),隐式实现参考引导的跨帧门控。
这种不对称设计的巧妙之处在于:中心帧和相邻帧共享相同的场景结构,但携带独立的时序噪声。Q 来自中心帧,K 来自相邻帧,当 Q 与 K 在正确的空间位置对应时,结构特征会产生更强的响应,而噪声由于不相关会被衰减。这从机制上解释了为什么 CGMamba 不需要单独的降噪模块。推理时使用分块循环 SSM 形式,计算复杂度为 O(N) 而非注意力机制的 O(N²)。
训练目标使用 Charbonnier 损失函数,它介于 L2 和 L1 之间,兼顾收敛稳定性和对大残差的鲁棒性。公式如下:
L = sqrt( (I_pred - I_GT)² + ε ),其中 ε = 10⁻³。

实验结果:33.19dB PSNR,消融揭示空间锚定的关键作用

CGMamba 在 IR275K 测试集上的表现可以用一句话概括:轻量级打出了重量级的成绩。测试结果见表IV。
表IV IR275K 上与代表性超分方法的定量比较
表IV:IR275K 上与代表性超分方法的定量比较。CGMamba(三帧)在 33.19 dB PSNR 和 0.8720 SSIM 上领先,且参数量和 FLOPs 显著低于单帧红外方法(如 GPSMamba、IRSRMamba)。
相比单帧红外超分方法(GPSMamba、IRSRMamba),CGMamba 在 PSNR 上高出 0.35~0.52 dB,而计算量却低一个数量级。注意,GPSMamba 有 92.76M 参数和 1143.59G FLOPs,几乎是 CGMamba 的 10 倍,但精度反而更低。这就是“暴力堆砌” vs “精巧设计”的典型对比。
真正的惊喜来自于消融研究。表 II 和图 8 展示了一个关键发现:
表II 结构消融研究
表II:结构消融研究。Base 不含 2D RoPE 也不含 CGCM;+2D RoPE 只加 RoPE;+CGCM 只加 CCGM(但去掉 RoPE);Full Structure 两者都加。
图8 结构消融可视化。
图8:结构消融研究。(A)GT、完整结构、去掉 2D RoPE(即 +CGCM 变体)和去掉 CGCM(即 +2D RoPE 变体)的视觉对比。去掉 2D RoPE 的结果出现明显的网格状伪影。(B)绝对误差图,完整结构误差最低。
单独加 2D RoPE 几乎没用(32.49→32.47 dB),单独加 CGCM 反而暴跌到 30.96 dB 且产生严重网格伪影。两者结合却达到 33.19 dB。这一不对称现象直接证明了:在隐式融合中,空间锚定是跨帧门控稳定的先决条件。没有 2D RoPE 提供的坐标信息,中心帧的查询(Q)就不知道应该从邻近帧的哪些位置取值,导致信息混乱。
此外,网络深度分析(表 III 和图 9)表明,(3,3,3,3,3) 配置是精度-效率的最佳平衡点,继续加深到 (4,4,4,4,4) 只换来 0.34 dB 提升但 FLOPs 增加 26%,而 (5,5,5,5,5) 反而下降。
表III 网络深度对性能的影响
表III:网络深度对性能的影响。深度 (3,3,3,3,3) 达到最佳权衡。
图9 网络深度对重建性能和模型复杂度的影响。
图9:网络深度对重建性能和模型复杂度的影响。横轴为深度配置,左纵轴为 PSNR,右纵轴为 FLOPs。
最后一组定性对比(图10)展示了几组测试场景的重建结果和强度曲线。CGMamba 在热边界处恢复更锐利,噪声抑制也更干净。
图10 IR275K 测试场景上的定性对比。
图10:IR275K 测试场景上的定性对比。每行展示重建图像、放大 ROI 和沿标记线的强度剖面。CGMamba 在保持热边界和抑制噪声方面表现最佳。

开源资源与未来展望

IR275K 数据集和评测框架已全部开源,包括固定的序列级划分、生成的 LR 输入、评估脚本和所有对比模型的配置文件,确保每项结果可独立复现。代码地址:https://github.com/InfraRecon7/IR275K
未来方向包括:(1)引入真实传感器退化模型(探测器模糊、非均匀噪声、压缩伪影);(2)扩展指标体系,加入下游任务(如目标检测、变化检测)性能评估;(3)探索更高效的 SSM 变体以及跨模态融合。
龙哥觉得,这个基准的出现可能会带动一批红外多帧超分模型的“军备竞赛”,但前提是大家遵守共同规则。IR275K 的意义不在于 CGMamba 刷了多高,而在于它给这个领域立了一面可以照镜子的尺子。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

IR275K 和现有可见光基准(如 REDS、Vimeo-90K)最大的区别是什么?最大的区别在于划分策略和压力测试设计。可见光基准通常随机划分,模型容易“偷懒”——训练时见过的运气分布可能包含和测试相似的难度。IR275K 刻意让测试集更难(噪声更大、运动更大),专门暴露模型在红外真实部署中容易翻车的三种失败模式:弱对比-高噪声耦合、噪声域差异、大位移失效。这种“逆向思维”更贴近工程实践。

2D RoPE 和常用的绝对/相对位置编码有什么不同?2D RoPE 专门为 SSM(状态空间模型)设计,它将二维坐标信息通过旋转矩阵编码进 Mamba 的复杂旋转机制中,而不是像 Transformer 那样加到 token 嵌入上。这样做不破坏 SSM 的线性复杂度,同时保留了二维空间邻接关系。在热均匀的红外图像中,这种方法比标准位置编码更有效,因为内容本身缺乏区分度,必须依靠坐标来建立对应。

CGMamba 的参数量和 FLOPs 相比红外单帧方法(如 GPSMamba)低很多,为什么性能反而更好?核心原因有三:一是多帧引入了额外空间信息,单帧方法受限于退化程度;二是 CGMamba 的隐式融合避免了显式对齐的误差累积;三是 2D RoPE 和 CGCM 的组合让跨帧信息可以精准聚合,而不是像大模型那样通过大量参数暴力拟合。简单说就是“巧劲胜过蛮力”。不过也要注意,本文中的对比仅基于 IR275K 上的 4x 双三次下采样,如果换成更复杂的真实退化,优势可能会缩小。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

在基准构建层面开创性地引入“训练-测试难度偏移”设计,替代了传统随机划分;在模型层面提出了 2D RoPE + CGCM 的隐式融合 SSM 架构,两者均具有很强的原创性。降一星是因为整体思路(隐式融合 + 位置编码)并非完全新概念,但结合红外场景的工程适配非常扎实。

实验合理度:★★★★☆

消融实验设计清晰,对比了多种单帧红外方法,并展示了网格伪影的关键证据。稍显不足的是与多帧方法(如 DCUNet)的对比仅出现在论文中但表中未列出具体值,且对比的 SOTA 方法(如 GPSMamba)发表于 2025 年后,时效性好。但缺少与最新 Transformer 视频超分方法的对比(如 BasicVSR++),虽然红外场景下这些方法可能不适用,但加了会更全面。

学术研究价值:★★★★★

IR275K 填补了红外多帧超分领域标准化基准的空白,其划分策略可作为后续其他弱纹理/高噪声模态(如合成孔径雷达、热成像)基准设计的范本。CGMamba 的空间锚定发现对 SSM 架构在视觉任务中的应用有重要指导意义。

稳定性:★★★★☆

在 IR275K 的 stress test 下表现稳健,特别是在大位移和高噪声条件下。但当前退化仅使用双三次下采样,如果加入真实传感器噪声(如散粒噪声、非均匀校正残差),鲁棒性可能会下降。

适应性以及泛化能力:★★★☆☆

红外场景覆盖了海陆空城市四类,但数据全部来自公开公共数据集,对于极端环境(如南极、沙漠、火灾)可能缺乏代表性。多帧输入的帧数固定为 3 帧,对于长序列的可扩展性未验证。另外,模型在其他模态(如可见光、SAR)上的泛化能力未测试。

硬件需求及成本:★★★★★

CGMamba 仅有 10.9M 参数和 112.14G FLOPs,训练在 4 块 RTX 4090 上仅需不到 2 天(100k 迭代),推理时单帧处理速度快。与动辄几十上百亿 FLOPs 的单帧方法相比,堪称“绿色算法”。

复现难度:★★★★★

论文提供了完整的数据集、划分文件、评估脚本和所有对比模型的配置,代码在 GitHub 上已开源。任何具备基础 PyTorch 环境的研究者都可以在数小时内复现主要结果。

产品化成熟度:★★★☆☆

基准本身可直接用于评测,CGMamba 在小规模部署(星上或机载嵌入式设备)具备潜力,但仍需验证在真实传感器噪声下的表现。训练和推理需要 GPU,对于极端低功耗的卫星载荷可能需要进一步量化和剪枝。

可能的问题:评估仅使用双三次下采样作为退化模型,未包含真实传感器效应(斑点噪声、非均匀校正、光学模糊),导致评测结果可能夸大了方法在实际部署中的表现。此外,多帧输入的帧数固定为 3,对于帧数更多的视频序列是否可以进一步提升效果未探索。另外,对比实验中缺少与几种最新的 Mamba 视频超分方法(如 MamEVSR、FMSR)的直接对比,虽然这些方法并非红外专用,但可以作为多帧性能的参考。


主要参考文献

[1] J. Deng et al., "IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing," arXiv:2607.22380v1, 2026.
[2] A. Gu and T. Dao, "Mamba: Linear-time sequence modeling with selective state spaces," in COLM, 2024.
[3] Z. Wang et al., "Image quality assessment: from error visibility to structural similarity," IEEE TIP, 2004.
[4] J. Su et al., "RoFormer: Enhanced transformer with rotary position embedding," arXiv:2104.09864, 2021.
[5] T. Dao and A. Gu, "Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality," in ICML, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
夏天毕业季,也是红外卫星“火热的夏天”。IR275K给算法工程师送清凉,CGMamba四两拨千斤。想跟龙哥聊聊图像超分、Mamba应用,或者卫星遥感影像处理?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。