还在为TIR图像的顽固噪声挠头?星球每日无上限解读去噪、增强等AI领域前沿论文,附带开源代码速递与行业动态,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥导读:
当你把机器人放进一座没有灯光的漆黑走廊,绝大多数视觉传感器都会当场“罢工”,但热红外相机可以。只是,它拍出来的画面像蒙上了一层雪花点,还带着顽固的横条纹。首尔大学团队交出的这份答卷——TIDY,用一种极其优雅的方式把噪声“剥离”了出来,纯靠小波域的数学之美,让热成像实现了前所未有的清晰。
原论文信息如下:
热红外图像去噪新突破:小波域中的精准“清洁工”
小波域中的精准“清洁工”:核心设计
1. 小波编码器-解码器:模型使用离散小波变换(DWT)作为编码器,将输入图像分解成多个子带。然后在一个轻量级的去噪主干网络(NAFNet)中处理这些子带的系数。最后,再使用逆离散小波变换(IDWT)将处理后的系数重新组合成一幅干净的图像。这个设计就像把一幅大画,拆成几块小的拼图,分别清洁后再拼回去,大幅降低了计算量。
2. FiLM条件调控:直接在小波域操作,虽然提升了效率,但也可能丢失一些全局信息(比如墙角的小灯)。为了弥补这个不足,FiLM模块就像一个“精明的细节管家”,它从原始的噪声图像中提取全局信息,然后调制每个小波特征的通道,告诉网络“这里有个小细节,要好好保留哦”。
3. 针对热红外噪声的专属损失函数:这是TIDY最亮眼的地方。它提出了两个全新的指标,作为损失函数来指导模型学习。
小波熵(Wavelet Entropy,WE)
小波方向性条纹指数(Wavelet Directional Stripe Index,WDSI)
自建真实配对数据集SCaN-TIR
轻量级模型实现34Hz实时处理
下游任务提升显著:理论与实践的完美闭环
热惯性里程计(TIO):类似人的“导航”能力,让机器人知道自己走了多远、转了多少弯。从表II可以看出,将TIDY去噪后的图像输入给经典算法VINS-Mono,其轨迹估计误差(ATE,绝对轨迹误差,值越小越好)在多个场景下都降至最低,甚至打败了专门为此任务设计的深度学习模型DeepTIO。图7直观地展示了原因:噪声图像会误导算法提取大量固定于画面的噪声点作为特征,导致定位不准;而TIDY去噪后,算法能稳定地提取真正属于场景结构的特征。
单目深度估计(MDE):类似人的“看远看近”能力,判断物体离自己有多远。从图8和表III可以看出,直接从噪声图像中估计深度,预测的深度图非常不准确。而TIDY去噪后,深度图的清晰度和准确度都得到了质的飞跃,可以帮助机器人更好地理解三维空间。
龙迷三问
这篇论文主要解决了什么问题?TIDY旨在解决热红外图像在机器人部署中,特别是室内场景下,因严重随机噪声和固定模式噪声(条纹状FPN)导致的感知退化问题。它提出了一种轻量级的、基于小波域的去噪方法,能够在实时运行的条件下显著提升图像质量,最终改善下游任务(如里程计、深度估计)的性能。
小波熵和小波方向性条纹指数具体是什么,它们为什么能起作用?小波熵(WE)计算小波系数分布的混乱程度,随机噪声会让系数分布更随机,熵值更高,所以降低熵可以抑制随机噪声。小波方向性条纹指数(WDSI)则利用小波子带的方向性,水平和垂直子带系数在条纹存在时会产生不同的方差模式,通过惩罚这种不平衡,可以抑制条纹噪声。它们共同构成了一个完全针对热红外噪声特性的、物理可解释的损失函数。
TIDY为什么不用像UNet那样的全尺寸编解码结构,而是用小波域?传统UNet在像素空间操作,计算量大。TIDY通过小波变换将空间分辨率缩减为原来的1/4,这使得后续的NAFNet主干网络的计算复杂度降低了约4倍(理论计算),从而实现了34Hz的高帧率。同时配合FiLM模块弥补下采样带来的信息损失,做到了效率与性能的兼得。
龙哥点评
论文创新性分数:★★★★✰
ZZZ: 将小波域与专门为热红外噪声设计的损失函数结合,并构建了首个真实配对数据集,创新性很高,但核心网络结构是基于已有的NAFNet,不是完全从零造轮子。实验合理度:★★★★★
ZZZ: 非常合理。在合成和真实噪声上做了全面对比,零样本测试也充分证明了泛化能力,下游任务验证更是锦上添花,对比基准都是近年最新或最相关的方法。学术研究价值:★★★★✰
ZZZ: 为热红外去噪提供了一个高效且鲁棒的新范式,其提出的可度量的噪声指标和真实数据集,对后续研究有重要启发和推动作用。稳定性:★★★★✰
ZZZ: 在多个不同数据集和噪声水平下表现稳定,但在极端恶劣、传感器损坏的情况下可能仍会面临挑战。适应性以及泛化能力:★★★✰✰
ZZZ: 论文展示了很强的跨场景零样本泛化能力,但其对非热红外领域的噪声(如可见光相机的变种噪声)的适用性未经检验,目前认为是专门为热红外噪声定制的方法。硬件需求及成本:★★★★✰
ZZZ: 非常低。仅需一块RTX 4090训练4小时,推理时34Hz的帧率也使得在嵌入式设备(如Jetson系列)上运行成为可能,成本可控。不过训练仍需要GPU,略微扣一星。复现难度:★★★★★
ZZZ: 极低。论文作者已开源代码和核心数据集SCaN-TIR,复现门槛基本为零。产品化成熟度:★★★✰✰
ZZZ: 已具备很高的产品化潜力,但距离“即插即用”的产品还有一段距离。主要限制是它需要针对特定相机型号和噪声水平进行微调,且未考虑时间维度的一致性。可能的问题:虽然方法非常出色,但可能会被批评为“工程味”较重,核心创新在于损失函数和数据集,而非模型架构。另外,WDSI和WE的权重(0.2和0.4)是通过实验确定的,在不同场景下是否最优还有待验证。此外,当时间维度的噪声模式变化较快时,纯帧级去噪可能不是最优解。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!