← 返回 PaperDaily 视觉与图像

Thermal-Det来了:零样本热成像检测,AP最高提升到0.372

热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。

Thermal-Det来了:零样本热成像检测,AP最高提升到0.372
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。


原论文信息如下:
论文标题:
Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection
发表日期:
2026年05月
发表单位:
Johns Hopkins University, Kitware, DEVCOM Army Research Laboratory
原文链接:
https://arxiv.org/pdf/2605.10130.pdf

🔥 热成像检测的“冷”知识:零样本开放词汇目标检测如何打破数据瓶颈?

热成像检测最尴尬的地方,不是“看不见”,而是“看见了也叫不出名字”。传统热成像模型通常只能认几类固定目标,比如行人、车辆,换个场景、换个类别就容易当场失忆。Thermal-Det 这篇论文的思路很直接:既然热成像标注贵、类别少,那就别死磕闭集检测,直接把开放词汇检测搬进热成像,让模型能听懂文字提示,自己去找“人”“车”“中心前方那辆车”这种更灵活的目标。
封面
图1:Thermal-Det 的封面示意。它想解决的不是“热成像能不能检测”,而是“热成像能不能像 RGB 开放词汇检测那样,听懂文字并识别陌生目标”。
这篇工作的关键词有三个:合成热成像数据语言引导跨模态蒸馏。说白了,就是先造一批“像热成像”的大规模训练样本,再用大语言模型补语言理解,最后把 RGB 老师的知识悄悄灌进热成像学生里。这个组合拳不花哨,但很实用。
先把结论说在前面:这不是那种“demo 很炫、落地很虚”的论文。它的提升来自一整套训练链路的重构,而不是单点小修小补。对热成像、安防、自动驾驶夜间感知、搜救等场景来说,这种“能用文字找目标”的能力,确实比只会认固定类别更值钱。

🛠️ 方法揭秘:合成数据 + LLM引导 + 跨模态蒸馏

Thermal-Det 的整体设计可以拆成一条很清楚的流水线:先用大规模合成热成像数据把模型“喂饱”,再用语言模块把语义对齐做细,最后用 RGB 教师把热成像学生往正确方向拽。它的底层逻辑其实很朴素:热成像标注太少,那就先借 RGB 世界的知识,再把知识迁移到热成像世界。
图2
图2:Thermal-Det 的整体框架。RGB 分支作为冻结教师,热成像分支负责学习;大语言模型负责生成场景级和目标级描述,推理时则会被丢弃,只保留真正干活的检测器。
第一步是造数据。论文把 GroundingCap-1M 转到热成像域里,形成超过一百万规模的合成热成像样本。这里的关键不是“把图变黑白”这么粗暴,而是用 F-ViTA 这类 RGB 到红外的图像翻译模型,把原图结构尽量保住,再复用原来的框和文本标注。这样做的好处很现实:不用重新人工标注,就能拿到带框、带 grounding 文本、还带详细 caption 的大训练集。
不过,RGB 世界里的 caption 直接搬到热成像里会有点尴尬。比如颜色词、光照词在热成像里基本没意义,所以论文做了一个轻量过滤,把“红色”“阳光”“阴影”这类 RGB 特征词删掉,保留对象类别、空间关系和场景上下文。这个操作看着简单,实际上很关键:它避免模型学到一堆和热成像无关的废话。
第二步是让模型真正“懂热成像”。论文在检测器里加入了 Thermal-Text Alignment Head,TTAH(热成像-文本对齐头)。它的作用很像“翻译腔校正器”:CLIP 的文本编码器本来更偏 RGB 语义,直接拿来配热成像,容易语义错位。TTAH 会给文本 embedding 加上热辐射属性向量,比如 hot、silhouette、reflective、high-emissivity 这类描述,再通过 MLP 和归一化映射到更适合热成像的文本空间。
公式:热成像文本对齐头
公式说明:tc* = LN(MLP([tc; aj]))。意思是把原始文本向量 tc 和热成像属性向量 aj 拼起来,再经过 MLP 和 LayerNorm,得到更适合热成像的文本表示。
为了避免这个文本校正“校过头”,论文还加了一个 drift 正则,约束校正后的文本向量不要离原始 CLIP 空间太远。这个设计挺务实:既要适配热成像,又不能把语言模型原本的语义能力洗没了。否则模型看起来像是懂了热成像,实际上把词义也一起弄丢了,那就很尴尬。
公式:TTAH总损失
公式说明:TTAH 的训练目标由对比损失和漂移约束组成。前者负责把热成像特征和文本对齐,后者负责防止语义空间跑偏。
第三步是跨模态蒸馏。这个部分是论文真正的“老江湖”操作:让一个冻结的 RGB 教师模型给热成像学生传知识。蒸馏不是只抄答案,而是抄三样东西:框的位置、语义特征、置信度分布。这样学生不仅知道“哪里有目标”,还知道“这个目标像什么”“老师有多确定”。
公式:跨模态蒸馏总损失
公式说明:LKD = LKD-box + LKD-sem + LKD-conf。也就是把几何位置、语义表示和置信度一起蒸馏,避免只学到“像个框”的粗糙结果。
公式:框蒸馏
公式说明:LKD-box = 1 - GIoU(Brgb, Bth)。这里用 GIoU 让热成像学生的框尽量贴近 RGB 教师的框,保证定位不飘。
公式:语义蒸馏
公式说明:LKD-sem 用对比学习方式把热成像特征 fth 和 RGB 特征 frgb 拉近。简单理解就是:老师看到的“这是车”,学生也要学会往“车”的方向靠。
公式:置信度蒸馏
公式说明:LKD-conf = KL(prgb ∥ pth)。它让学生学老师的“判断习惯”,尤其在热成像低对比、边界模糊时更有用。
第四步是把大语言模型也拉进来,但不是为了“聊天”,而是为了 caption 监督。LLM 接收检测器提取的视觉 token,生成场景级和目标级描述;训练时用 caption loss 约束,推理时把 LLM 扔掉,只保留检测器。这个设计很聪明:训练阶段让语言模型帮忙学语义,部署阶段又不背着大语言模型的算力包袱。
公式:caption损失
公式说明:Lcap = Lcap-scene + Lcap-object。前者管全局场景理解,后者管局部目标与文本的对应关系。
公式:总目标函数
公式说明:总损失 Ltotal 把检测、蒸馏、文本对齐和 caption 四部分一起优化。换句话说,这不是单兵作战,而是四路并进。
还有一个挺有意思的细节是 TTAH 里的“子类选择”。论文不是简单给每个类别一个文本向量,而是给类别扩展出多个热成像风格的子标签,比如“hot person”“silhouette vehicle”之类,再从中选最匹配当前热图的那个。这个做法有点像给同一个词准备几种“热成像口音”,让模型自己挑最顺耳的版本。
公式:子类文本生成
公式说明:tc,j* 表示类别 c 的第 j 个热成像子文本表示,后面会在多个候选里选最合适的那个。
公式:子类相似度
公式说明:sc,j = cos(fth, tc,j*)。热成像特征和每个子文本都算相似度,谁最像就用谁。
公式:最终文本选择
公式说明:最终会选出最匹配当前热成像场景的文本表示,避免一个死板的类别词硬套所有情况。

📊 实验结果:7个基准数据集全面领先

实验设置其实挺“狠”:训练时不靠人工热成像标注,主要依赖合成热成像数据和无标注 RGB-thermal 配对数据;测试时直接上真实红外基准,考验的就是零样本迁移到底能不能扛住。这样的设置很接近真实业务,因为现实里最缺的,往往就是热成像标注。
表1
表1:在 FLIR-Aligned、FLIR-V2、CAMEL 和 Utokyo 上的零样本检测结果。Thermal-Det 在多个指标上都超过了现有开放词汇检测器,尤其在 FLIR-V2 和 CAMEL 这类更难的数据集上优势更明显。
从表1能看出,Thermal-Det 不是靠某一个数据集“刷脸”,而是跨数据集都能稳住。比如在 FLIR-Aligned 上,它的 AP 和 AP50 都是最强一档;在 FLIR-V2 上,提升尤其明显,说明它对更难、更杂、更低对比的场景适应得更好;在 CAMEL 上,它也拿到了最优 AP,说明合成热成像数据加语言监督确实不是纸上谈兵。
图3
图3:Thermal-Det 在多个热成像基准上的零样本表现对比。可以直观看出,它对不同场景、不同传感器的泛化更稳,不是只会在某个测试集上“表演”。
表S1
表S1:SMOD、MFAD 和 LLVIP 上的零样本结果。补充实验进一步说明,这套方法不是只在主表里好看,而是在更多红外数据集上都能保持竞争力。
表2
表2:在 FLIR-Aligned 和 CAMEL 上,不同 RGB 开放词汇检测器作为教师骨干时的对比。结果显示,Thermal-Det 对不同教师骨干都有效,说明它不是“只认某一家模型”的定制方案。
这张表的价值在于验证“方法本身”而不是“某个 backbone 的运气”。不同 RGB 教师都能带来提升,其中 MM-GDINO 的相对增益很大,说明教师预训练数据越丰富,蒸馏信号越强;但最终论文选择 Grounding DINO 作为后续主干,是因为它的绝对表现最好。这个取舍比较合理,没玩文字游戏。
表3
表3:逐步加入各个模块后的消融结果。可以看到,caption 监督、TTAH 和跨模态蒸馏是互相补位的,不是“有一个就够了”。
消融结果最重要的信号有两个。第一,单纯增加 caption 监督能带来基础收益,但真正拉开差距的是 跨模态蒸馏TTAH,说明热成像问题的核心瓶颈确实在“语义对齐”和“域间迁移”。第二,多个模块叠加后提升更稳定,说明方法不是靠某个单点技巧撑门面,而是形成了闭环。
表4
表4:TTAH 内部子类选择策略的消融。这个表说明,热成像文本不是随便加几个修饰词就行,怎么选、选多少、怎么匹配都影响结果。
图S1
图S1:定性结果展示。可以看到,Thermal-Det 不仅能框出目标,还能更好地处理文字查询和位置引用类表达,这一点比很多“只会认类别名”的热成像模型强不少。
如果把这些结果串起来看,论文的提升路径很清楚:合成热成像数据解决“没数据”的问题,TTAH解决“文本不贴热成像”的问题,跨模态蒸馏解决“热成像学生不会抄老师”的问题,LLM caption 监督则负责把高层语义补齐。四件事各管一摊,合起来才像一个完整系统。

💡 核心创新点与潜在局限

这篇论文最值得肯定的地方,不是“把热成像做成了一个新任务”,而是它把开放词汇检测里最难落地的三件事一次性处理了:数据稀缺、语义错位、跨模态迁移。很多相关工作只解决其中一项,Thermal-Det 则是把三项同时往前推了一步。
它的第一个创新点是大规模合成热成像预训练。这一步把原本稀缺的热成像标注扩展到百万级,直接把训练规模拉起来了。第二个创新点是TTAH,它不是简单微调文本编码器,而是在文本侧引入热辐射属性,让语言空间更贴近热成像。第三个创新点是RGB 到热成像的冻结教师蒸馏,这让模型在没有热成像人工标注的情况下,仍能吃到开放词汇知识。
不过,这篇工作也不是没有边界。首先,合成热成像数据再像,终究还是合成数据,真实传感器噪声、极端天气、复杂遮挡这些因素,未必都能被 F-ViTA 一次性模拟好。其次,蒸馏依赖 RGB 侧教师的质量,如果教师本身在某些类别上就不稳,学生也会被带偏。再次,推理阶段虽然去掉了 LLM,但训练链路变长了,工程复杂度和算力成本都不低。
还有一个更现实的问题:开放词汇检测在热成像里虽然“能用”,但并不意味着所有类别都能稳。小目标、弱纹理、低对比场景仍然是硬骨头。论文自己也承认,在某些细粒度类别上,性能瓶颈更多来自传感器和尺度限制,而不是模型设计单独能解决的。

🔮 未来展望与思路启发

这篇论文给后续研究提供了一个很实用的方向:不要只盯着热成像的视觉特征,语言和跨模态知识同样重要。如果热成像数据少,那就想办法把语言监督、合成数据、教师蒸馏三者拼起来,而不是等着“神奇标注数据集”从天上掉下来。
对做论文的人来说,这篇工作的启发也很明确。第一,数据构造本身就是方法的一部分,不是附录里的配角。第二,语言空间的对齐在跨模态任务里往往比单纯堆模型层数更有效。第三,训练时复杂、推理时简单,通常比把大模型硬塞进部署链路更容易落地。
如果未来继续往前走,比较值得期待的方向有两个:一个是更逼真的热成像合成与域随机化,让合成数据和真实传感器差距更小;另一个是更轻量的语言对齐模块,让开放词汇热成像检测能在边缘设备上跑起来。毕竟,安防和车载场景不太会给你一台满配服务器慢慢想。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是热成像目标检测“只能认固定类别、不能听文字找目标”的问题。Thermal-Det 把开放词汇检测搬到热成像里,让模型能在没有热成像人工标注的情况下,依据文本提示识别新目标。

TTAH 是什么意思?为什么要加它?TTAH 是 Thermal-Text Alignment Head,中文可以理解为“热成像-文本对齐头”。它的作用是把原本偏 RGB 的文本 embedding 校正到更适合热成像的语义空间里,减少热成像视觉特征和文本之间的偏差。

这套方法为什么比直接拿 RGB 开放词汇检测器迁移更强?因为它不是直接硬迁移,而是做了三层适配:先用合成热成像数据补训练分布,再用 TTAH 做文本侧校正,最后用 RGB 教师蒸馏补语义和定位知识。三者一起上,才更像真正的热成像开放词汇检测。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把开放词汇检测、热成像适配、LLM 监督和跨模态蒸馏串成闭环,思路完整,且确实切中了热成像领域的痛点。

实验合理度:★★★★☆

训练不依赖热成像人工标注,测试覆盖 7 个真实红外基准,外加骨干和消融分析,整体实验设计比较扎实。

学术研究价值:★★★★☆

对热成像开放词汇检测是有明显研究价值的,尤其给“低标注、强迁移、强语义”的方向提供了可复用范式。

稳定性:★★★☆☆

思路是稳的,但合成数据和教师蒸馏都带有依赖项,换传感器、换极端环境时仍需再验证。

适应性以及泛化能力:★★★★☆

在多个热成像数据集上都能保持提升,说明泛化比常见的适配式方法更强,但小目标和细粒度类别仍有天花板。

硬件需求及成本:★★★☆☆

推理阶段还算友好,因为 LLM 被丢掉了;但训练阶段链路较重,合成数据、教师模型和多目标损失会抬高成本。

复现难度:★★★☆☆

方法框架清楚,但涉及合成数据构造、RGB-thermal 配对数据和多模块训练,复现门槛不算低。

产品化成熟度:★★★☆☆

在安防、夜间感知、搜救等场景有应用潜力,但要真正上车上边缘设备,还得继续压缩训练复杂度并验证极端环境鲁棒性。

可能的问题:创新链条完整,但对合成数据质量和教师模型依赖较强;小目标、低对比和极端场景仍是硬骨头,离“万能热成像检测器”还有距离。


主要参考文献

[1] Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel. Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection. arXiv:2605.10130, 2026.
[2] GroundingCap-1M, F-ViTA, Grounding DINO, LLMDet 等相关工作见论文正文与附录引用。

热成像看不清?那就让语言来帮忙“点名”。想看更多这类“少标注也能干活”的论文拆解,欢迎加入龙哥读论文粉丝群,一起聊检测、蒸馏、开放词汇和落地细节。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。