← 返回 PaperDaily 视觉与图像

UC San Diego最新实测:AI超分热成像三维重建,清晰度暴涨却更“不准”?

每次去佛罗伦萨,游客都在仰头看大卫像,而真正的“老司机”却在用热成像扫墙面。UC San Diego团队在千年凉廊上做了一场“硬核实验”:把AI超分拉来重建三维热像模型,结果耐人寻味——

UC San Diego最新实测:AI超分热成像三维重建,清晰度暴涨却更“不准”?
原论文信息如下:
论文标题:
Loggia dei Lanzi: AI Thermography Enhancement Comparisons through 3D Photogrammetry
发表日期: 2026年08月(预印本,投稿CHCD 2026)
发表单位: 加州大学圣迭戈分校文化遗迹工程计划(UC San Diego / Cultural Heritage Engineering Initiative, CHEI)等
原文链接: https://arxiv.org/pdf/2608.02404v1.pdf
开源代码链接: https://github.com/smcavoy12/3d_thermography_chdc
开源数据集链接: https://doi.org/10.34946/D66S3Q(Loggia dei Lanzi热成像数据集)及 https://doi.org/10.34946/D6W0(Palazzo Vecchio激光扫描参考数据集)
项目链接: https://doi.org/10.34946/D66S3Q(OpenHeritage3D在线交互3D查看器)
在佛罗伦萨领主广场,游客的目光总被大卫像吸引,极少有人注意南侧那座始建于14世纪的兰奇凉廊。这座历经数百年改造的开放式建筑,墙壁里藏着许多未载入史册的“秘密”。2025年12月的一个寒夜,加州大学圣迭戈分校文化遗迹工程计划(CHEI)团队用FLIR T1020 HD热像仪对凉廊后墙进行扫描,随后用多种AI超分模型对热像图进行增强,再放入三维重建流程中比拼。一场关于“清晰度”与“真实性”的较量就此展开。
封面图:兰奇凉廊热成像三维重建与AI增强对比研究
封面图:兰奇凉廊热成像三维重建与AI增强对比研究

热成像遇上AI超分:千年古建筑的“透视”之争

这项研究并非传统意义上的“AI顶会刷榜文”,但它做了一件有趣的事:把计算机视觉中最热门的AI图像超分辨率(Super-Resolution, SR)技术,拉进文化遗产热成像(IRT)三维重建的现场,与相机厂商自带硬件超分方案正面对决。论文标题很长,核心问题却一句话能说清:AI把热像图“放大变清晰”,到底是让模型看到了更多细节,还是只是在用幻觉填像素?
这个问题在自然图像上可能只是“好不好看”的差别,但在文化遗产保护中却极其严肃。热像仪记录的是物体表面温度分布,隐藏在灰泥层下的砖石砌体、被封堵的旧门窗,会因热导率差异在墙面形成微小温度梯度。这些梯度往往只有零点几度,却如实记录着建筑数百年的“体温病史”。如果把AI超分当作诊断工具,它“脑补”出的每一根纹理线,都可能被后人误读为真实结构信息——这对文物保护来说,不是锦上添花,而是误导性证据。
图1:19世纪末兰奇凉廊的历史照片(来源:Fratelli Alinari档案馆)
图1:19世纪末兰奇凉廊的历史照片(来源:Fratelli Alinari档案馆)

从兰奇凉廊说起:一座中世纪地标的热像密码

兰奇凉廊坐落在佛罗伦萨领主广场南侧,始建于1374年,曾是共和国举办官方仪式的“城市舞台”。建筑史学家Carl Frey在1885年依据付款记录还原了其建造过程[1],但书面记录无法回答“墙里面还有什么”。
热成像技术(IRT)的底层逻辑并不复杂。任何温度高于绝对零度的物体都在辐射红外线,热像仪将其转换为温度图。冬季是进行被动热成像调查的黄金窗口,因为室内外温差越大,隐藏结构的“热签名”就越明显[3]。Lehmann等人已证实稳态热成像可可靠定位历史砌体中被封堵的门窗[4]
在佛罗伦萨,热成像的“祖师爷”是Maurizio Seracini,他早在20世纪60年代末就开创了用多光谱成像分析艺术品的先河,并曾在旧宫五百人大厅用热像仪发现隐藏在墙内的旧窗户[9]。这条技术路线后来延伸到了增强现实(AR)领域[10,11]。本次研究使用的FLIR T1020 HD热像仪,传感器分辨率1024×768,热灵敏度优于20mK,配合14mm镜头可捕捉墙面上细微到0.02°C的温度差异。
图2a:兰奇凉廊可见光全景拼接 图2b:兰奇凉廊热红外全景拼接,可见墙体中隐藏的建筑结构
图2:兰奇凉廊可见光全景拼接(a)与热红外全景拼接(b),热像图中可以清晰地看到隐藏在灰泥层下的建筑结构
团队于2025年12月6日晚间执行热像采集,现场环境温度约11°C,湿度43%。他们用三脚架架设四个站点,以松开云台锁钮的方式保留微小抖动空间,共采集161张带辐射定标数据的热像原片。这些16位单通道TIFF格式的温度矩阵,每一像素都对应真实温度测量值,是可用于定量测温的物理量。
图3:全部原生热像输入的三维正射镶嵌图,展示兰奇凉廊后墙
图3:所有原生热像输入拼接成的三维正射镶嵌图,完整展示了兰奇凉廊后墙的热分布

六层级对决:硬件微扫描vs AI超分辨率的硬核评测

评测的“参赛选手”共有六位,覆盖从硬件到软件、从传统插值到生成式模型的完整光谱。它们共享同一组161张热像原图,输出分辨率各不相同,目的就是让数据自己回答:超分带来的额外像素,有多少能转化为三维重建中真正可用的几何信息?
第一档是原生分辨率(Native),即传感器直接输出的1024×768图像,作为所有比较的基准线。第二档是FLIR UltraMax,利用相机内部硬件微扫描机制,在不到一秒内连续采集16帧存在亚像素位移的图像,最终输出2048×1536像素、线性分辨率翻倍的热像图[14,15,16,18]。与实验室用压电陶瓷精确控制位移不同,UltraMax依赖手持拍摄时人手的微震颤产生亚像素偏移,位移量事后估算。厂商声称不会丢失辐射定标数据,但此前无独立研究量化过它到底恢复了多少真实信息——本论文是第一个。
第三档是双三次插值(Bicubic),将原生图像用数学插值放大到2048×1536。这个方法不包含任何新信息,但可作为完美的“安慰剂”对照组:如果某个AI模型的效果并不比双三次插值强,那就说明它并未真正理解热像内容,只是在用更复杂的方式做平滑。
第四档是SwinIR,基于Swin Transformer架构的经典图像复原模型[22]。研究者有意不做任何热像微调,直接拿预训练权重跑推理,测试“开箱即用”的通用模型在热像上的表现。第五档是DifIISR,来自CVPR 2025的扩散模型,专门为红外图像超分设计,具备热谱分布约束机制[25]。扩散模型本质上是生成式模型,其输出细节理论上可能不是真实测得的辐射信息,而是模型“猜测”出的高频纹理。第六档是TongJi-SR(又称DRCT),基于密集残差连接Transformer架构,在热像数据上微调过,拿下了2025年CVPR PBVS研讨会第六届热像超分挑战赛Track 1冠军[23,24]
原生分辨率1024×768
原生热像输出分辨率:1024×768
UltraMax输出分辨率2048×1536
UltraMax硬件微扫描输出分辨率:2048×1536
整个评测的实验设计相当克制且严谨。所有六组数据都经过完全相同的运动恢复结构(SfM)流程,在Agisoft Metashape Professional(v2.2)中完成匹配与重建。为确保唯一变量是图像内容,团队将每张照片的相机外参直接锁定为LiDAR参考坐标系下预先解算好的固定值,不允许SfM在不同档位间重新估算相机位置;相机内参按分辨率比例缩放后固定不变,畸变系数作为无量纲参数原样传递。这样一来,任何图像内容造成的差异,都不会被相机标定漂移所掩盖。
另一个精妙设计在于地面采样距离(GSD)的处理。六档图像分辨率从1×到8×不等,而重投影误差这种像素度量在不同分辨率下完全不可比。团队没有直接采用软件反算的GSD值,而是结合固定相机位姿、焦距和目标物距,从成像几何上直接推导出物理尺度下的换算关系:原生分辨率GSD为8.75毫米/像素,此后每提升一倍线性分辨率就减半。所有像素域的重投影误差经由此换算为墙面上真实的毫米误差后再做比较。同时,重建不确定性(RU)作为纯几何量纲的比值,不受分辨率影响,被选为核心质量判别指标。
还有一个容易忽略但很重要的细节:团队坚持让每个模型在其原生输出分辨率下参与评测,而不是把所有档位都降采样到同一分辨率。如果所有AI超分结果被强行拉回2×分辨率,相当于对高频信息做了一次低通滤波,恰好把需要检验的“AI合成的细节”给抹掉了。各档位分辨率的差异通过GSD物理归一化来化解,同时用与分辨率无关的RU指标兜底。这一设计既严谨又聪明。

关键发现:为什么“更清晰”不等于“更准确”?

实验中全部六档图像都经由同一个149张图像的公共匹配网络处理(161张采集图像中,各档能成功对齐的数量从154到159张不等,最后取六档交集的公共子集149张),保证对比完全基于同一网络结构。最终主实验结果如下表所示:
*表格超出部分左右可以滑动
档位 分辨率 匹配点数 平均观测数/点 重投影误差(px) 重投影误差(mm) RU>100占比 ≥3张图像观测占比
Native1024×76822,5503.481.8516.20.0%45.5%
UltraMax2048×153620,6603.414.2818.77.8%42.7%
Bicubic2048×153619,4842.873.8817.041.0%32.0%
SwinIR2048×153623,2303.244.2618.629.2%39.7%
DifIISR4096×307215,9443.0512.0026.233.4%35.1%
TongJi8192×61449,3302.8520.2022.121.9%32.5%
表1:六档分辨率在公共149张图像匹配网络下的摄影测量指标对比(重投影误差同时给出像素值与经GSD换算后的墙面毫米值;RU为重建不确定性,表中为超过阈值100的匹配点占比)
解读这组数据,有几个值得注意的现象。首先,原生分辨率图像在几何精度上全面获胜:归一化重投影误差仅为16.2毫米,重建不确定性超过100的匹配点占比为0.0%,跨视角一致性(被至少3张图像同时观测到的匹配点比例)达到最高的45.5%。换句话说,热像仪直出的原始图像虽然“看起来不够清晰”,但每一个匹配点都真实可靠,三维重建的点云质量最高。
其次,AI超分生成的大量细节在多视角验证下“露馅”了。SwinIR虽然产出了最多的匹配点数量(23,230个),但归一化重投影误差(18.6毫米)明显比原生更差,RU>100的占比也达到29.2%——这说明它新增的匹配点里有相当一部分在不同视角下无法自洽地对应到同一物理位置。DifIISR和TongJi的结果更说明问题:前者归一化重投影误差高达26.2毫米,是六档中最差的;后者在原始像素误差上看似乎很糟糕(20.2像素),但经过GSD换算到物理尺度后反而优于DifIISR(22.1毫米对26.2毫米)。生成式模型“脑补”出来的纹理细节在单张图片上或许赏心悦目,但在严格的多视角三角化校验下,这些细节并不具备真实的几何一致性。
第三个反直觉的发现来自UltraMax。作为硬件级多帧微扫描方案,UltraMax的表现并没有厂商宣传中那么惊艳。它的匹配点数(20,660个)反而比原生档少了约8%,归一化重投影误差(18.7毫米)也略高于原生,RU>100的占比为7.8%。考虑到UltraMax依赖手持微震颤来产生亚像素位移,而本次实验为了保持站点稳定性采用了三脚架松云台的折中方案,这种相对保守的运动幅度可能导致位移估计质量不如正常手持拍摄。但无论如何,这是学术界第一次独立评估UltraMax在热像三维重建中的真实增益,结论是:它并没有比原生分辨率提供更多可靠的几何信息。
至于双三次插值这一“安慰剂”档位,它的表现非常有意思:归一化重投影误差(17.0毫米)居然优于UltraMax(18.7毫米)和所有AI模型,但RU>100占比达到41.0%,匹配点数也较少。这说明单纯增加像素数量确实能带来一部分几何精度的“虚假提升”,但这部分提升完全经不起重建不确定性的推敲。这个对照实验的价值在于:它清晰地展示了“像素多”和“信息真”是两回事。
研究人员还发现了一个有趣的现象:在原生分辨率档位下,有45.5%的匹配点可以被3张以上图像同时观测到,而经过任何增强手段处理后的档位,这一比例都出现下降,其中SwinIR的比例为39.7%,UltraMax为42.7%,双三次插值和TongJi均为32%左右。这表明增强处理不仅没有帮助特征点“更稳定”,反而让它们在不同视角下的匹配更加涣散。一个合理推测是:超分过程(无论硬件还是AI)都会引入插值或生成的高频噪声,这些噪声在各个视角中的表现形式并不一致,导致匹配算法被“虚假细节”干扰,反而丢失了原本可以在低分辨率下稳定匹配的真实纹理。
论文的核心结论可以浓缩为一句话:在热像SfM三维重建中,超分辨率技术——无论硬件还是AI——都未能带来可靠几何信息的净增益。AI超分在单帧图像的视觉质量评估(如PSNR、SSIM)上或许表现优异,但一旦进入多视角几何一致性验证,生成的高频细节就暴露出其“幻觉”本质。这为热像超分领域的研究者提了一个醒:仅用峰值信噪比(PSNR)、结构相似性(SSIM)这类单帧图像质量指标来评价超分模型,在文化遗产保护这种对真实性要求极高的场景里,可能远远不够。
speechless
看到这里,可能有人会觉得:那是不是说AI超分在文化遗产数字化里就完全没用?倒也不能一概而论。论文讨论了一个重要的边界条件——本次评测的输入是FLIR T1020 HD这种科研级热像仪拍摄的高质量16位辐射热像图。而当前大多数热像超分模型,例如PBVS挑战赛所采用的FLIR Tau2(640×480,8位)数据,来自安防监控级别的非制冷热像传感器,原始画质差得多。对于低端传感器采集的模糊热像,AI超分能否在三维重建中带来实际增益,仍是尚未回答的问题。另一个值得关注的方向是:热像超分在单帧观测中提取的纹理信息,是否可以辅助验证隐藏结构的平面范围(即便它无法提升三维几何精度)。例如,在本次热像调查中发现的被封堵门窗和材料交界区域,SwinIR增强图像虽然未能产出更多可靠匹配点,但其视觉纹理增强效果对人工判读建筑结构的分布仍然具有参考意义。

文化遗产数字化的未来:XR与开放数据的延伸

这项研究除了方法论层面的贡献,另一个值得点赞的动作是开放数据。全部热像原始数据(含16位辐射温度矩阵)、三维点云模型和LiDAR参考扫描都公开在OpenHeritage3D平台上,采用知识共享许可协议发布。UC San Diego团队甚至把处理流程中的每一个环节——超分包装脚本、Metashape匹配点导出插件、分析统计代码——都放在了公开代码仓库里。这意味着任何人都可以复核他们的数据、重现他们的实验,甚至拿他们发布的16位热像数据去测试新的超分模型。
研究的延伸也不止步于论文本身。团队将热像点云模型集成到了ARtifact扩展现实(XR)应用程序中——这是一款面向移动设备的增强现实系统,从最早的平板电脑原型[10]发展到如今覆盖佛罗伦萨全市历史建筑的城市级实现[11]。游客在兰奇凉廊前举起手机,屏幕上的建筑表面就能叠加显示热像图,原本肉眼不可见的历史结构在AR中“浮”出来。这种体验对公众理解建筑遗产的“看不见的历史”具有极强的感染力。
从行业层面看,这项研究与近来热门的“AI for Science”潮流的交汇点在于:AI模型必须尊重物理测量数据的真实性边界。在文化遗产领域,伪造的细节不只是技术瑕疵,更是对历史证据的污染。当有一天算法生成的“伪结构”被当作真实历史信息写入保护档案,那将对后续研究造成难以估量的混乱。本文用严谨的实验展示了这种风险的现实存在,也为后续如何规范AI增强技术在文物保护中的应用提供了一个很好的基准。

专家点评:这项研究的价值、局限与启示

从研究价值来看,这篇论文最大的贡献并非提出了一种新的超分算法,而是为“热像超分+摄影测量”这一交叉地带建立了第一个标准化的评测范式。它巧妙地将GSD归一化和多视角一致性检验结合起来,把超分效果的评价从单帧图像空间推向了三维几何空间。在目前热像超分领域普遍沿用PSNR/SSIM指标衡量模型性能的背景下,这个评测框架为后续研究提供了重要的参考基准。
研究的局限性也同样明显。首先,实验场景只有一座建筑、一个夜间时刻、一种拍摄距离,样本量相对有限。其次,UltraMax在三脚架松云台条件下的微震颤可能与正常手持条件下的表现存在差异,这为UltraMax在本次评测中“表现平平”保留了一丝解释余地。再者,所有AI超分模型都是在通用算力(一张RTX 4090)上离线的,模型运行耗时和内存开销并未详细报告。未来若有研究将单帧超分与SfM匹配点生成做端到端联合优化,或者将热像超分模型直接在多视角一致性目标下训练,这一领域的天花板可能会被进一步推高。另外,AI超分对于低分辨率/低比特深度热像传感器的重建增益效果,仍然值得探索——毕竟PBVS挑战赛的夺冠架构在8位监控级热像上确实展现了可观的视觉增益,这种增益在三维几何层面有多大价值,目前还没有定论。
更值得深思的是产业层面的启示。当前热像仪厂商(包括FLIR)都在相机中内置了类似UltraMax的超分增强功能,但如果这类增强的收益在三维重建任务中无法转化为可靠的几何信息,那么对于摄影测量用户而言,这项功能的价值就值得重新评估。对AI超分工具的使用者来说,这篇论文的核心信息是:
当超分图像被用于定量测量时,请务必做多视角几何一致性检验;当超分图像只用于人眼判读时,请明确标注哪些细节是AI生成的,避免误导后续的研究者。

龙迷三问

下面是龙哥对大家可能有的几个问题的解答:

Q1:UltraMax微扫描超分到底是什么原理?为什么它能从16张图中恢复到2048×1536?UltraMax的核心是利用图像传感器与光学系统之间亚像素级别的相对位移,在多个采样相位上对同一场景进行多次采集。由于热成像焦平面阵列相对其光学分辨率通常欠采样,高于探测器奈奎斯特(Nyquist)频率的空间频率会混叠到低频中,造成信息丢失。微扫描通过获取不同亚像素相位的多帧图像,将这些信息重新配准到更细的网格上,从而恢复出单帧无法记录的高频细节。FLIR T1020 HD的UltraMax功能在不到1秒内采集16帧,经过内部重建软件输出线性分辨率翻倍、像素数变为4倍的图像。这种恢复出来的细节是实际测量得到的,而非模型“猜测”的。

Q2:什么是SfM三维重建?跟普通的三维扫描有什么区别?SfM(Structure-from-Motion)即运动恢复结构,是摄影测量领域的经典技术:从多个视角拍摄的重叠照片中自动检测特征点(本文使用SIFT算法),通过特征匹配确定同一物理点在多张图像中的投影位置,再利用三角化原理反推出该点的三维空间坐标。多视角观测越多、匹配越精确,重建点的位置就越可靠。与LiDAR激光扫描直接测量深度不同,SfM不需要主动发射激光,只需要被动图像,而且能够附带丰富的纹理信息。本研究中,团队先用LiDAR标定相机位置,再让SfM在固定相机位姿下做特征匹配,这样就能精准评估各档位图像带来的重建质量差异。

Q3:为什么说一项纯“负面结论”的研究也有价值?在科研体系中,证实一个假设固然重要,证伪一个被广泛接受的假设同样具有不可替代的价值。在AI超分社区,模型作者常常只报告PSNR/SSIM这类单帧质量指标,很容易让人误以为更清晰就等于更真实。本文通过严谨的多视角几何验证,证伪了“超分增强能提升热像三维重建精度”这一隐含假设,相当于给行业踩了一脚刹车。这种结论对实际工程选型(比如文物保护单位是否要为UltraMax功能支付高额溢价)有直接的决策参考价值。同时,公开数据和代码为后续研究提供了公共基准,所有做热像超分的研究者都可以用这个数据集来检验自己的模型是否真正提升了三维重建的几何可靠性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

选题交叉方向有开创性,首次对硬件微扫描与AI超分在热像三维重建中的效果做了独立对比,但方法论本身大都沿用成熟框架,创新更在于评测视角而非新算法。

实验合理度:★★★★☆

实验设计非常严谨,固定相机位姿、固定内参、GSD解析归一化、公共图像子集筛选,都体现了很高的方法论水平。扣一星是因为UltraMax的测试条件(三脚架松云台)与其设计使用场景(手持微震颤)存在偏差,且单一建筑单一时段的样本量有限。

学术研究价值:★★★★☆

这项研究为热像超分领域建立了一个新的评价范式,把“超分是否有效”从单帧视觉质量拉高到多视角几何一致性的维度,对未来工作有很强的启发性。加上公开数据集便于所有人进行后续对照实验,学术价值值得肯定。

稳定性:★★★★☆

在热像SfM三维重建任务中,原生图像表现出了最高的一致性和最低的重建不确定性,结论的指向非常清晰。AI超分档位的重建不确定性普遍上升,其对特征匹配稳定性的负面影响在不同模型间具有一致性表现。

适应性以及泛化能力:★★★☆☆

结论基于单一建筑、单一环境条件、单一热像仪型号得出,扩展到其他建筑类型、其他环境温度条件和不同传感器时,具体数值可能发生变化。对于低分辨率监控级热像传感器,AI超分的增益效果可能有所不同,需要更多跨场景实验验证。

硬件需求及成本:★★★★☆

推理侧全部AI模型在单张RTX 4090上即可运行,算力门槛不高;FLIR T1020 HD属高端科研热像仪(报价通常在几万美元级别),对于普通文物保护单位而言成本偏高,但对行业级用户来说属于场地常规投入。

复现难度:★★★★★

全部数据、代码、处理脚本和参数配置均已公开,模型使用公开预训练权重或已有开源实现,复现链条非常完整,几乎不存在“看不清细节”导致无法重复的问题。

产品化成熟度:★★★☆☆

热像三维重建本身已具备一定的工程成熟度,但本研究结论表明当前AI超分模型不能直接用于提升热像重建的几何精度。对于依赖三维测量的文保项目,建议采用原始分辨率数据;若将超分图像用于人工判读或展示,需要额外标注AI生成内容。

可能的问题:论文未报告AI超分模型的运行耗时与内存开销,且实验仅在单一建筑和单一夜间环境进行;UltraMax在非理想使用条件下得到的负向结果,是否代表其真实水平仍待进一步验证。


主要参考文献

[1] C. Frey, Die Loggia dei Lanzi zu Florenz, Berlin, 1885.
[2] Infrared thermography (IRT) 在文化遗产科学中的非破坏性检测综述,见原文引用文献。
[3] F. Lehmann et al., 冬季稳态热红外成像定位历史砌体墙中封堵门窗的研究。
[4] M. Seracini 等人关于多光谱成像与诊断技术应用于艺术品的开创性工作。
[5] FLIR Systems, FLIR T1020 HD 用户手册及 UltraMax 技术说明。
[6] J. Liang et al., SwinIR: Image Restoration Using Swin Transformer, ICCVW 2021.
[7] B. Li et al., DifIISR: 面向红外图像超分辨率的扩散模型,CVPR 2025.
[8] C. Hsu et al., DRCT: Dense-Residual-Connected Transformer,PBVS 2025热像超分挑战赛Track 1第一名方案。
论文原链接:https://arxiv.org/pdf/2608.02404v1.pdf
开源数据平台:OpenHeritage3D(https://doi.org/10.34946/D66S3Q)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球