← 返回 PaperDaily
视觉与图像
遥感分割的黑盒难题,被熵中心XAI破解了?
深度模型在遥感分割里跑得欢,可它凭什么这么分?黑盒不拆,谁敢拿去搞灾情评估和土地利用监测?本文提出熵中心XAI方法,用熵不确定性给分割模型的决策画热力图,还顺手设计了一个H-SIT评估框架揪出“假重要区域”,在WHU数据集上把Grad-CAM、Score-CAM和Seg-Sobol都甩在身后,值得一读。
龙哥读论文
发布于 2026-08-30 00:20:01
阅读 5
查看原文
原论文信息如下:
AI黑盒困境:遥感图像分割为何需要可解释性?
先来聊一个让遥感行业头疼的老问题:深度学习模型在图像分割任务上跑得飞快,像素级的分割结果看着也漂亮,但模型到底凭什么把这块区域划成建筑物、把那片地划成植被?没人说得清。
这在很多关键领域是个大问题。比如利用遥感影像做土地利用监测、环境评估或者灾害管理时,AI模型给出的分割结果直接影响决策方向。如果模型犯了错,而人类又无法追溯它犯错的原因,那么再高的准确率也很难让人放心采用。说白了,黑盒模型在遥感这种"一步错可能步步错"的场景里,信任门槛比普通图像任务高出好几个数量级。
可解释人工智能(Explainable AI, XAI)就是干这个的。它试图打开黑盒,把模型的注意力区域用热力图等方式呈现给人类看。不过,目前XAI在图像分类任务上已经比较成熟,但扩展语义分割任务上却进展缓慢。原因也不难理解:分类是对整张图输出一个标签,解释逻辑相对简单;分割则是逐像素输出标签,像素之间、区域之间存在强烈的空间相关性,一张热力图要同时表达"模型关注了哪里"和"模型为何如此划分边界",难度不是一个量级。
目前主流的XAI方法大致分成两条路线:一类是基于梯度(Gradient-based) 的方法,比如Grad-CAM,它利用网络反向传播的梯度信息来生成热力图;另一类是基于采样(Sampling-based) 的方法,它把模型当作黑盒,通过系统性地扰动输入图像的不同区域,观察模型输出的变化来推测哪些区域对决策更重要。本文要介绍的,正是把采样方法和熵不确定性 结合起来。这篇论文由黎巴嫩大学、巴黎东克雷泰伊大学(UPEC)以及黎巴嫩国家遥感中心的研究者共同完成,针对遥感图像语义分割提出了一种全新的XAI方法——Entropy-Centric(熵中心XAI) 。
熵中心XAI:从不确定性视角解释模型决策
要理解熵中心方法,得先知道它的灵感来源——Sobol灵敏度分析。Sobol指数是一种基于方差的全局敏感性分析方法,用来衡量每个输入变量对模型输出方差的贡献程度。简单来说,就是"哪个输入一改变,输出波动最大,哪个输入就最重要"。
对于输入特征 x = {x₁, ..., xₙ},模型输出 f(x) 的总方差 D 可以分解为各个输入变量的主效应和交互效应之和:
传统的Sobol指数计算需要海量的模型推理,对于图像这种高维输入简直是灾难。于是Fel等人在NeurIPS 2021上提出了高效的黑盒解释方法,引入Jansen估计器来加速计算,其核心公式如下:
不过,直接把Sobol方法搬到图像分割上并不顺手。Sobol关注的是输出数值的方差变化,而分割模型的输出是一张空间概率图,单纯看数值方差很难和"模型是否真正依赖这片区域"画上等号。本文的切入点是:从熵的角度衡量扰动带来的不确定性变化 。
核心原理:熵中心XAI的工作流程
在信息论里,熵用来衡量一个概率分布的不确定性。对于二分类问题而言,当模型对某个像素预测正类的概率pₖ接近0.5时,熵最大,说明模型最"纠结";而当pₖ接近0或1时,熵很小,说明模型很有把握。本文提出的方法正是利用这个特性,对每个像素计算二元熵:
相比Sobol灵敏度方法关注"输出方差"的变化,熵中心方法关注的是"预测不确定性"的变化。这个区别很微妙,但很重要:方差大不意味着模型不自信,可能只是数值在合理范围内波动;而熵的上升则直接反映模型对预测结果越来越没底。对于分割任务来说,"模型哪里变得不确定"往往比"模型哪里输出波动大"更能揭示决策的关键依据。
另外值得强调的是,熵中心方法完全在黑盒条件下运行 。它不读取模型的梯度、不关心特征图的内部结构,只需要模型的输入输出接口。这意味着无论分割模型是U-Net、DeepLab还是Swin Transformer,只要给模型喂一张图和输出分割概率图,这个方法就能用。
H-SIT评估框架:识别虚假高显著性区域的新方法
提出一个新XAI方法只是第一步,还有一个更棘手的问题:怎么客观评估一个热力图到底好不好?如果热力图把模型真正依赖的区域全标亮了,那就是好图;如果热力图标得很热闹,但模型根本不看那些地方,那就是误导。近两年有不少XAI评估方法被提出,尤其是在遥感影像分割领域,Gizzini等人之前提出了一个评估方法——低显著性无关性测试(Low-Salience Irrelevance Test, L-SIT) 。
L-SIT的思路是:将热力图中得分低于某个阈值的区域(即模型认为不重要的区域)从图像中移除,然后观察模型性能的变化。如果性能几乎没有下降,说明低显著性区域确实无关紧要,热力图对"不重要的区域"的判断是对的:
但L-SIT有一个盲区:它只能验证"低显著性区域是否真的无关",却无法验证"高显著性区域是否真的重要"。设想一种糟糕的热力图:模型明明只依赖建筑物周围的一小圈阴影,热力图却把远处的停车场也标成了亮红色。L-SIT拿这种热力图没辙,因为远远超出目标的高亮区域根本不在测试范围内。
为了补上这个漏洞,本文提出了一种新的评估方法——高显著性影响测试(High-Salience Influence Test, H-SIT) 。H-SIT的思路刚好反过来:保留目标对象和"不重要的区域",把目标对象之外的高显著性区域抹掉:
配合L-SIT和H-SIT,本文提出了三项评估指标:预测置信度下降程度、IoU(Intersection over Union,交并比,衡量预测分割区域与真实标注重叠程度)下降程度,以及目标区域熵值的上升程度。一个优秀的热力图应该在L-SIT测试中让模型性能几乎不变(说明低显著性区域确实是无关的),同时在H-SIT测试中让模型性能大幅恶化(说明高显著性区域确实关键)。整个评估框架如下图所示:
实验结果:熵中心方法如何超越现有XAI方法
论文的实验设置相当干净利落。数据集采用WHU建筑足迹分割数据集,该数据集包含航空和卫星图像,是一个被广泛使用的遥感分割基准。分割模型则采用预训练的U-Net架构,专门用于屋顶分割。参与对比的XAI方法包括Grad-CAM(基于梯度)、Score-CAM(基于类激活映射的采样方法)以及Seg-Sobol(将Sobol方法适配到分割任务的现有方案)。
先看热力图的定性效果。下面这张图展示了三组代表性样本,涵盖了测试集中观察到的各种情况:
从第一行样本可以看到,大多数情况下,Score-CAM和熵中心方法都能比较好地标出建筑主体及其周边环境;而Grad-CAM只关注了建筑像素的一小部分,对完整的建筑轮廓以及周边上下文区域基本视而不见。后面的几行则展示了Score-CAM的特殊失败情况:有时高亮了远离建筑的无关区域,有时跳过了建筑物本身而高亮了道路,甚至有时几乎没有高亮任何有效区域。相比之下,熵中心方法虽然没有出现这类灾难性失败,但在一些样本中会漏掉部分建筑区域。
接下来是定量评估。论文使用L-SIT和H-SIT两种评估方法,在阈值0.1下分别考察三种指标的变化情况,结果汇总如下:
先看L-SIT的表现。L-SIT测试的是"低显著性区域是否真的无关",指标越低说明热力图对不重要区域的判断越准确。熵中心方法在这个测试中表现非常亮眼:掩掉低显著性区域后,模型置信度仅下降2%、IoU仅下降0.7%、熵仅上升3.4%,在IoU和熵指标上明显优于Score-CAM(4.1%和8.9%),在置信度上也远好于Seg-Sobol(12.2%)和Grad-CAM(27.3%)。这说明熵中心方法生成的低显著性区域确实与模型决策"脱钩",把它们去除对模型几乎没有影响。
再看H-SIT的表现。H-SIT测试的是"高显著性区域是否真的关键",指标越高说明热力图越精准地抓住了模型决策的要害。熵中心方法在这里的表现同样突出:掩掉高显著性区域后,模型置信度下降37.4%、IoU下降44%、熵上升48.5%,三项指标全面超过Score-CAM(32.3%、36.2%、45.3%)和Seg-Sobol(25.9%、29.1%、34.1%)。这说明熵中心方法能够有效地锁定模型决策所依赖的关键区域,把这些区域拿掉,模型立刻"方寸大乱"。
Grad-CAM在H-SIT中的表现就非常尴尬了:各项指标几乎没变化,IoU甚至出现了-0.1%的"反向提升"——把Grad-CAM认为重要的区域抹掉,模型性能基本不受影响,真是让人啼笑皆非。这恰恰说明Grad-CAM的热力图在分割任务中给出的高亮区域离模型真正的决策依据差了十万八千里。
论文还从方法论层面对Score-CAM和熵中心方法进行了对比,整理成了一张对照表:
Score-CAM的优势在于计算效率高,只需要少量的前向传播就能得到精细的归因图,但它需要访问模型内部的激活图,对模型结构有依赖,而且对"上下文交互"的感知能力较弱。熵中心方法则完全不需要访问模型内部,通过系统性的输入扰动来工作,稳定性更强,能捕捉到区域之间的交互影响,虽然计算开销更大,但解释结果与模型的实际行为更加一致。
局限与展望:迈向更可靠的XAI评估体系
客观来说,这篇论文还有一些值得完善的方面。首先是验证范围:实验仅在WHU数据集和U-Net一个分割模型上进行。虽然WHU数据集具有一定代表性,但要在遥感领域全面验证熵中心方法的有效性,还需要在更多数据集(如ISPRS、DeepGlobe)和更多模型架构(如DeepLabV3+、Swin Transformer等)上进行测试。
其次是粒度问题。熵中心方法基于patch级的采样网格,解释精度受采样网格密度限制。网格太粗,解释不够精细;网格太密,计算开销会成倍增长。如何在精细度和效率之间取得更好的平衡,是一个值得继续深挖的方向。
第三是计算成本。与CAM类方法只需几次前向传播不同,熵中心方法需要进行多次(每次扰动一次)前向推理,计算开销明显更高。论文使用的采样规模尚可接受,但在高分辨率遥感影像上扩展到更大规模时,计算时间可能成为瓶颈。
从未来方向上看,论文提到了三个明确的延伸点:多数据集验证、混合XAI方法(将熵中心与其他方法融合)、以及支持更多样的模型架构。龙哥认为,熵中心方法还有两个潜在的落地场景值得关注:一是作为模型审计工具,在模型部署前检查分割模型是否真正关注了物理上有意义的区域(比如屋顶分割是否真的在看屋顶),而不是依赖某种偶然的数据偏置;二是与主动学习结合,用熵中心热力图标记模型"心中有鬼"的区域,辅助标注人员优先修正那些模型决策依据不充分的样本。
龙迷三问
这篇论文到底在解决什么问题? 黎巴嫩大学等机构提出熵中心可解释AI方法,基于熵不确定性原理为遥感图像语义分割生成归因热力图,并设计H-SIT评估框架识别虚假高显著性区域,在WHU建筑物分割数据集上显著优于Grad-CAM、Score-CAM与Seg-Sobol
这篇工作最值得看的点是什么? Entropy-Centric在L-SIT和H-SIT评估中均表现最优。在L-SIT中,仅导致2%置信度下降和0.7% IoU下降,远优于Grad-CAM的27.3%和29.7%;在H-SIT中,导致37.4%置信度下降和44% IoU下降,优于Score-CAM的32.3%和36.2%
这篇工作的边界或风险在哪里? 优点:(1) 提出基于熵的XAI方法,从不确定性角度解释模型决策,与传统的基于梯度或方差的方法形成互补;(2) 提出H-SIT评估方法,弥补了L-SIT无法检测虚假高显著性区域的缺陷;(3) 方法为模型无关的,适用于任意黑盒模型。缺点:(1) 计算成本较高,需要多次前向传播;(2) 解释粒度受限于采样网格大小;(3) 仅在单一数据集和单一模型上验证,泛化性有待进一步验证
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种基于熵不确定性原理的采样型XAI方法,通过扰动输入图像并计算目标对象区域的熵变化来生成归因热力图,实现对语义分割模型决策过程的解释。
实验合理度: ★★★★☆
预测置信度下降、IoU分数下降、熵分数增加
学术研究价值: ★★★★☆
提出一种基于熵不确定性原理的采样型XAI方法,通过扰动输入图像并计算目标对象区域的熵变化来生成归因热力图,实现对语义分割模型决策过程的解释;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
未明确给出具体FLOPs,但Entropy-Centric方法需要N次前向传播(N为采样数量),计算成本高于Grad-CAM但低于传统Sobol方法
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 计算成本较高,需要多次前向传播;(2) 解释粒度受限于采样网格大小;
主要参考文献
[1] T. Fel, R. Cadene, M. Chalvidal, M. Cord, D. Vigouroux, and T. Serre, "Look at the Variance! Efficient Blackbox Explanations with Sobol-based Sensitivity Analysis," Advances in Neural Information Processing Systems, vol. 34, 2021.
[2] H. Nasrallah, A. E. Samhat, Y. Shi, X. X. Zhu, G. Faour, and A. J. Ghandour, "Lebanon Solar Rooftop Potential Assessment Using Buildings Segmentation From Aerial Images," IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, vol. 15, pp. 4909-4918, 2022.
[3] A. Gizzini, M. Shukor, and A. Ghandour, "Extending CAM-based XAI methods for Remote Sensing Imagery Segmentation," Environ. Sci. Proc, vol. 1, no. 0, 2023.
[4] T. Speith, "A Review of Taxonomies of Explainable Artificial Intelligence (XAI) Methods," in Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency, 2022, pp. 2239-2250.
[5] S. Ji, S. Wei, and M. Lu, "Fully Convolutional Networks for Multisource Building Extraction From an Open Aerial and Satellite Imagery Data Set," IEEE Transactions on Geoscience and Remote Sensing, vol. 57, no. 1, pp. 574-586, 2019.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
遥感分割黑盒深,熵心热力图解谜团。
想和龙哥一起拆解更多AI黑盒?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群