每年大约有100名消防员在执行任务时牺牲,其中视野受限是导致伤亡的核心因素之一。在火灾现场,能见度低不仅仅是找路困难——浓烟中的一氧化碳、氰化氢等有毒气体会让消防员在数秒内失去意识。因此,快速判断房间结构、门窗位置和逃生路线,是生死攸关的问题。然而,现有消防设备在浓烟环境中有着各自的硬伤。热成像仪能穿透烟雾看到热源,但在杂乱场景中精度下降严重,且价格昂贵难以普及;强光手电在烟雾中会产生严重的后向散射,反而让视野更模糊;微光夜视设备在火焰附近会因为强光而产生光晕效应,完全失效。更重要的是,火场内的通信基础设施常常被烧毁或断电,任何依赖云端的智能辅助系统都存在断网风险——消防员不可能在火场里等待AI的云端响应。这些限制条件共同指向了一个明确的硬件平台选择:必须在本地运行、成本足够低、功耗足够小、体型足够便携。树莓派4 Model B正是这样一款设备——它只有信用卡大小,搭载四核Cortex-A72处理器,零售价不到100美元,却能够运行轻量化的神经网络推理。作者们的目标很纯粹:设计一套能够在这类入门级硬件上全天候运行的视觉辅助系统,让消防员在进入火场前,能够通过固定在肩部或头盔上的摄像头,实时看到经过AI增强的结构轮廓图。
去雾前置网络:一个看似合理却未必最优的设计
这套管线采用了一种在计算机视觉领域极为常见的两阶段设计范式:将图像增强网络放置在任务网络之前。这种设计的内在假设是清晰、干净的输入能让下游任务获得更好的表现。在算力充裕的服务器上,这种策略几乎没有成本——大不了多跑一次前向推理。但在嵌入式设备上,这种假设需要被严格审视,因为每一个额外的网络层都在消耗本就紧张的功耗预算和推理时间。论文设计的系统包含几个关键模块,各自承担明确的职责。去雾网络负责“擦除”烟雾,它采用卷积编码器-解码器结构,包含35.5万个参数。编码器对输入图像进行两次下采样,将空间分辨率从256×256降至64×64,然后应用一个空洞卷积层——这个设计巧妙的层以2的扩张率在不降低空间尺寸的情况下扩大了感受野,让网络能够看到更大的上下文区域,从而更准确地估计雾浓度。随后解码器通过两次转置卷积逐步恢复分辨率,并通过跳跃连接将编码器中对应阶段的细节特征拼接回来——这种结构借鉴了经典的U-Net设计,有效缓解了编码路径中空间信息丢失的问题。训练时使用均方误差损失来回归干净图像,并配合LeakyReLU激活函数和批归一化来稳定训练。图1展示了完整的门控流水线架构。去雾阶段仅在暗通道先验估计值s超过阈值τ时才会运行。图中标注了每个阶段在树莓派4 Model B上测得的每帧延迟中位数(每个网络运行100次迭代,门控模块运行200次)。可以看到,去雾器单独运行需要469.6毫秒,是整个流水线的性能瓶颈。边缘检测网络紧随其后,采用U-Net风格结构,仅包含2.3万个参数。它与去雾器最大的区别在于使用了深度可分离卷积——这种设计将标准卷积分解为深度卷积和逐点卷积两个阶段,让参数量大幅缩减。其编码器的两个模块将分辨率降低到原来的四分之一,解码器则通过最近邻上采样和跳跃连接恢复空间尺寸。边缘检测网络通过二元交叉熵损失训练,监督信号来自人工标注的边缘图。这里有一个值得注意的工程细节:作者最初尝试使用标准转置卷积进行上采样,但在部署到树莓派的TensorFlow Lite运行时时遇到了兼容性问题——32位Raspberry Pi OS对Python 3.7的支持锁定了tflite-runtime 2.11版本,该版本无法注册某些动态形状算子,导致程序在分配张量时中止。作者索性将上采样层替换为无参数的最近邻插值,这一改动让算子种类从十个降到了六个,模型体积缩小到了53KB,而精度几乎没有损失(ODS从0.740变为0.741)。图2展示了在真实烟雾拍摄场景中,这套流水线的作用:从左到右分别是充满烟雾的原始输入、去雾后的画面、最终生成的边缘图。通过视觉对比可以直观感受到,去雾后的边缘图确实提取出了更多可用的结构信息,包括门框轮廓和障碍物边界。在去雾模型的数据集选择上,作者们经历了一个颇有启发性的弯路。最初他们在RESIDE合成数据集上训练模型,但一位有着丰富实战经验的消防员在评审早期效果时直言不讳地指出,合成雾霾与真实火灾产生的烟雾在物理特性上差异巨大。合成雾通常是大尺度均匀分布的,而真实烟雾则具有非均匀、动态变化的结构,且往往伴随着高温和湍流。这个反馈促使作者们放弃了大而全的合成数据集,转而使用更小但更真实的SMOKE数据集(110对训练、12对测试)和DENSE-HAZE数据集(55对)进行重新训练。这一决定在后续实验中得到了验证:虽然牺牲了训练数据的数量,但模型在真实烟雾上的泛化能力显著提升。全整数量化是整个嵌入式部署的关键一步。两个网络的所有权重、激活值和推理输入都被量化为uint8格式,通过TensorFlow Lite的完整整数推理在树莓派上运行。量化后的边缘检测模型大小为56KB,去雾器为373KB。值得注意的是,量化对两个模块的影响并不相同:边缘检测模型由于输出本质上是近似二值的边缘图,uint8的量化精度对其表现几乎没有影响(ODS从0.738略微提升至0.740,属于噪声范围内的波动);而去雾器需要回归全彩RGB图像,张量缩放需要跨越整个颜色范围,量化损失就明显得多——PSNR从18.60 dB下降至16.80 dB,SSIM从0.616下降至0.462。这一发现也直接指向了论文未来的改进方向:采用量化感知训练来弥补这一差距。
关键发现:去雾并非总是有益
在评估模型性能时,论文在12对待测SMOKE图像对上比较了去雾效果,结果显示本方法达到了18.60 dB的PSNR,比未处理的原始输入高出5.0 dB,也显著超过了AOD-Net的17.08 dB。有趣的是,经典的暗通道先验方法表现甚至还不如不做任何处理——这是因为暗通道先验的核心假设是“每个局部图像块中都存在一个极暗的像素”,这一假设在户外自然场景中通常成立,但在浓密且明亮的烟雾环境中却失效了:烟雾颗粒散射光线,使得所有像素都趋于明亮,模型便会过度估计烟雾浓度,导致输出图像被过度压暗。这个结果说明了数据驱动方法在特殊退化场景中的重要性。论文的实验设计值得专门梳理一下。对于核心的去雾模块,作者在SMOKE数据集的12对待测真实烟雾图像上,以PSNR和SSIM作为指标,对比了暗通道先验、DehazeNet、AOD-Net和自己训练的模型。所有基于学习的基线模型都在相同的165对训练图像和相同的数据增强方式下重新训练,保证了对比的公平性。对于边缘检测模块,则在BIPEDv2数据集的50张测试图像上对比了边缘检测结果,评价指标采用F-measure(ODS和OIS两个尺度)——这套指标会先将预测结果和真值细化到单像素宽度,然后在2像素容差范围内进行二分图匹配,每个标注像素最多匹配一个预测像素,严格程度较高。图3揭示了整个研究最具洞察力的实验结果:在不同烟雾浓度下,边缘F-measure的变化曲线清楚地展示了固定策略的局限。对清晰输入,不做去雾时边缘检测ODS为0.738,去雾后反而降至0.710——去雾器在清理本就不存在的雾霾时,也一并抹掉了部分图像细节。轻度烟雾下(t=0.7)也呈现类似趋势。只有当烟雾变得浓密(t=0.35)时,去雾的优势才显现出来:ODS从0.438提升至0.598。这个交叉点大致落在t=0.7和t=0.5之间。图3中的测试方法是将不同浓度的合成雾叠加到BIPEDv2测试图像上,雾浓度由透射率t(取值范围0到1之间)控制——t值越小代表雾越浓。测试时,保持大气光A固定为0.8,模型输入按照经典大气散射模型 I = J·t + A·(1-t) 合成。这里J代表清晰图像,I代表观测到的带雾图像。通过对比门控策略、始终去雾策略、永不去雾策略在每种浓度下的表现,可以清晰看到,门控策略(图中绿色曲线)几乎完美追踪了两种固定策略的上包络:在每种单一浓度下,它都不是最优的,但在跨浓度的平均性能上却做到了最好,并且消耗的计算量比始终去雾少了43%左右。为什么去雾在轻度烟雾下反而会损害后续任务?作者从模型学习的角度给出了合理解释:去雾网络本质上是一个有损的图像重建过程。对于无雾或者轻度雾霾的图像,其重建过程中引入的噪声和细节损失,可能比原本烟雾对边缘检测造成的干扰还要大。当烟雾浓密到影响特征提取时,去雾的正面作用才超过其信息丢失的副作用。这个现象在计算机视觉领域具有普适性,它提醒我们在任何级联系统设计中,前处理模块都应当被视为整体数据流的一部分来审视——很多时候,一个“不完美但便宜”的输入反而是更好的选择。
论文的诚实体现在对局限性的交代。整套评估只用了12对真实烟雾训练对和50张BIPEDv2测试图,样本量确实有限。虽然difference bootstrap(配对自助法)能将门控相对“始终去雾”的差距分辨率做到[0.005, 0.017],但单策略绝对ODS的置信区间仍达±0.013。作者自己也承认,四种烟雾条件采用等权平均是一个建模选择,真实火场中各密度烟雾的分布权重需要实测数据才能替代。换句话说,目前报告的平均性能,并不代表真实任务场景中的期望性能。更关键的差异在于:实验中的非均匀烟雾来自烟雾机,而不是真实的火灾烟气。真实火灾中的烟气温度更高、颗粒物成分更复杂、气流动态更剧烈,与发烟机产生的冷烟雾相比,在大气散射特性上存在本质区别。门控阈值τ是在合成烟雾和烟雾机画面上标定的,能否适配真实火场,论文坦承没有验证。此外,合成雾测试固定了大气光A=0.8,这个假设在真实火灾场景中不一定成立。真火条件下的阈值重新标定、搭配量化感知训练来挽回1.8 dB PSNR的量化损失、以及通过消防部门伦理审查后的真火测试,都是后续工作的方向。还有一点必须提醒:BIPEDv2数据集仅限非商业用途,因此基于它训练的模型也继承了这条限制。也就是说,即使这套系统通过了消防器材标准认证,该边缘检测网络的授权范围也仅限科研用途,距离真正的商业化产品还有法律层面的障碍要解决。论文设定的应用目标是帮助消防员在能见度近乎为零的空间里识别结构轮廓,但在成为真正的可用装备前,它还需要经过热环境可靠性测试、抗冲击测试、电池续航验证和一线消防员的实战反馈。