← 返回 PaperDaily 视觉与图像

RMIT提出RMR-Net:道路缺陷检测新范式,7/8场景精度领先

道路缺陷检测最怕输入图像又糊又暗——坑洼裂纹在模糊里“隐身”,再强的检测器也得抓瞎。RMIT团队这篇工作直接把退化证据变成恢复条件,让复原后的图像“喂”给检测器,8种退化场景里7项精度领先。方法简洁、定位精准,适合所有做巡检和车载视觉的团队围观。

RMIT提出RMR-Net:道路缺陷检测新范式,7/8场景精度领先

paperdaily_reaction_gif


原论文信息如下:
论文标题:
RMR-Net: Degradation-Evidence-Guided Road-Image Restoration for Defect Detection
发表日期: 2026年08月
发表单位: RMIT University(皇家墨尔本理工大学)与 The University of Melbourne(墨尔本大学)
原文链接: https://arxiv.org/pdf/2608.08957v1.pdf
试想一个几乎天天都发生的场景:市政养护车清晨出门,车载相机一路扫过去,晚上回机房导数据,发现拍到的坑洼图片不是糊成一团就是暗得像深夜。如果靠人去筛,一万张图能看出颈椎病;如果靠AI去筛,AI对着模糊图也只会“礼貌地沉默”。运动模糊、失焦、低照度、传感器噪声、压缩伪影——这些退化就像给检测器戴上了一副墨镜外加一层毛玻璃,细长的裂缝和坑洼边缘在画面里直接“隐身”。
这个痛点,就是RMIT大学团队在论文《RMR-Net: Degradation-Evidence-Guided Road-Image Restoration for Defect Detection》中正面刚的问题。本论文提出了一套紧凑的任务感知恢复前端RMR-Net,思路可以概括成一句话:先看清洗出来的图“生病”到什么程度,再根据退化证据“对症下药”地做恢复,最后用冻结的检测器来验收效果。八个受控退化场景里,七个场景的缺陷检测mAP50做到最高,直接把IVCNZ运动模糊场景的检测精度从0.140拉到了0.427。

道路缺陷检测的隐形杀手:退化图像如何让AI“失明”?

坑洼检测恢复效果示例
坑洼检测在恢复前后的效果对比示意。上面的恢复图让原本淹没在模糊里的坑洼边界重新“浮出水面”。
先解释一下“退化”这个词在图像处理里的含义。一张理想的道路图像,在拍摄过程中会因为相机抖动、对焦不准、光线不足、传感器热噪声、压缩编码等因素,变成一张“信息受损”的图。运动模糊是车辆行驶时最常见的退化,坑洼边缘在运动方向上被拉成一条模糊的亮带;失焦模糊则让整个画面像蒙了一层薄纱;低照度加噪声会让暗处的裂纹直接淹没在噪点里。对这些被退化的图像,哪怕是最好的检测器——比如本论文用的YOLO11s——也会出现漏检率飙升的情况。
检测器在退化图像上“失明”的根本原因,是退化过程压制了缺陷与普通路面纹理之间的弱对比。裂缝或者坑洼边缘本来就只有几个像素的宽度,模糊会把这些像素的能量扩散到周围,导致局部对比度跌破检测器能感知的阈值。更麻烦的是,通用图像恢复方法在这个场景里时常帮倒忙:很多去模糊、去噪网络追求的是像素级或感知级的保真度,它们会把一张模糊图“磨”成一张干净光滑的图,但同时也把细裂缝这道关键证据一并磨掉了。视觉上更干净,检测上更差,这种情况在道路排查里格外致命。
RMR-Net的出发点,是把“下游检测器需要什么证据”作为恢复的第一目标,而不是简单地让图片“好看”。论文中提出了一种退化证据引导的条件化恢复框架:在推理时,网络先从退化图像中估计出一个描述退化状态的向量,再用这个向量去调节恢复模块的每个环节,让恢复过程真正“知道”自己面对的是运动模糊还是失焦。

RMR-Net核心机制:退化证据引导的条件化恢复

RMR-Net的完整名称是Road-image Restoration with degradation-evidence guidance,即“带退化证据引导的道路图像恢复网络”。它的推理架构主要包括三个环节:退化编码器、条件化恢复骨干、有界细节增强路径。下面逐个拆解。
第一步,估计退化状态。给定一张退化道路图像I_d,一个轻量级编码器g_φ会从图像内容中直接推断出一个八维退化代码ẑ,这一步对应论文中的公式:
式1 退化估计编码公式
式(1):退化估计编码公式。ẑ的八个坐标分别代表水平运动分量、垂直运动分量、不规则振动、离焦程度、噪声水平、低照度系数、压缩程度和整体严重程度。在受控训练中,ẑ会被监督逼近真实的退化生成参数z*。
第二步,融合外部退化先验。如果车辆上存在额外的元数据(例如IMU惯性测量单元记录的角速度、GPS速度等),这些信息可以通过一个小型映射网络g_m变换成同样的八维代码z_m。图像估计代码ẑ和外部代码z_m之间,由一个可靠性门控ρ来动态决定到底信谁多一点:
式2 可靠性门控融合公式
式(2):可靠性门控融合公式。其中ρ∈[0,1]^8是一个由图像代码与元数据代码的一致性以及元数据可用性标志共同预测的逐坐标权重向量。门控的好处在于:当外部参数与图像证据一致时多信外部参数;当两者冲突时自动回调到图像估计,避免错误元数据把恢复带偏。训练时还会对z_m做随机丢弃和扰动,防止模型养成“过度依赖辅助信息”的惰性。这个设计的巧妙之处在于,即使完全拿不到外部元数据,模型也能退化成纯图像估计模式,推理不受影响。
第三步,条件化恢复。恢复骨干是一个三尺度编码器-解码器结构,每个残差块都采用深度可分离卷积来降低计算量。融合后的退化代码z通过特征级线性调制FiLM(Feature-wise Linear Modulation)来调节每个残差块的中间特征:
式3 FiLM调制公式
式(3):FiLM调制公式。γ(z)和β(z)分别是由退化代码生成的逐通道缩放因子和偏移量。这个机制让同样的骨干网络在面对“运动模糊”和“低光照”时,内部特征处理通道完全不同——相当于根据退化状态给网络切换了一套更适合的“内部参数”。四种无需标注的证据图(梯度幅值、局部对比度、暗区、色彩饱和度)则引导一个轻量级的任务证据注意力分支,让网络在缺乏检测器参与的情况下也能主动聚焦细裂缝和坑洼边缘这类弱结构区域。
架构图如下:
RMR-Net整体架构图
图1:RMR-Net整体架构总览。图中展示了推理路径(部署模型)的三个关键模块:退化编码器、条件化恢复块和有界细节路径。
训练阶段还引入了一个值得注意的设计:预训练并冻结一个干净的YOLO11s检测器,恢复网络在训练时不仅看重建损失,还要让自己的恢复结果在这个冻结检测器的特征空间里靠近干净图像。这里YOLO11s是Ultralytics在2024年发布的YOLO系列最新版本,You Only Look Once的缩写,是一种单阶段目标检测器。冻结意味着检测器权重在恢复网络训练过程中保持不变,只作为“裁判”提供梯度信号。此外还有一项Hutchinson风格的雅可比惩罚项,用来抑制“图像微小变化导致检测器特征剧烈变化”的脆弱行为:
式5 雅可比惩罚项公式
式(4):雅可比惩罚项公式。其中Φ表示冻结检测器的特征提取函数,v是随机方向向量,该式等价于计算恢复结果I_r在检测器特征空间中的Hutchinson风格梯度范数,用来惩罚不稳定的局部变化。整体训练损失由重建主项、退化代码监督、检测器特征项、雅可比项和一系列安全约束加权求和得到:
式6 总损失函数公式
式(5):总损失函数公式。其中L_base是主导的重建项,L_code监督退化编码,L_det是低权重的检测器特征项,L_J是雅可比惩罚,L_safe包含特征锚定、证据不回归和细节约束。这种设计保证了“恢复服务于检测”而非“恢复服务于美观”。
这里要特别强调论文中关于实验范围的诚实说明:在IVCNZ坑洼数据集和PCM道路损坏数据集(坑洼、裂缝、检修井盖)上所使用的条件信息,是“保存的合成生成器参数”,而不是实测的车辆遥测数据。也就是说,实验验证的是“给定准确的退化参数能带来多少帮助”,而不是“真实车载传感器能带来多少帮助”。两者之间存在差距,这也是论文留待后续工作的关键点。
推理时各方法获得的信息对比表
表II(随图1):推理时各方法获得的信息对比。该表格明确区分了外部提供信息与模型内部估计信息,可以看出RMR-Net在控制实验中额外接收的只是一个八维的连续退化代码z_m,而干净图像、标注框、检测器输出等都没有在推理时提供给任何恢复方法。

有界细节路径:如何在恢复与保留间取得平衡?

通用图像恢复网络有个“行业通病”——过度平滑。为了追求高分PSNR和SSIM,网络倾向于输出一张干净但纹理被抹平的图。在道路缺陷检测任务里,这等于把证据毁掉了:细裂缝被抹掉、坑洼边缘被磨圆。RMR-Net针对这个问题设计了一个非常有意思的有界细节路径(Bounded Detail Path)。
具体做法是:解码器先输出一个基础恢复结果I_b,这个结果通常是平滑的。然后,网络利用固定的局部均值滤波器构造出一个多尺度高频残差库——即原始退化图像里那些被平滑掉的高频纹理。一个小型分支网络把残差库和前面的任务证据图结合起来,生成一个学习得到的细节信号D(I_d)和一个空间门控图G_d∈[0,1]^{H×W}。最终输出如下:
式4 有界细节路径公式
式(6):有界细节路径公式。其中η_d(z)=η_max·ρ_d(z),η_max给整个更新量设一个上限,ρ_d(z)则根据退化严重程度动态降低细节回传幅度。
这个路径的价值在于“有界”二字。如果直接加一个无约束的锐化滤波器,确实能把裂缝变明显,但同时也把噪声和压缩块效应一起放大了,甚至可能制造出假的缺陷。有界细节路径用η_max限制最大修改幅度,用G_d做空间选择(只在可能包含缺陷纹理的区域加细节),用ρ_d避免在退化太严重时盲目复制不可靠纹理。三者配合,既能找回那条细裂缝,又不至于变成无脑锐化。
消融实验也证实了这一点。论文在PCM数据集的失焦条件下做了顺序消融,结果如下表所示:
顺序消融实验表
表IV:PCM失焦条件下的顺序消融实验。所有训练行使用相同的数据划分、随机种子和8轮训练预算,通过验证集mAP50选择最优检查点。有界细节路径带来的提升最大,把mAP50从0.240提升到0.264。
值得注意的是,顺序消融中出现了一个反直觉的现象:加入受控参数融合后mAP50反而从0.254掉到了0.251,加上任务证据注意力又从0.251掉到0.240。论文没有回避这些“不好看”的中间结果,而是老实交代了这种非单调变化。这说明辅助信息带来的收益并不总是即时体现,某些模块需要配合后面的细节路径一起才能发挥效果。这种诚实的实验报告方式在学术论文里是加分项。

实验结果:7/8条件领先,但有一个例外

实验设置在可控性上做得相当严谨。两个数据集均按图像级划分,先划分干净图像,再在划分后生成退化图像,这样任何测试图像的退化版本都不会进入训练集或验证集。退化类型包括参数化的线扩散运动模糊、各向同性失焦模糊、低照度加噪声、以及运动模糊叠加低照度噪声的复合退化,每种退化分0.30、0.60、0.90三个严重等级。数据划分如下:
受控数据集划分表
表I:受控数据集划分。IVCNZ坑洼数据集包含1243张有序帧,PCM数据集包含2009张640×360分辨率的图像,配有坑洼、裂缝和维护井盖三种标注。
评价协议最关键的一点是:同一个冻结检测器、同一个置信度阈值、同一个IoU阈值,评估所有图像来源(干净、退化、各方法恢复)。这样任何检测精度的差异都直接来源于图像证据本身的变化,而不是检测器被重新训练过。检测器每张图都独立推理,保证公平性。
完整对比结果如下:
完整检测对比结果表
表III:完整测试集冻结YOLO11s检测结果对比。数值为mAP50,DeMoE-A和DeMoE-S分别表示自动路由和已知场景路由,NAFNet-R表示道路训练的NAFNet,加粗表示每行中最佳的非干净图像来源。RMR-Net在八个条件中的七个取得最高mAP50。
mAP50是平均精度均值(mean Average Precision)在IoU阈值为0.50时的取值。简单理解:模型预测的检测框和真实标注框的重叠度超过50%就算预测正确,mAP50就是所有类别上“预测对了多少”的综合得分。在道路缺陷检测里,mAP50越高,说明“AI找到并圈对坑洼与裂缝”的能力越强。本论文选择的对比基线也很有层次:DFPIR(Degradation-aware Feature Perturbation for all-in-one Image Restoration)和DeMoE(Deblurring Mixture-of-Experts)使用官方发布权重,不针对道路数据做任何再训练;NAFNet-road则是在同一道路配对数据上从头训练的通用恢复模型。这里NAFNet是Neural Attention Filter Network(神经注意力滤波网络),一种简洁高效的图像恢复基线。相比这些常用基线,RMR-Net不是靠更大的模型或更强的重建精度取胜,而是靠“把恢复目标对齐到检测需求”这一设计思路。
具体到数值:IVCNZ数据集上,运动模糊条件的mAP50从退化的0.140提升到0.427(零提升214%),失焦从0.154提升到0.372,复合退化从0.280提升到0.427。PCM数据集上,失焦从0.060提升到0.233,低照度从0.326提升到0.435,复合退化从0.061提升到0.139。而唯一的例外是PCM运动模糊:DeMoE-scenario达到0.320,RMR-Net只有0.312。
分场景检测恢复结果对比图
图2:分场景冻结检测器恢复效果对比。上图是IVCNZ坑洼基准,下图是PCM坑洼/裂缝/检修井盖基准。柱状图直观展示了IVCNZ上运动模糊、失焦和复合退化的显著恢复,以及PCM上失焦、低照度和复合退化的明显增益。
为什么PCM运动模糊会成为例外?一个合理的推测是:PCM数据集中的坑洼、裂缝和检修井盖在不同运动模糊方向和长度下的特征差异极大,DeMoE-S“已知正确退化类型”的设置让它能直接选择最匹配的专家子网络,相当于拿到了“开卷答案”;而RMR-Net虽然也有退化编码,但八维编码对运动方向这类连续参数的估算仍存在误差。这个例外恰恰说明“准确的退化先验”和“恢复模型的鲁棒性”是两个互补的杠杆——真实场景中如果遥测噪音大,RMR-Net这类图像估计加可靠性融合的方案可能反而更稳。在PaperDaily已收录的论文范围内做辅助判断,该结果对同类研究有参考价值,但由于各数据集和退化设置不尽相同,不宜做绝对的跨论文优劣排序。
PCM检测恢复效果图
图:PCM道路损坏检测在恢复后的效果示意。

局限与展望:从合成参数到真实遥测的跨越

定量之外,论文还给出了定性恢复示例和下游测量展示。图3上半部分对比了退化输入、RMR-Net直接恢复结果和干净参考图,可以看到坑洼边缘、道路纹理和裂缝对比度都明显向干净参考靠拢。下半部分展示的是在冻结检测器输出框基础上做的受控主动轮廓细化,将检测框转换成缺陷边界的近似轮廓,进一步估算面积、周长等几何指标。
定性恢复与下游测量结果图
图3:定性恢复与下游测量结果。上图是受控运动模糊和失焦条件下的退化输入、RMR-Net直接恢复输出与干净参考对比,黄色矩形标出了标注缺陷区域;下图展示了从检测框出发的受控主动轮廓细化结果,计数为示例对应的接受轮廓数,不构成额外的测试集评估指标。
再聊局限性。RMR-Net报告参数量约134万,在NVIDIA RTX 3050 GPU上对640×360帧的推理耗时约114毫秒,相当于每秒能处理不到9帧,距离车载实时(通常需要20毫秒级别)还有差距。不过考虑到该实验跑的是入门级显卡,部署到更强算力平台后性能会有所改善。
真正需要划重点的局限是:所有实验的退化都是合成生成的,条件代码来自保存的生成器参数,不是真实车辆遥测数据。论文明确说明没有使用车速、角速度、振动、曝光时间、相机姿态、GPS等同步测量数据。这意味着“真实遥测→退化先验→恢复”这条完整的链路还没有被验证。另外,论文在回顾性审计中发现划分中存在少量重复或时间上相邻的帧,虽然不影响受控退化的评估,但也说明不能把当前结果直接理解为野外泛化精度。
未来的方向在论文结尾说得很清楚:需要专门训练一个退化上下文估计模型,配合真实的同步遥测信号(速度、角速度、振动等)在自然模糊数据上做验证。一旦这条路走通,这套“退化证据引导”的框架将很有潜力成为车载道路巡检的实际落地工具。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?车载摄像头遇模糊、暗光就“失明”?RMIT等机构提出RMR-Net,通过退化证据引导图像复原,在8种退化条件下让道路缺陷检测精度7项领先,运动模糊下mAP50从0.140飙升至0.427,为道路智能巡检装上AI慧眼。
这篇工作最值得看的点是什么?在8个测试条件中7个取得最高mAP50,IVCNZ运动模糊从0.140提升至0.427,PCM散焦从0.060提升至0.233。
这篇工作的边界或风险在哪里?优点:任务感知的恢复策略明确建模退化状态,有界细节路径有效保留薄裂纹和坑洼边缘,轻量设计适合部署,消融实验完整。缺点:在PCM运动模糊条件下未超越DeMoE-S,退化条件信息依赖合成参数而非真实车辆遥测,泛化性受限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出RMR-Net,一种紧凑的任务感知图像恢复前端,通过估计退化证据并可选融合外部退化参数,条件化轻量恢复模块,并通过有界残差路径保留高频路面细节,以提升道路缺陷检测性能。

实验合理度:★★★★☆

mAP50(主要指标)、mAP50-95、PSNR、SSIM。

学术研究价值:★★★★☆

提出RMR-Net,一种紧凑的任务感知图像恢复前端,通过估计退化证据并可选融合外部退化参数,条件化轻量恢复模块,并通过有界残差路径保留高频路面细节,以提升道路缺陷检测性能;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

约1.34百万参数,在NVIDIA RTX 3050 GPU上处理640×360帧约需114ms。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:在PCM运动模糊条件下未超越DeMoE-S,退化条件信息依赖合成参数而非真实车辆遥测,泛化性受限。

主要参考文献

[1] A. Ghorbani, A. K. Gostar, W. Q. Chuah, V. Ghorbani, A. Blair, A. Bab-Hadiashar. RMR-Net: Degradation-Evidence-Guided Road-Image Restoration for Defect Detection. arXiv preprint arXiv:2608.08957v1, 2026.
[2] S. W. Zamir, A. Arora, S. Khan, M. Hayat, F. S. Khan, M.-H. Yang. Restormer: Efficient Transformer for High-Resolution Image Restoration. CVPR 2022.
[3] L. Chen, X. Chu, X. Zhang, J. Sun. Simple Baselines for Image Restoration. ECCV 2022.
[4] E. Perez, F. Strub, H. de Vries, V. Dumoulin, A. Courville. FiLM: Visual Reasoning with a General Conditioning Layer. AAAI 2018.
[5] X. Tian, X. Liao, X. Liu, M. Li, C. Ren. Degradation-aware Feature Perturbation for All-in-one Image Restoration. CVPR 2025.
[6] D. Feijoo, P. Garrido-Mellado, J. Rim, A. Garcia, M. V. Conde. Towards Unified Image Deblurring using a Mixture-of-Experts Decoder. CVPR Workshops 2026.
[7] Ultralytics. Ultralytics YOLO11 Documentation. 2024. https://docs.ultralytics.com/models/yolo11/
[8] P. A. Chitale et al. Pothole Detection and Dimension Estimation System using Deep Learning (YOLO) and Image Processing. IVCNZ 2020.
[9] E. Giordani, L. Arcioni, M. Gil-Martín, G. L. Foresti

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球