← 返回 PaperDaily
视觉与图像
对称检测新SOTA!去噪+等变匹配双管齐下,F1冲到65.52%
对称检测模型一遇到旋转图像就"掉链子"?这篇来自广东实验室的工作给出了答案:用非对称区域去噪配合旋转等变特征匹配,在DENDI上将F1提升到65.52%刷新SOTA,还捎带手构建了多干扰的GMSYM新基准。方法不复杂,收益很实在,值得一看。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
对称之美:AI如何精准捕捉旋转图像的"镜像密码"?
对称几何,是自然界最"自恋"的结构之一。蝴蝶的双翅、树叶的脉络、建筑的倒影,全都在用它。让机器自动找到图像里的对称轴(也称反射轴),不仅能用于图像压缩、修复、去噪,还能帮机器人判断物体姿态、帮工业视觉排查缺陷。
但问题来了:说得轻巧,做起来可真难。日常生活中,一张照片里有主体也有杂乱背景;明明是对称的图案,换个角度拍,AI就"不认识"了。现有的对称检测模型,很多一遇到这类场景就翻车。
近期,来自广东人工智能与数字经济实验室(深圳)、深圳大学、南方科技大学和卡尔顿大学的研究团队提出了一套名为 ARD-REFSM 的新方案。它在 DENDI 基准上将 F1 分数提升到了 65.52%,刷新了该任务的最优成绩,同时还带来了一个新的多场景基准数据集 GMSYM。方法不复杂,收益很实在,值得仔细看看。
两大困扰:背景干扰与旋转失效——现有方法为何频频失手?
先科普一个基础概念:反射对称检测(Reflection Symmetry Detection),目标是找出图像中那条"镜子"——对称轴。沿这条轴翻转图像,主体区域应当保持不变。早期的算法靠关键点匹配和手工特征来猜,误匹配率极高;后来大家改用深度学习直接回归逐像素的对称得分图,效果确实好了不少,但仍有两大硬伤。
第一层困扰来自非对称区域的干扰。真实照片里除了对称主体,还有行人大妈、乱入的路牌、晃动的树叶——这些背景区域并不遵循对称模式,却可能在得分图上产生"假的对称响应",也就是伪影。伪影一旦靠近真正的对称轴,就会把检测结果带偏,导致轴的定位不完整或不准确。
第二层困扰是旋转失效。普通的卷积神经网络(CNN)没有旋转等变性。什么意思?同样一个对称图案,转个30°再输入网络,卷积核提取到的特征就"对不上了"。特征表示不一致,对称轴的预测自然不可靠。这正是很多模型在旋转图像上表现拉胯的根本原因。
下图把这个痛点展示得很直白:现有模型要么被非对称背景干扰,要么在旋转图像上直接"失明"。
图1:(a) 大多数图像对称检测模型存在两个主要局限:易受非对称区域干扰,以及经常无法检测旋转图像内的对称性;(b) 记 z 为从原始图像 x 中提取的特征,y 为最终预测;(c) 本文方法通过结合非对称区域去噪与旋转损失,有效预测反射对称。
去噪+等变双管齐下:ARD-REFSM的核心机制揭秘
这篇论文的核心思路可以概括成一句话:用噪声抑制解决背景干扰,用等变学习解决旋转失效。对应的两个关键模块分别是 非对称区域去噪(Asymmetric Region Denoising,简称 ARD) 和 旋转等变特征相似性匹配(Rotation Equivariant Feature Similarity Matching,简称 REFSM)。整套网络被命名为 ARDNet。
对称得分图(Score Map):网络逐像素输出的热力图,每个像素的数值表示该位置属于对称轴的概率。得分越高的区域,越可能是对称轴所在位置。
旋转等变性(Rotation Equivariance):输入图像旋转一个角度后,输出特征图也按同样的方式旋转,而不是变成另一套完全不同的特征。这是解决旋转图像检测问题的关键性质。
群等变卷积(Group Equivariant Convolution):把普通卷积扩展到对称群上,使特征天然具备某种变换一致性。本文使用二面体群 D8,对应8个离散旋转方向(每45°一个),让卷积在旋转下保持行为一致。
空洞空间金字塔池化(Atrous Spatial Pyramid Pooling,ASPP):一种多尺度上下文特征提取结构,用不同膨胀率的空洞卷积并行捕捉不同尺度的语义信息,源自 DeepLab 系列语义分割模型。
整体流程先看图。给定一张原始图像 x 和一张随机旋转过的图像 xrot,网络先用群等变编码器提取多尺度特征,再由群等变解码器分别恢复出两张初步对称得分图 U 和 Urot。U 送进 ARD 模块做非对称区域去噪,得到最终预测 D。与此同时,U 被旋转与 xrot 相同的角度,得到 Ûrot,网络强制要求 Ûrot 与 Urot 保持一致,从而学会旋转等变的预测。
图2:本文提出的 ARDNet 总体框架。给定未旋转输入图像 x 和随机旋转图像 x_rot,分别通过群等变编码器和群等变解码器获得初步对称得分图 U 和 U_rot。随后,U 经过非对称区域去噪模块获得最终预测结果 D。同时,将 U 进行与 x_rot 相同的旋转得到 Û_rot,最大化 Û_rot 与 U_rot 的相似性以实现旋转不变的预测。
先看 ARD 模块。网络的编码器将输入图像 x 逐层提取为多尺度特征 Fi = Encoder(Layeri(x)),解码器沿这些尺度逐层上采样融合,获得初步对称得分图 U。解码过程中,最深的特征 F4 还会经过 ASPP 得到语义更丰富的特征图 P。到这里,问题就回到了"怎么把 P 里面属于背景的响应压下去"。ARD 的做法非常巧妙:把初步得分图 U 当作空间权重,直接乘到 P 上。对称轴区域权重高、背景区域权重低,一乘一归一化,背景干扰就被"软性屏蔽"了。公式表达为:
D = ARD(P, U) = exp(Ph,w,c · Uh,w,c) / Σc exp(Ph,w,c · Uh,w,c)
其中下标 h、w 表示像素位置,c 表示特征通道。这里对通道做了 softmax 归一化,让网络自己决定每个通道该信多少。把去噪后的特征解码还原成分数图,就得到了更干净、更聚焦的对称预测。
再看 REFSM 模块。它的目标非常明确:让网络对"图像朝哪个方向摆"这件事不再敏感。训练时,输入图像被随机旋转 0° 到 45°,同时将未旋转分支的得分图 U 旋转相同角度得到 Ûrot。理想情况下,同一个人对称图案,不管怎么转,预测的对称轴应该跟着转,而得分图的相对结构保持不变。为此,网络最小化 Ûrot 和 Urot 之间的差异:
argminx [ ½‖Urot − Ugtrot‖² + ½‖Ûrot − Urot‖² ]
这里 x 代表网络参数,Ugtrot 是旋转图像的标注真值。为什么只随机旋转 0° 到 45° 就够了?因为网络底层用的是 D8 群等变卷积,自带8个旋转方向的对称性,每转45°特征就会"对齐"一次。4 5° × 8 = 360°,两者搭配起来,整圈的旋转情况都被覆盖了。这个设计相当省事,不用真的在输入上暴力枚举所有角度。
训练目标这边,由于对称轴像素在整张图里只占极小比例,正负样本严重失衡,文章选用了 焦点损失(Focal Loss) 来平衡两类像素。Focal Loss 通过调制因子压低易分样本的权重,让网络把注意力放在难分样本上,是处理稠密小目标分类不平衡的经典工具(源自 RetinaNet,TPAMI 2020)。
最终总损失由四项等权相加:未旋转分支的损失 Lori、旋转分支的损失 Lrot、ARD 去噪后得分图的损失 Lden,以及旋转一致性损失 Lfrot。全部权重设为1,也就是让四项任务同步优化,同时把控预测精度和旋转一致性。
L = Lori + Lrot + Lden + Lfrot
论文主体思路的关键信息,这里直接汇总成一张表,方便快速把握全貌:
*表格超出部分左右可以滑动
| 项目 |
内容 |
| 应用场景 | 图像反射对称轴检测,可用于图像压缩、修复、三维重建、工业视觉、机器人操控等 |
| 问题建模 | 逐像素二分类:预测对称轴(前景)与背景,以对称得分图形式输出 |
| 模型Backbone及选择原因 | 基于二面体群 D8 的等变卷积骨干网络,使特征具备旋转一致性;搭配逐层上采样 UDecoder 保留多尺度信息 |
| 损失函数 | 四个焦点损失等权相加:L_ori、L_rot、L_den、L_frot |
| 训练数据集 | DENDI(含多轴标注的反射对称数据集) |
| 测试数据集 | DENDI、NYU、LDRS、SDRW 以及新提出的 GMSYM |
| 训练方法 | 100轮,Adam优化器,学习率0.001,批量16,4块A100 |
| 实验效果 | DENDI上F1达65.52%,超过此前最优EquiSym约1个百分点;各旋转角度下均有提升 |
| 方法优势 | 抑制非对称区域伪影;借助旋转一致性实现更鲁棒的旋转等变预测;提供多场景多干扰新基准 |
| 方法缺点 | 仅针对反射对称;GMSYM基于DENDI派生而非全新采集;代码未开源 |
全新基准GMSYM:用复杂场景"拷打"对称检测算法
论文里另一个值得关注的产出是新的测试基准 GMSYM。为什么需要一个新基准?作者给出的理由很实在:现有的反射对称测试集,比如 SDRW、NYU、LDRS,普遍存在两个问题——图像没有按场景分类,也没有考虑带干扰的复杂情况。真实世界里的照片哪会那么干净?形变、噪点、马赛克,各种意外都有可能出现。
GMSYM 以 DENDI 为基础,把图像重新梳理并归入动物、人物、建筑、路标、花朵、猫、水果等场景,同时有意识地加入多种干扰——例如几何形变、高斯噪声、马赛克遮挡等,用来检验算法在"不完美"输入下的真实水准。换句话说,这个基准的目的就是专门给对称检测算法"上强度",看它在复杂世界里到底还能不能打。
这一手确实有意思——以后做对称检测的团队,终于不用只拿"清一色"的老数据集比来比去了,可以拉到 GMSYM 上正面碰一碰。
从数据到实战:四大数据集见证新SOTA的诞生
实验环节,作者在 DENDI、NYU、LDRS、SDRW 四个公开数据集以及新提出的 GMSYM 上进行了全面评估。训练用 DENDI,100 轮、Adam 优化器、学习率 0.001、批量大小 16、4 块 A100。评估指标包括 F1 分数、召回率(Recall)、精确率(Precision)、省略误差(OE)和正确分类百分比(PCC)等。