← 返回 PaperDaily
视觉与图像
最新图像配准算法:不靠深度学习,亚像素误差降近5倍
图像配准要做到亚像素精度,传统傅里叶-梅林方法经常"差口气"。这篇论文把辅助函数方法无缝融入傅里叶-梅林框架,缩放、旋转、平移误差全面下降,还不靠深度学习,适合资源受限的落地场景。
龙哥读论文
发布于 2026-08-16 11:00:56
阅读 14
查看原文
原论文信息如下:
亚像素图像配准:当传统傅里叶-梅林方法精度不足时
图像配准(image registration)是让两张在不同视角、不同条件、不同时间拍摄的图像“对齐”到同一个坐标系下的技术。大家平时用手机拍HDR照片、晚上开多帧降噪,背后都有配准在干活;全景拼图、医学影像融合、三维重建更是离不开它。这类任务要估计图像之间的几何变换关系,最常见的是一组“相似变换”(similarity transformation),也就是平移、旋转加缩放。数学上可以写成:
配准方法大体分成两大流派。一类是基于特征的,先用SIFT、SURF、A-KAZE这类描述子提取关键点,再通过RANSAC剔除外点、估计单应矩阵;另一类是基于强度的,直接优化像素误差或估计光流(optical flow)。两种思路精度都不错,但在手机、嵌入式设备这类资源受限的场景,特征提取和迭代优化的计算量常让人头疼。最近几年深度学习也被用于单应性估计,效果很好,可模型推理的算力开销不是所有设备都扛得住。所以,如何在保持低计算成本的同时把精度做上去,一直是图像配准领域实在的痛点。基于特征的方法虽然对光照变化和遮挡有一定鲁棒性,但在纹理稀疏或重复纹理区域容易失效;基于强度的方法虽然能利用全局像素信息,但容易陷入局部最优。深度学习方法的精度上限很高,但依赖大量标注数据,且模型泛化能力在面对域偏移时可能大打折扣。相比之下,基于频域相关的方法具有计算效率高、无需训练、对光照变化不敏感等优点,因此一直是资源受限场景下的重要选择。
低成本方案里,基于二维互相关的方法一直是主力,频域上借助快速傅里叶变换可以算得飞快。其中,傅里叶-梅林变换(Fourier–Mellin Transform,FMT)配准是处理平移+旋转+缩放的经典代表。它的巧妙之处在于两个性质:第一,图像的傅里叶幅度谱对平移不敏感;第二,把幅度谱转到对数极坐标(log-polar)后,空间域的缩放和旋转会变成坐标轴上的平移。由此,缩放、旋转和平移都可以通过两轮互相关峰值检测来估计——复杂问题被拆成了两个“找峰值”的简单问题。问题在于,传统做法在离散格点上找相关峰位置,精度天然被像素分辨率限制。要做亚像素对齐,往往就“差口气”。具体来说,当真实变换参数落在整数像素之间时,离散相关峰的位置只能给出一个近似的整数估计,后续的亚像素细化通常依赖抛物线拟合或插值,这些方法在噪声存在时精度有限且不稳定。傅里叶-梅林方法虽然优雅,但它的精度瓶颈恰恰在于最后一步的峰值定位。
这篇论文的办法,是把一个原本用于纯平移场景的高精度相关峰定位算法——基于辅助函数方法(auxiliary function method,也叫MM方法,即majorization-minimization方法)的连续最大化算法——整体塞进傅里叶-梅林框架里。缩放和旋转估计用它在对数极坐标幅度谱上做连续相关峰定位,平移估计用它在空间域对校正后的图像做连续相关峰定位。两步都做到亚像素精度,且全程不依赖深度学习。下面逐一拆解。这种“组合式创新”的思路值得借鉴:将一个领域内成熟的高精度工具,巧妙地迁移到另一个相关问题的关键环节中,从而突破原有方法的精度瓶颈。它不需要设计全新的网络结构,也不需要大规模的训练数据,而是通过数学上的精确优化来换取性能提升。
辅助函数方法:从离散到连续的精度跃升
要读懂这篇论文,得先搞清楚辅助函数方法在配准里做什么。这里不涉及神经网络,只有数学优化。给定参考图像x和只发生平移的图像y,它们之间差一个位移Δp。衡量匹配程度最直接的工具是互相关函数:位移取到真实平移量时,相关性最强,配准就成了一个最大化问题。二维离散图像对应的互相关函数可以在频域写成如下广义形式:
利用互谱的共轭对称性,这个连续化的相关函数可以重写成一组余弦函数的线性组合。每个余弦函数都可以被一个二次函数从下方逼近,而二次函数的最大值存在解析解。这一步正是辅助函数方法的核心:交替执行两个步骤,一是“极小化/构造下界”(minorization),在当前位置构造目标函数的下界函数并保证两者相切;二是“最大化下界”(maximization),求出下界函数的极大值点,得到新的位置估计。因为下界始终压在目标函数下方,每次迭代都会推动目标函数单调上升,直到收敛到局部最大值。这种优化策略的优美之处在于,它将一个复杂的、非凸的最大化问题,转化为一系列简单的、具有解析解的二次函数最大化问题。每一次迭代都保证目标函数值不下降,因此算法具有稳定的收敛性质。而且,由于下界函数在当前位置与目标函数相切,迭代过程能够自适应地调整搜索方向和步长,通常只需要很少的迭代次数就能达到很高的精度。
这个思路最初由Yamaoka等人用于子样本时延估计,后来由Kinoshita等人扩展到二维互相关峰定位。本文的贡献,是让这个工具不再局限于纯平移,而是把它推广到缩放和旋转的估计上。这种推广并非简单的套用,而是需要仔细设计如何将对数极坐标变换后的幅度谱与辅助函数方法相结合。由于对数极坐标变换本身引入了非线性重采样,幅度谱在变换后的网格上不再具有简单的解析形式,因此需要巧妙地处理插值和梯度计算。论文作者在这方面做了细致的工作,确保了算法在实际实现中的稳定性和精度。
两阶段估计框架:先尺度旋转后平移
有了亚像素相关峰定位工具,剩下的问题就是怎么在傅里叶-梅林框架里用好它。先回顾它如何把缩放旋转变成平移。傅里叶变换有一个著名性质:图像在空间域平移,其幅度谱不变。更一般地,如果图像y是x的相似变换结果,那么二者幅度谱满足如下关系:
但直接使用原始幅度谱有个坑:自然图像的频谱能量大多集中在低频,直接做相关,结果容易被直流和近直流分量主导,中高频的纹理结构反而贡献不大,而中高频恰恰对缩放旋转估计最有帮助。论文的解法是使用对数幅度谱(log-magnitude spectrum):
整个流程分成两个阶段,如图1所示。第一阶段,计算参考图像与待配准图像的幅度谱,进而得到对数幅度谱并映射到对数极坐标网格;用辅助函数方法最大化两者的相位相关,得到对数极坐标下的位移估计,换算回缩放因子和旋转角;接着用这两个参数对待配准图像做缩放和旋转补偿,得到校正图像。第二阶段,在空间域对参考图像与校正图像用同样方法最大化相位相关,估计平移量,最后补偿平移,得到最终对齐图像。这种两阶段的级联设计是合理的:先估计全局的缩放和旋转,再进行平移对齐。因为如果直接估计平移,缩放和旋转的存在会使平移估计失效;而先校正缩放和旋转后,剩下的纯平移问题就简单了。两个阶段都使用相同的辅助函数方法,保持了算法的一致性,也便于实现和调优。
与传统傅里叶-梅林配准最大的区别在于:传统方法所有峰值检测都在离散格点上完成,只能依赖插值近似;本文把所有互相关最大化都换成基于辅助函数方法的连续优化,因此缩放、旋转、平移三个参数都能达到亚像素精度。整个算法依然只有FFT和迭代更新,不训练任何网络,也不需要GPU,理论上很适合放在资源受限的设备上。从算法复杂度来看,主要计算量集中在FFT和迭代更新上。FFT的复杂度为O(NM log(NM)),迭代更新每次的复杂度为O(NM),通常迭代次数在10次以内。因此总复杂度与传统的傅里叶-梅林方法处于同一量级,只是常数因子更大。这种计算特性使得它在CPU上也能高效运行。
实验结果:精度全面提升但计算成本增加
实验数据来自超高清宽色域标准图像集中的三张2K图像:MusicBox、Moss和Ship,如图2所示。每张原图被随机施加一次相似变换并裁剪出256×256的图像区域,重复五次,生成五对测试图像。变换参数的取值范围如表I所示:旋转角-30度到30度,缩放因子0.8到1.2,水平和垂直平移均为-5到5像素,基本覆盖了典型抖动和缩放场景。作为基线,论文使用标准的傅里叶-梅林配准方法,该方法通过最大化离散互相关来估计参数。计算DFT时,本文方法施加了标准差为输入信号长度1/5的高斯窗。选择这三张图像的原因是它们具有不同的纹理特征:MusicBox包含丰富的细节和边缘,Moss具有细腻的纹理,Ship则包含较大的平滑区域和结构特征。这种多样性有助于评估算法在不同类型图像上的表现。每张图像生成5对测试样本,总共15对测试图像,虽然规模不大,但足以初步验证方法的有效性。
两种方法在每对图像上的绝对误差如表II所示。从结果看,无论是MusicBox、Moss还是Ship,本文方法在水平平移、垂直平移、缩放因子和旋转角四类参数上的平均绝对误差都显著小于基线。举几个直观数字:MusicBox的水平平移平均误差从基线的0.340像素降到0.056像素,旋转角平均误差从0.509度降到0.101度;Moss的水平平移平均误差从0.174像素降到0.043像素;Ship的旋转角平均误差从0.263度降到0.093度。虽然个别测试对的某个参数误差略有波动,但整体趋势非常一致:把离散相关峰定位换成连续优化之后,精度全面上了一个台阶。值得注意的是,缩放因子的误差也从基线的0.002-0.003量级降低到了0.0005-0.001量级,这对于需要精确尺度估计的应用(如多分辨率图像融合)具有重要意义。旋转角的误差降低尤其明显,从0.5度左右降到0.1度左右,这对于需要精确角度对齐的任务(如工业检测)非常关键。
原文还展示了两个典型对齐效果:图3是MusicBox第3对图像的结果,图4是Moss第4对图像的结果。肉眼可见,两种方法都能基本对齐,但基线的边缘处残余错位更明显一些,本文方法的结果更干净。对“差口气”的应用来说,这正是决定成败的细节。从视觉对比中可以观察到,基线方法在图像边缘和纹理丰富区域存在明显的重影或模糊,而本文方法的结果则更加锐利和清晰。这种视觉上的差异与数值误差的降低是一致的,进一步验证了方法的有效性。
精度提升的代价是计算时间变长。实验机器配置如表III所示,所有计算均在CPU上完成,未使用GPU加速,计时采用Python的time.perf_counter()。表IV给出了两种方法的总执行时间:对三张图的五对样本,基线平均耗时在5.7~8.0秒之间,本文方法平均耗时在16.9~24.5秒之间,约为基线的2.75~3.08倍。多出来的时间主要花在辅助函数法的迭代更新上。从绝对时间来看,对于256×256的图像,本文方法在CPU上需要约20秒完成配准,这个速度对于离线处理是可以接受的,但对于实时应用(如视频防抖)则显得较慢。不过,考虑到算法尚未经过优化,且迭代次数和收敛阈值都有调整空间,实际部署时可以通过多种手段来加速。
这个trade-off很清晰:辅助函数方法换来的亚像素精度不是免费的,每轮迭代都要构造并最大化一个二次下界函数,迭代次数直接决定耗时。论文的实验设计相对克制,变换参数范围固定,数据只有三张图各五对,主要对比对象是同类傅里叶-梅林离散相关方法,没有与SIFT、光流、深度单应估计等方法做横向对比,也没有加入噪声、遮挡、光照变化等更严苛的条件。因此准确地说,论文证明的是“在傅里叶-梅林框架内,辅助函数方法能显著提升参数估计精度”,而非“在所有配准算法中准确率最高”。同时要看到,平均误差从0.3像素量级降到0.05像素量级,对很多需要高精度对齐的工业场景而言,这个提升是可感知、可用的。例如,在印刷电路板(PCB)的自动光学检测中,元件对齐误差需要控制在0.1像素以内,本文方法能够满足这一要求。在医学图像配准中,亚像素级的精度对于病灶的准确定位和尺寸测量至关重要。
局限与展望:更高效、更鲁棒的配准之路
论文的方法在精度上确实亮眼,但短板也很明显。第一,计算成本明显增加,约为基线的3倍,对实时应用是不小的压力;在手机上做HDR多帧合成或实时视频防抖,还得继续优化。第二,对数极坐标重采样使用的是双三次插值,插值本身会引入新的误差源,论文也把“调研替代插值方案”列为未来工作。第三,实验只用了随机相似变换的合成数据,没有涉及真实拍摄中常见的噪声、运动模糊、遮挡,也没有测试更大旋转角度或更极端缩放。第四,对比对象是传统傅里叶-梅林方法,缺少与SIFT、光流以及深度配准方法在同一基准上的全面比较。这些局限性意味着,虽然方法在受控条件下表现优异,但其在真实复杂场景中的鲁棒性还有待验证。例如,在低光照或高噪声环境下,相位相关的性能可能会下降,辅助函数方法的收敛性也可能受到影响。
展望方面,这个方向还有不少可挖的点。比如把辅助函数方法与金字塔或多分辨率策略结合,先在低分辨率粗定位、再在高分辨率细优化,既保留亚像素精度又能压低计算量;又比如将log-polar重采样换成更精确的插值核,或引入可学习参数来校准插值误差。更进一步,基于强度的高精度相关峰定位思路不仅可以用于相似变换,也可以推广到仿射变换、非刚性形变,甚至与深度特征结合,在更复杂的配准任务里继续发挥作用。多分辨率策略是加速迭代收敛的有效手段:在低分辨率下,相关峰更平滑,迭代可以快速接近最优解;然后在高分辨率下进行精细调整,通常只需要很少的迭代次数。这种由粗到细的策略在图像配准领域已被广泛验证,与辅助函数方法结合有望在保持精度的同时大幅降低计算时间。此外,将辅助函数方法与深度学习特征结合也是一个有趣的方向:用深度网络提取鲁棒的特征图,然后在特征图上使用辅助函数方法进行精确的几何参数估计,这样既能利用深度学习的表征能力,又能保持几何优化的精确性。
龙迷三问
这篇论文到底在解决什么问题? 东海大学与东京都立大学针对傅里叶-梅林配准在亚像素估计上的精度瓶颈,将辅助函数方法引入缩放-旋转与平移两阶段估计。在随机相似变换图像对上,缩放、旋转、平移误差较离散互相关基线全面下降,无需深度学习即可实现高精度图像配准。
这篇工作最值得看的点是什么? 在三个图像集的所有评估参数上,所提方法的平均绝对误差均小于基线方法。例如,MusicBox图像集上水平平移误差从0.340降至0.056像素,旋转误差从0.509降至0.101度,尺度误差从0.005降至0.001。
这篇工作的边界或风险在哪里? 优点:(1) 将辅助函数方法成功应用于傅里叶-梅林框架,实现了亚像素精度的相似变换参数估计;(2) 使用对数幅度谱减少了低频分量主导问题,提高了估计稳定性;(3) 两阶段估计策略清晰有效。缺点:(1) 计算复杂度较高,约为基线方法的3倍;(2) 实验规模较小,仅使用3幅图像各5对测试;(3) 缺乏与更多先进方法的对比;(4) 对数极坐标重采样使用双三次插值,可能引入额外误差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出将辅助函数方法(MM方法)用于傅里叶-梅林框架中两个阶段的连续互相关最大化,实现相似变换参数(尺度、旋转、平移)的亚像素精度估计。
实验合理度: ★★★★☆
绝对误差(水平平移、垂直平移、尺度因子、旋转角度的绝对误差)
学术研究价值: ★★★★☆
提出将辅助函数方法(MM方法)用于傅里叶-梅林框架中两个阶段的连续互相关最大化,实现相似变换参数(尺度、旋转、平移)的亚像素精度估计;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在Intel Core i7-1185G7 CPU上,处理256×256图像对的总执行时间约为16.9-24.5秒(5对图像平均),约为基线方法的2.75-3.08倍。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ,提高了估计稳定性;(3) 两阶段估计策略清晰有效。缺点:(1) 计算复杂度较高,约为基线方法的3倍;(2) 实验规模较小,仅使用3幅图像各5对测试;(3) 缺乏与更多先进方法的对比;
主要参考文献
[1] B. Reddy and B. Chatterji, "An FFT-based technique for translation, rotation, and scale-invariant image registration," IEEE Trans. Image Process., vol. 5, no. 8, pp. 1266-1271, 1996.
[2] Y. Kinoshita, K. Yamaoka, and H. Kiya, "Maximization of 2D cross-correlation based on auxiliary function method for image alignment," APSIPA Annual Summit and Conference, pp. 2043-2047, Nov. 2023.
[3] C. D. Kuglin, "The phase correlation image alignment method," Proc. Int. Conf. Cybern. Soc., pp. 163-165, Sep. 1975.
[4] K. Takita, T. Aoki, Y. Sakai, T. Higuchi, and K. Kobayashi, "High-accuracy subpixel image registration
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!