← 返回 PaperDaily 视觉与图像

CVPR新思路?无对应点云配准快10倍

点云配准里最烦的事,不是算不动,而是先得“找对象”。这篇 Generalized-CVO 直接把对应点这一步掀桌子,改用各向异性核和二阶黎曼优化,速度和鲁棒性都挺能打。

CVPR新思路?无对应点云配准快10倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
点云配准里最烦的事,不是算不动,而是先得“找对象”。这篇 Generalized-CVO 直接把对应点这一步掀桌子,改用各向异性核和二阶黎曼优化,速度和鲁棒性都挺能打。


原论文信息如下:
论文标题:
Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization

发表日期: 2026年06月

发表单位: 没有

原文链接: https://arxiv.org/pdf/2606.10019.pdf

告别点对点匹配:点云配准的“无对应”新范式

点云配准这事,说白了就是把两堆三维点“摆正站队”,让它们在同一个坐标系里对齐。传统路线最常见的思路,是先给每个点找“对象”,再根据这些对应关系去估计位姿。问题也很现实:环境一旦 特征稀疏,比如高速公路、乡野道路、空旷赛道,点云就像一群穿同款灰衣服的人,谁跟谁都不太好认。
这篇论文的思路很直接:别找对应点了,直接把点云当成连续函数来对齐。它沿用的是 RKHS(Reproducing Kernel Hilbert Space,再生核希尔伯特空间)这条线。简单理解,就是把离散点集合“熨平”成一张连续的函数图层,再比较两张图层之间的重合程度,而不是一对一地拎点去配对。这样一来,噪声、离群点、局部缺失带来的麻烦会小很多。
图1:基于各向异性核嵌入的无对应点云配准框架,局部通过二阶黎曼高斯牛顿优化求解。
图1把核心流程讲得很清楚:点云先被映射到 RKHS 里,随后通过一个局部优化过程不断调整位姿,最后把一帧帧扫描拼成稳定的轨迹。这里最关键的变化是,目标函数不再依赖显式对应关系,而是最大化两个函数表示之间的内积。换句话说,传统方法像“先相亲再结婚”,这套方法更像“先同居再磨合”——少了中间那堆找对象的体力活。
为了让读者不被术语劝退,先把几个核心概念捋顺。位姿就是三维空间里的旋转加平移;流形可以理解成“带弯曲结构的空间”,在这里是 SE(3),也就是三维刚体运动群;黎曼优化则是在这种弯曲空间上做优化,不能把它粗暴地当成普通欧式平面来算,不然容易把几何结构算歪。

各向异性核函数:让点云“感”知几何表面

如果只把点云看成一堆点,确实太“平”了。现实里的点云大多来自表面扫描:车身、墙面、地面、路沿,背后其实藏着明显的局部几何结构。论文的第一个创新点,就是把原先的各向同性核,换成了各向异性核函数。各向同性核像一颗圆球,四面八方一视同仁;各向异性核则像一个被压扁的椭球,对不同方向赋予不同权重。
这招为什么有用?因为表面配准时,法向方向通常更敏感,切向方向则允许一定滑动。直白点说,沿着墙面“横着蹭一蹭”问题不大,但往墙里“戳进去”就不行。各向异性核正是把这种直觉写进了数学里:沿法向更严格,沿切向更宽松。这样既能贴住表面,又不会被局部点分布牵着鼻子走。
图2:原始点云与重采样点云,边缘与表面点在协方差特征上被区分出来。
图2展示的是论文如何根据局部协方差判断点属于边缘还是表面。这里的协方差矩阵可以理解成“局部形状指纹”:如果某个方向的变化特别小,说明点云在这个方向上很平,往往对应表面;如果有两个小特征值,则更像边缘。论文用这个局部统计量去构造核函数,让核不再是无脑圆球,而是会“看地形”的椭球。
公式:点云在 RKHS 中的函数表示。
这条公式表示:点云 X 被写成若干核函数的加权和。c(ℓX) 是特征权重,k(x,·) 是核函数。它的意思很朴素:别直接拿点去打架,先把点云变成“函数画像”,再比谁更像谁。
公式:RKHS 中两帧点云的距离表达。
这条式子说明了一个关键事实:两帧点云在 RKHS 里的距离,最终只剩下一个需要优化的交叉项。也就是说,只要把这个交叉项做大,两帧就更对齐。论文把配准问题改写成了一个最大化内积的问题,形式上更优雅,计算上也更容易做局部迭代。
公式:最大化两帧点云函数内积的配准目标。
这就是无对应配准的核心目标。传统 ICP 像是在茫茫人海里先找配对对象,再谈感情;这里则是直接让整体“函数相似度”最大化,少了对应搜索这一步,鲁棒性自然更容易上来。

二阶黎曼优化:从“蜗牛”到“猎豹”的加速

如果只把目标函数写得漂亮,但求解器还是老一套,那大概率会陷入“理论很美,算得很慢”的经典尴尬。论文第二个核心贡献,就是把原先常见的一阶梯度上升,升级成了二阶黎曼高斯牛顿(Riemannian Gauss-Newton,黎曼高斯牛顿法)优化。简单理解,一阶方法只知道“往坡上走”,二阶方法还知道“坡弯不弯、弯多少”,因此通常收敛更快。
公式:左不变黎曼度量的内积定义。
这条公式定义了 SE(3) 上的度量方式。ω 表示旋转分量,v 表示平移分量。它们被放在同一个度量框架下,意味着优化时不会把“转一转”和“挪一挪”混成一锅粥。
公式:黎曼 Hessian 的定义。 公式:Hessian 由梯度的方向导数和修正项组成。
这里的关键是:在流形上,梯度和 Hessian 都不能照搬欧式空间的写法。论文用了联络项把“不同切空间里的向量怎么比较”这件事补齐。说人话就是,别在弯弯曲曲的空间里硬拿直尺量弧线,先把规则定对,后面才不会瞎跑。
公式:Riemannian gradient 的显式表达。
这条式子把梯度拆成了平移项和旋转项。它们都依赖于当前变换后的残差 rij 和局部协方差 Σij。可以把它理解成:哪个方向还没对齐,梯度就往哪个方向使劲。
公式:二阶黎曼高斯牛顿更新。
这就是 G-CVO-2 的更新公式。它不是单纯沿梯度迈一步,而是借助近似 Hessian 直接算出更合适的步长和方向。论文还特意做了近似:只保留最主要的二阶项,避免“精度提升一点,代价翻一倍”的得不偿失。这个取舍挺务实,毕竟工程里最怕的不是不优雅,而是太优雅导致算不动。

KITTI/赛车/室内三场景“屠榜”:性能全面领先

实验部分的设计比较完整:先看城市驾驶场景,再看特征稀疏的赛道环境,最后补上室内 RGB-D 数据集。这样的安排很合理,因为它能逐步验证两件事:一是各向异性核是否真的能处理局部几何;二是二阶优化是否真的能把速度拉上来,而不是只会纸上谈兵。
表1:标准 KITTI 序列上的配准误差对比。
表1显示,在 KITTI 的标准序列上,G-CVO-2 在平均平移误差上优于传统 CVO 和多数基线方法,旋转误差也保持在很有竞争力的水平。尤其是在 01、04 这类特征不那么密的高速路段,方法优势更明显。这个结果说明:当对应关系变得不靠谱时,无对应的 RKHS 建模确实更能顶住压力。
图3:KITTI 序列 01 上 G-CVO 与基线方法的可视化对比。
图3更直观:叠加后的轨迹越整齐,说明帧间对齐越稳定。G-CVO 的轨迹在关键转弯和长直路段上都比较平滑,没有出现“越配越歪”的经典翻车现场。对做自动驾驶和机器人定位的人来说,这种稳定性比单次峰值指标更重要。
表2:三条特征稀疏赛车序列上的配准误差对比。
表2才是这篇论文最能证明“不是花架子”的地方。赛道环境里点云稀疏、运动快、视角变化大,传统对应式方法很容易找不到靠谱匹配。G-CVO-2 在三个序列上都保持了较好的误差水平,而 G-CVO-1 明显慢了一截,说明二阶优化的价值不是摆设,而是实打实地把收敛效率拉起来了。
图4:赛车数据集上的真值轨迹与 G-CVO-2 跟踪结果。
图4里,空旷赛道和土路场景都能看出 G-CVO-2 的轨迹跟得比较稳。尤其是在点云信息很少的区域,方法依然能维持连续跟踪,没有轻易“跑偏”。这说明各向异性核在稀疏场景里并不只是锦上添花,而是真能帮上忙。
表3:ETH3D 五个 RGB-D 序列上的跟踪误差。
室内 RGB-D 场景进一步说明,这套方法不只适用于激光雷达。表3里,G-CVO 在 ETH3D 上同样保持了不错的跟踪精度,证明它对不同传感器模态有一定适应性。也就是说,这不是“只会在车上跑”的专用小把戏,而是有机会扩展到更一般的局部配准任务。
图5:ETH3D 上基线方法与 G-CVO 的轨迹对比。
图5里,G-CVO 的堆叠轨迹更紧凑,说明局部误差不会越积越大。对于长期跟踪任务,这一点特别关键,因为配准稍微漂一点,后面就会像滚雪球一样越来越离谱。
公式:第一步更新方向由梯度和步长共同决定。 公式:一阶梯度上升的位姿更新。
论文对比了一阶和二阶方法的收敛时间。结论很朴素:一阶方法虽然每步便宜,但步子小、试探多;二阶方法虽然每步更贵,却更像“看准了再走”,总体时间反而更优。这个结论和直觉一致,尤其在高频跟踪任务里,少迭代几轮往往比单步便宜更重要
图6:不同优化器迭代过程中的误差变化。
图6很能说明问题:二阶方法的误差下降更快,目标函数也更快进入稳定区间。这类收敛曲线比单个数字更有说服力,因为它直接告诉读者——这不是“最后撞大运撞出来的结果”,而是优化过程本身更顺滑。
图7:不同优化器的平均收敛时间对比。
图7则把“快”这件事说透了:G-CVO-2 的平均收敛时间明显优于 G-CVO-1,说明二阶信息确实值回票价。论文还讨论了 warm start,也就是用恒速假设给上一帧一个初值,这在实际里很常见,属于能白捡就别浪费的工程技巧。
图8:不同点数规模下的收敛时间与精度权衡。
图8展示了一个很现实的问题:点越多,精度可能更好,但时间也会更长。G-CVO 在不同点数规模下都能保持不错的精度-速度平衡,说明它不是只会在“低分辨率省电模式”下表现好。

该方法的局限性与未来展望

这篇论文的思路很完整,但也不是“万能钥匙”。首先,局部协方差要算得靠谱,点云本身就不能太离谱;如果传感器噪声特别大,或者局部结构极不稳定,各向异性核的收益会打折。其次,二阶方法虽然快,但实现上比一阶梯度法更复杂,对工程调参和数值稳定性也更挑剔。
更进一步地说,这类方法目前主要还是局部配准,适合有较好初值的 tracking 场景。若初始位姿偏差很大,或者场景重复纹理、重复结构特别强,单靠局部 RKHS 对齐未必能稳稳拿下。未来如果能把这种无对应局部配准和全局初始化、更强的语义特征或多模态信息结合起来,实用性会更上一层楼。
图10:赛车数据集的三种场景示意。
图10补充说明了赛车数据集的三种环境:Skid Pad、Race Track 和 Dirt Track。它们共同的特点就是“对定位不太友好”,非常适合检验一个局部配准方法到底是真有本事,还是只会在舒适区里打转。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是局部点云配准里“先找对应再优化”太慢、太脆的问题。方法用 RKHS 把点云连续化,再用各向异性核编码局部几何,最后用二阶黎曼优化快速求解。

RKHS 是什么,为什么老被提到?RKHS 是再生核希尔伯特空间,可以把离散点云映射成连续函数,方便用核函数衡量整体相似度。它的好处是不用显式找点对点对应,抗噪声和离群点能力通常更强。

各向异性核和普通核差在哪?普通核对所有方向一视同仁;各向异性核会根据局部协方差给不同方向不同权重,更贴近表面扫描的真实几何结构,所以在边缘、表面和稀疏区域通常更稳。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把无对应 RKHS 配准和各向异性局部几何结合起来,思路比较新,尤其是把表面结构直接塞进核函数里,挺有辨识度。

实验合理度:★★★★☆。城市、赛道、室内三类场景都覆盖了,还补了收敛时间和消融,实验链条比较完整;不过部分基线在不同数据集上的可比性仍要看实现细节。

学术研究价值:★★★★☆。它不是只做一个工程小修补,而是在无对应配准这个方向上往前推了一步,对后续局部配准、鲁棒跟踪都有启发。

稳定性:★★★☆☆。比传统对应式方法更稳,但仍依赖局部结构质量和合理初值,离“拿来就能闭眼上车”还有距离。

适应性以及泛化能力:★★★★☆。从 LiDAR 到 RGB-D 都做了验证,适应性不错;但面对大初值误差时,它仍然更像局部选手。

硬件需求及成本:★★★☆☆。二阶优化让速度上来了,但核计算和局部协方差估计仍有开销,算力要求不算低。

复现难度:★★★☆☆。方法本身公式完整,但涉及流形优化、核设计和 CUDA 实现,复现门槛不算低。

产品化成熟度:★★★☆☆。适合局部跟踪和高精度配准模块,若要直接进产品,还需要更强的初始化、异常处理和实时系统集成。

可能的问题:思路漂亮,工程也扎实,但对初值、噪声和局部结构质量仍较敏感;大幅失配场景下还得靠更强的全局模块托底。


主要参考文献

[1] Absil, Mahony, Sepulchre. Optimization Algorithms on Matrix Manifolds.
[5] Besl, McKay. A Method for Registration of 3-D Shapes.
[16] Continuous Visual Odometry (CVO) 相关工作,论文中作为 RKHS 配准基础引用。
[23] CVO 原始论文,本文各向异性 RKHS 配准的直接基础。
[22] Geiger et al. KITTI 数据集。
论文原文链接:https://arxiv.org/pdf/2606.10019.pdf

点云配准一旦“对上眼”,机器人和自动驾驶就不容易迷路。想继续看这类高能又能落地的论文拆解,欢迎加入龙哥读论文粉丝群,一起把匹配、优化、SLAM这些硬骨头嚼碎。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。