← 返回 PaperDaily 视觉与图像

LAMM和MS-Mapping都输了?这套UAV建图框架更会修图

无人机多会话建图最怕两件事:飞得远就漂,拼得多就歪。这篇论文把RTK时空对齐、不确定性感知因子图和粗到细优化串起来,思路完整,实验也很硬。

LAMM和MS-Mapping都输了?这套UAV建图框架更会修图
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
无人机多会话建图最怕两件事:飞得远就漂,拼得多就歪。这篇论文把RTK时空对齐、不确定性感知因子图和粗到细优化串起来,思路完整,实验也很硬。


原论文信息如下:
论文标题:
UAV-MapFusion: RTK-Aligned Uncertainty-Aware Coarse-to-Fine Multi-Session UAV Mapping
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.26928v1.pdf
项目链接:
MS-Fusion 是一个用于多场景地图合并及一致性优化的系统,主要解决不同场景下生成的地图在融合时出现的不一致性问题,通过算法优化实现高质量的地图合并。

01. 无人机建图难题:单次飞不完整,多次飞对不准

无人机做大场景建图,听起来像“飞一圈,世界就被装进点云里”。现实却很骨感:电池不够、存储不够、视角还老变。于是一个大场景往往要分成多次飞行采集,最后再把几段地图拼起来。问题来了——单次飞行会漂,多次飞行会歪,拼接时还容易出现“局部看着挺对,全局一拉全崩”的经典名场面。
这篇论文盯住的,就是这个让人头大的矛盾:既要压住长距离漂移,又要保住局部几何精度。只做全局对齐,容易把细节压扁;只做局部精修,又可能全局已经歪到姥姥家。于是作者把 RTK、场景图、因子图、粗到细优化串成了一套完整系统,目标非常明确:让多次飞行不只是“拼上了”,而是“拼得像一张图”。
图1:UAV-MapFusion系统总览
图1:UAV-MapFusion系统总览。输入包括多会话激光雷达点云、RTK测量和前端SLAM初始位姿;系统先做基于BTC的场景图构建,再进行MOGP-RTK时空对齐,最后通过不确定性感知的粗到细优化得到统一地图。
这里先把几个缩写掰开说清楚,免得读到后面脑子打结。RTKReal-Time Kinematic,中文常译为“实时动态差分定位”;它能提供比普通GNSS更稳的绝对位置信息。DTWDynamic Time Warping,中文是“动态时间规整”,常用来给两段节奏不完全同步的序列找对齐关系。MOGPMulti-Output Gaussian Process,中文是“多输出高斯过程”,这次主要用来把不连续、带噪声的RTK轨迹补成连续可用的时序估计。BTC 则来自原文引用的 BTC descriptor,一种点云检索描述子,出处见文中引用的 BTC [9]。

02. 打破僵局:RTK+粗到细优化,实现全局与局部双赢

本论文的核心思路可以概括成一句大白话:先把大框架拽正,再把小细节抹平。作者没有把“全局对齐”和“局部精修”当成二选一,而是设计成前后接力:先借助RTK给地图一个靠谱的世界坐标锚点,再在统一框架里做因子图优化,最后用平面约束去修局部几何。这个套路的妙处在于,它不是单纯靠某一个模块硬扛,而是让每个模块各司其职。
图3:粗到细优化流程
图3:粗到细优化流程。粗阶段把里程计、回环和RTK一起放进不确定性感知因子图,先把大范围漂移压下去;细阶段再重建体素地图,利用平面因子迭代优化位姿,进一步提升局部结构清晰度。
这套设计最值得点出来的地方,是它对“测量质量不一致”这件事很诚实。RTK并不是神仙定位,时间不同步、采样不连续、甚至掉帧,都会让它和激光里程计之间出现偏差。论文没有假装这些问题不存在,而是专门做了时空对齐,再把对齐后的RTK不确定性带进优化里。说白了,就是不让坏数据装成好数据混进来“碰瓷”。
更有意思的是,它的细化阶段并不是简单再跑一遍ICP之类的老办法,而是把点云里的平面结构抽出来,做成平面因子。平面在建筑、厂区、农田这类场景里非常常见,像地面、墙面、屋顶、田块边界,都自带“几何秩序感”。一旦位姿稍微对不齐,平面就会变厚、变糊、变成“毛边版地图”。所以用平面约束来修,思路很自然,也很对症。

03. 核心揭秘:场景图、RTK时空对齐与不确定性因子图

先看第一步:场景图构建。作者先用BTC描述子做会话内和会话间的回环检索,再用点到面ICP做几何验证,最后把同一物理场景里的多个session组织成一个连通分量。这里的连通分量不是数学课上那个“看起来很抽象”的东西,它其实就是:能互相连通、能互相传递约束的一组会话,放一起优化最靠谱。
公式1:场景图连通分量定义
公式1:C(v)= {u∈V | u 在图 G 中可从 v 到达}。意思很简单:从某个节点出发,沿着图里的边能走到的所有节点,都算进同一个场景图。这里的 V 是节点集合,G 是无向图,C(v) 就是以 v 为起点的连通分量。
接着是最“有脑子”的部分:RTK时空对齐。很多人以为RTK只要有了就能直接用,结果现实会用掉这份天真。问题在于RTK和激光里程计往往不是同一时钟,采样也不一定同步,甚至中间还会掉帧。作者先从运动明显的片段里提取速度变化,再用DTW去找两段序列的最佳对齐路径,估计时间偏移;然后再用MOGP把离散、缺失的RTK轨迹补成连续函数,最后把RTK位置映射到扫描时刻上。这个流程就像先校时,再补帧,最后再对号入座。
图2:DTW时间规整路径
图2:DTW时间规整路径。DTW会在两段运动序列之间寻找一条最优匹配路径,用来估计RTK与扫描位姿之间的时间偏移。它特别适合处理“节奏差不多,但时间轴不完全对齐”的数据。
公式2:MOGP局部训练集
公式2:𝒟* = {(tir, pir) | i ∈ 𝒩(t*)}。意思是:针对某个查询时刻 t*,只拿它前后最近的若干个RTK点来做局部建模,而不是把整条轨迹都塞进去。这样既省计算,又更适合非均匀采样和局部缺失。
公式3:MOGP观测模型
公式3:yia = fa(tir) + εia。这里 a 表示 x、y、z 三个方向之一,ε 是噪声项。作者还把RTK报告的精度信息放进噪声里,等于告诉模型:这个点有多靠谱,别一视同仁。
公式4:RBF核函数
公式4:RBF核函数。它的作用是描述时间上相近的RTK点更相似,离得越远相关性越弱。这里的 σf、ℓ 分别控制函数幅度和时间平滑程度,是高斯过程里最常见的一类核。
公式5:MOGP后验分布
公式5:p(fa(t*) | 𝒟*) = 𝒩(μa*, (σa*)2)。也就是说,模型不仅给出预测值,还给出不确定性。对建图来说,这个“我有多没把握”的信息非常值钱,因为它能直接影响后面的优化权重。
公式6:MOGP预测均值与方差
公式6:这是MOGP给出预测均值和方差的闭式表达。直白点说,它把“补出来的RTK位置”以及“这位置到底靠不靠谱”一起算出来,给后面的因子图提供完整输入。
最后是不确定性感知因子图。粗阶段里,里程计、回环和RTK因子一起进图优化;细阶段再把平面因子加进来,专门修局部结构。这里还有一个很关键的设计:不同因子的噪声不是拍脑袋设的,而是根据它们自身的质量来定。RTK因子用MOGP输出的协方差,平面因子则用平面厚度来表征可靠性。换句话说,谁更稳,谁说话更大声;谁更飘,谁就少插嘴。
公式7:平面因子噪声
公式7:σk = √(1/|Pk| Σ h²(π(p)))。平面越“厚”,说明局部几何越不稳定,这个因子就会被赋予更大的噪声;平面越薄,说明结构越清晰,优化时就更值得信任。
公式8:平面RMSE残差
公式8:rkplane = √(1/Mk Σ d²)。这就是平面因子的残差,衡量一帧里的点到对应平面的平均偏差。偏差越小,说明局部对齐越好。

04. 实验结果一览:全面碾压LAMM和MS-Mapping

实验部分选了8个场景,既有自采数据,也有公开的 MARS-LVIG 数据集,覆盖河岸、森林、工厂、农田、空旷机场、岛屿、乡镇和山谷。这个设计挺合理,因为它不是只挑“容易跑出好看结果”的场景,而是把开阔、重复结构、强视角变化、地形起伏这些难点都拉进来了。对于多会话无人机建图来说,这才像真实战场。
图4:自研数据采集平台
图4:自研数据采集平台。整套传感系统由作者团队自行设计搭建,深圳和佳木斯两地都采了数据。这个信息很关键,因为它说明论文不是只在“理想数据”上做文章,而是有真实部署背景。
评价指标也比较对路。AWDAverage Wasserstein Distance,中文可理解为“平均瓦瑟斯坦距离”,用来衡量全局一致性,越低越好;SCSSpatial Consistency Score,中文是“空间一致性得分”,用来衡量局部一致性,越低越好。简单说,AWD看地图整体歪没歪,SCS看局部细节糊没糊。
公式9:AWD定义
公式9:AWD = 1/M ΣWi。它就是把每个占据体素上的分布差异平均起来,数值越小,说明重建地图和参考地图越接近。
公式10:SCS定义
公式10:SCS = 1/M Σ σ(𝒲𝒩(i)) / μ(𝒲𝒩(i))。它看的是局部邻域里误差波动大不大,越小越说明局部结构稳定。
先看消融。论文把“原始结果”“去掉时空对齐的粗优化”“加上时空对齐的粗优化”“粗+细完整方案”放在一起比较,结论非常清楚:RTK时空对齐是必要的,平面细化也是必要的。少了前者,RTK约束会因为错位而把局部几何带偏;少了后者,虽然全局已经正了,局部还是会留下一层“毛边”。这说明作者的粗到细链路不是装饰品,而是真正起作用的两段式修复。
表1:八个场景上的消融实验
表1:八个场景上的消融实验。可以看到,从原始结果到完整方法,AWD和SCS都明显下降,说明RTK对全局漂移抑制有效,平面因子对局部结构修复也很关键。
再看和 LAMM、MS-Mapping 的对比。作者报告的结论是:在八个场景里,UAV-MapFusion 的 AWD 和 SCS 都是最优,尤其是 AWD 的提升更明显。这个结果其实很符合方法设计逻辑:LAMM 和 MS-Mapping 主要还是靠 LiDAR 内部约束和图优化,而本文额外引入了RTK这个外部全局观测,相当于给系统装了一个“别跑偏太远”的导航锚。对于森林、岛屿、山谷这种长距离漂移更严重的场景,这个锚点尤其值钱。
表2:与LAMM和MS-Mapping的基准对比
表2:与LAMM和MS-Mapping的基准对比。整体上,本文方法在8个场景中都取得最好结果,说明“RTK对齐 + 不确定性建模 + 平面细化”这条链条确实能同时兼顾全局和局部。
图5:森林场景定性消融对比
图5:森林场景定性消融对比。原始融合图在重叠区域出现了明显错位和层叠,偏移甚至可到十几米乃至更大;加入RTK时空对齐后,全局一致性明显改善;再加上细优化后,局部结构也更紧致了。这个图的说服力很强,因为肉眼就能看出“从乱到顺”的过程。

05. 优缺点与未来展望:虽好,但仍可优化

这篇论文的优点很明确:思路完整,模块之间衔接顺,且每一步都对应真实痛点。尤其是把RTK的时间错位、采样不连续和噪声不确定性都考虑进去,这种“把麻烦事先说透再处理”的态度,确实比那种“默认数据都很乖”的方案更接近工程现实。对无人机大场景建图来说,这类方法很有实用价值。
但它也不是无敌金身。首先,方法依赖RTK质量,若GNSS信号受遮挡严重,或者RTK本身漂得厉害,整体收益会打折。其次,MOGP和因子图优化都不是轻量级操作,虽然论文给出了可接受的实验设置,但在更大规模、更高频数据上,计算和调参成本仍然值得关注。再者,平面细化对“平面多”的场景很友好,但如果场景本身结构杂乱、平面稀少,收益可能没有那么夸张。
未来可以继续往两个方向走:一是把RTK对齐做得更自动、更鲁棒,比如面对更严重掉帧时仍能稳定估计时延;二是把局部几何细化从“平面”扩展到更多结构先验,比如边缘、曲面、语义区域等,让方法在复杂城市场景里也能继续保持稳定。若再结合更强的前端SLAM和更高效的后端优化,这条路线还有继续往产品化推进的空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是无人机多会话大场景建图里“全局漂移大、局部细节差、RTK又不同步”的三重麻烦。核心做法是先对齐RTK,再做不确定性感知的粗优化,最后用平面因子精修局部。

DTW 和 MOGP 分别在干什么?DTW负责找时间偏移,像给两段不同步的录像“对拍”;MOGP负责把离散且缺失的RTK轨迹补成连续预测,还能给出不确定性,方便后续优化按权重使用。

AWD 和 SCS 为什么都要看?AWD看全局一致性,SCS看局部一致性。只看一个指标容易“顾头不顾尾”,而多会话建图恰恰就是既要地图整体不跑偏,也要局部结构不发糊。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把RTK时空对齐、不确定性建模和粗到细优化串成统一系统,思路完整,且针对无人机多会话建图的痛点很准。

实验合理度:★★★★☆。消融、基准对比和定性结果都比较齐全,场景也不算“挑软柿子”,可信度不错。

学术研究价值:★★★★☆。对多会话点云融合、GNSS/RTK融合和因子图优化都有参考意义,后续还能继续扩展。

稳定性:★★★☆☆。有RTK加持后更稳,但对GNSS质量仍有依赖,极端遮挡环境下要打折。

适应性以及泛化能力:★★★☆☆。对大场景、开阔或半开阔无人机场景很合适,但对结构稀少或RTK受限场景,适配性一般。

硬件需求及成本:★★★☆☆。算法本身不算轻,但硬件主要依赖常规无人机平台和RTK传感器,成本中等。

复现难度:★★★☆☆。模块多、链路长,复现需要多种数据和较完整工程实现,但作者说明代码和数据会公开,算加分。

产品化成熟度:★★★☆☆。在有RTK条件的测绘、巡检、建图场景里有落地潜力,但还需要更强鲁棒性验证。

可能的问题:对RTK质量依赖较强,且粗到细链路较长;在GNSS弱、场景弱平面或大规模实时应用中,还需进一步优化。


主要参考文献

[6] LAMM: 相关多会话地图融合系统,原文对比方法之一。
[7] MS-Mapping: 相关多会话建图系统,原文对比方法之一。
[9] BTC descriptor: 原文用于场景检索与回环检测的点云描述子。
[24] GTSAM: 原文用于因子图优化的开源库。
[25] MARS-LVIG: 原文使用的公开多会话无人机数据集。

地图拼接老是歪?那就来龙哥读论文粉丝群一起拆招。无人机、机器人、SLAM、建图融合、RTK对齐,这些难题都能在群里聊明白。
扫描下方二维码,或者加龙哥助手微信号 kangjinlonghelper,备注“研究方向+地点+学校/公司+昵称”,更快进群~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。