← 返回 PaperDaily 视觉与图像

北航北邮提出GeoUP:一个骨架统一三大3D感知任务,五大驾驶基准SOTA

自动驾驶3D感知,向来是深度、检测、占用各学一套。北航与北邮提出的GeoUP,直接把视觉几何基础模型VGGT改造成统一3D感知骨架,一个模型三大任务全包,在nuScenes、Waymo、Argoverse 2、KITTI、DDAD五大基准拿下SOTA。思路清奇,落地潜力值得关注。

北航北邮提出GeoUP:一个骨架统一三大3D感知任务,五大驾驶基准SOTA
原论文信息如下:
论文标题:
Geometry-Grounded Unified 3D Perception for Autonomous Driving(GeoUP:面向自动驾驶的几何基元统一3D感知)
发表日期:
2026年08月

发表单位:
北京航空航天大学(Beihang University)、北京邮电大学(Beijing University of Posts and Telecommunications)

原文链接:
https://arxiv.org/pdf/2608.13147v1.pdf

项目链接:
https://buaa-colalab.github.io/geoup_page

引言

开车这件事,人类靠两只眼睛就能搞定,但换成纯视觉的自动驾驶系统,事情就没那么简单了。摄像头拍回来的是二维图像,而车要理解的是一个三维世界——不仅要知道前方有辆车,还要知道它离自己多远、朝哪个方向开、会不会下一秒就窜到跟前。为了把这个二维到三维的鸿沟填上,研究者们把问题拆成了几个经典子任务:深度估计负责恢复每个像素对应的距离,3D目标检测负责在空间中框出物体实例,语义占用预测则把整个空间划分成体素、逐格标注语义类别。
有意思的是,这三个任务本质上描述的是同一个3D场景:深度是曲面的几何,检测是实例的几何,占用是体积的几何。既然底层的物理世界是同一个,为什么偏要让每个任务各自搭一套特征提取器、各学各的几何?这正是北航与北邮团队在GeoUP里试图回答的核心问题——能不能用一个统一的、自带几何属性的视觉表征,把三个任务一次性全包了?
所谓“自带几何属性”,指的是图像编码器提取的特征里本身就包含度量的3D结构信息,而不是靠后续任务模块临时“脑补”出深度和空间关系。过去大家常用的ImageNet预训练骨干,学的是语义识别,对几何几乎无感;后来有人用单目深度预训练来增强几何感知,但单帧的深度估计又缺了多相机一致性和时序连续性。GeoUP的答案是直接站在VGGT的肩膀上——这是一个以多图3D重建为目标训练的视觉几何基础模型,它的隐表征天生就是三维结构化的,语义信息由DINOv2编码器提供,几何信息由重建目标约束,两者放在一起,恰好是自动驾驶感知最想要的那杯茶。

从语义识别到几何感知:自动驾驶3D感知的范式转变

要理解GeoUP的位置,得先回顾自动驾驶3D感知里"预训练"这件事的演变。
过去很长一段时间,纯视觉方案的图像骨干网络都用ImageNet预训练,学到的是语义识别能力——能把物体分类得很清楚,但对三维结构和度量距离却近乎"绝缘"。摄像头返回的是2D图像,下游任务却需要恢复3D度量结构。为了弥补这个鸿沟,传统方案只能在任务模块里各自补课:3D检测网络里加深度估计分支,占用预测网络里加BEV(Bird's Eye View,鸟瞰视角)变换,深度估计网络单独训练一个编码器……这样做的结果就是,深度、检测、占用各学各的几何,彼此之间的表征无法互通。
后来慢慢有人意识到光靠语义预训练不够,开始用单目深度估计做几何预训练,给模型加上"深度感"。但单目深度本质上还是一个模糊的三维线索,缺少多视图一致性。骨干网络学到的是"一些几何先验",而不是"一个结构化的3D场景表征"。
视觉几何基础模型的兴起带来了一个新选择。这类模型用大规模多视角3D重建目标训练,输入多张图片就能同时预测相机参数、深度图、点图、对应关系,隐空间里的特征天然就是三维结构化的。VGGT是其中最典型的代表。VGGT全称Visual Geometry Grounded Transformer,是一个前馈式视觉几何基础模型,它的骨干是DINOv2——Meta训练的自监督视觉特征模型,提供语义判别力;而重建目标则强行让表征携带真实的3D几何结构。两者组合,恰好是自动驾驶感知最需要的"语义+几何"双卡双待。
论文开头用一张图对比了三种预训练范式:
图1:自动驾驶3D感知预训练范式对比。左侧为语义识别预训练,中间为几何预训练,右侧为3D重建预训练(VGGT)。
图1:自动驾驶3D感知预训练范式对比。(a) 语义识别预训练,(b) 几何预训练,(c) 3D重建预训练。
从图里可以看到,最右边的3D重建预训练同时具备语义丰富度、几何感知和时序一致性。但VGGT不是为驾驶场景直接设计的,有三个问题需要解决:第一,没有显式注入相机标定信息,模型不知道绝对度量尺度;第二,全局跨图注意力计算开销巨大;第三,没有对时间维度和跨视角维度做区分。GeoUP的核心思路,就是把这套重建导向的表征"平移"到自动驾驶上,并做三项关键改造:注入标定感知的光线图编码、分解时空注意力、多任务统一解码。

GeoUP核心设计:分解注意力与标定感知光线图注入

GeoUP的输入是一段同步的多相机环视视频,假设有V个相机、T帧时间窗口。每帧图像切patch后经过DINOv2编码成patch token。为了减少冗余计算,历史帧的token会被缓存,每个推理时刻只需编码当前帧图像。
图2:GeoUP整体流程。多视角输入经过光线图编码注入几何感知token,经分解注意力骨干后解码出深度、检测、占用和相机位姿。
图2:GeoUP整体流程示意图。输入流式多视角图像,构造几何感知token后经分解注意力骨干处理,并行解码深度、检测、占用与相机位姿。
接下来是第一个精妙设计——光线图注入
自动驾驶场景里,每个传感器都有精确的标定参数:内参描述相机的焦距、光心,外参描述相机在世界坐标系或车体坐标系下的位姿。既然标定已知,为什么不直接把它用起来?GeoUP将每个patch中心投影成一条空间光线,用Plücker(普吕克)坐标表示。Plücker坐标是空间直线的一种参数化方式,包含一个方向向量和一个矩向量,用6个数字即可完整描述一条光线的位置和朝向。公式如下:
公式1:光线图编码公式。R_t^v(x,y) = MLP(Proj(x,y,K_t^v,E_t^v))
公式1:光线图编码公式。其中K是相机内参矩阵,E是相对参考帧的外参矩阵,Proj(x,y,K,E)把像素坐标映射成6维Plücker表示,再经MLP投影到token维度。
这个ray embedding加到patch token上以后,每个token都携带了它对应光线的绝对方向和位置信息。模型对相机几何和度量尺度就有了天然感知。更妙的是,depth head解码深度时还会再注入一次内参信息,让深度分支更清楚每个相机的成像几何,帮助减少跨数据集的域差距。
第二个设计是token构造。GeoUP沿用VGGT中的camera token和register token机制:
公式2:token构造公式。Z_t^v = Concat([C_t^v; Q_t^v; X_t^v])
公式2:token构造公式。C为camera token记录全局相机几何信息,Q为register token提供额外的可学习容量,X̃为几何增强后的patch token。当前帧(参考帧)使用独立的camera token embedding,非参考帧共享另一个。
第三个设计也是最核心的改造——注意力分解。原始VGGT对所有输入token做全局跨图注意力,token规模一大计算量就爆炸,而且时间维度和视角维度的对应关系被混在一起。GeoUP把它拆分成依次执行的三步:
公式3:分解注意力更新公式。F^(l) = Attn_view(Attn_temp(Attn_self(F^(l-1))))
公式3:GeoUP Transformer层的分解注意力更新公式。自注意力(self)在每帧图像内部建模上下文,时间注意力(temporal)沿时间轴聚合同一相机不同帧的特征,视角注意力(view)在同一时刻跨相机交换信息。
三种注意力的执行顺序是经过实验验证的最优解:先理解单帧内容,再理解时序运动,最后融合空间视角,信息流更加自然。论文的图解很直观:
图3:GeoUP分解注意力示意。自注意力在单帧图像内,时间注意力跨帧同相机,视角注意力同时刻跨相机。
图3:GeoUP分解注意力机制示意。注意力在token、视角、帧三个维度上分别进行。
这套设计的好处一看就懂:计算复杂度从全局注意力的二次方级别大幅降下来了,同时先验结构更贴近驾驶场景的真实物理关系。论文在消融实验中也验证了分解注意力相对全局注意力的优势——不仅更快,效果反而更好。

一石三鸟:统一架构下的深度估计、3D检测与占用预测

统一表征建好了,接下来就是如何把三个任务优雅地"读"出来。
论文的视角非常清晰:深度估计是曲面级(surface-level)读出口,对应每个像素的表面几何;3D目标检测是实例级(instance-level)读出口,对应具体的物体实例;语义占用预测是体积级(volume-level)读出口,对应整个空间区域的占用状态和语义类别。三者是对同一个3D场景的不同粒度理解,天然适合共享表征。
深度头采用DPT风格解码器。DPT(Dense Prediction Transformer,密集预测Transformer)是一种经典的密集预测架构,能从多层级特征恢复高分辨率预测。GeoUP的深度头读取当前帧的patch token,送入深度头前再次融入相机内参的MLP编码,帮助模型感知不同数据集的成像几何差异:
公式4:深度头特征增强公式。Y_T^(l),d,v = X̄_T^(l),v + MLP(K_T^v)
公式4:深度头的内参条件化公式。在patch token上叠加相机内参的MLP编码,增强度量几何信息。
检测头基于RayDN,这是一个以光线建模为核心的3D检测框架。GeoUP从共享表征中取当前帧多层级特征,经过检测neck处理后,注入深度引导的3D位置编码——这一技巧参考了Stream3DPPE——最后通过RayDN头中的900个目标query预测3D框、类别和速度。
占用头采用OPUS-V2风格query解码器。给定多帧多视角的共享特征,占用头内部先做时序对齐,再通过query-based采样预测当前时刻的稀疏语义占用点集:
公式5:占用预测公式。O_T = H_occ(多帧多视角特征)
公式5:占用预测公式。输出为一组稀疏占用点及其语义标签。
相机头是一个巧妙的辅助设计:训练时,它从camera token中解码出每帧相对参考帧的位姿,构成相机级别的重建约束。这个分支不直接参与推理时的下游感知,而是像一个"几何锚点",让共享表征在训练中始终受到相机几何的约束。
一个统一的编码器加四个读出头(深度、检测、占用、相机),这种架构组织的直接好处是:模型只需要学一遍几何感知的表征,三个任务共享底层特征,而不是每个任务各学一个独立编码器。训练时多个任务的梯度还会相互牵制、相互正则,促使表征学到更本质的几何结构。

多数据集联合训练:异构标注如何增强几何表征

GeoUP的另一个独到之处是它的训练策略——跨数据集的联合多任务训练
整个过程分为两个阶段。第一阶段,用VGGT预训练权重初始化骨干,只用深度和相机两个分支在驾驶数据集上微调,让模型从"通用重建"过渡到"驾驶场景"。这一阶段的损失函数是深度损失加相机损失:
公式6:第一阶段微调损失。L_ft = L_dep + L_cam
公式6:第一阶段微调损失函数。
第二阶段加入检测和占用头,统一优化。联合损失函数长这样:
公式7:多任务联合损失。L = m_dep·λ_dep·L_dep + m_cam·λ_cam·L_cam + m_det·L_det + m_occ·L_occ
公式7:多任务联合损失函数。m为各任务的标注掩码,λ为损失权重。
这里的m_dep、m_cam、m_det、m_occ四个掩码表示当前采样样本是否有对应标注。这种掩码机制非常灵活:某个数据集的某类标注缺失时,对应的掩码直接置零,梯度只在有监督的部分回传。这样一来,GeoUP就能把nuScenes、Argoverse 2、Waymo、KITTI、DDAD五个数据集的异构标注全部利用起来——有些提供3D检测框,有些提供稠密深度,有些提供语义占用。
训练数据上,采样比例按数据集规模设定为nuScenes : Argoverse 2 : Waymo : DDAD : KITTI = 8 : 8 : 9 : 3 : 1。Argoverse 2被额外降采样4倍,因为它的单数据集训练只跑6个epoch,均匀采样会导致欠拟合。联合训练也天然带来了更强的泛化能力:模型见过不同相机配置、不同感知距离的数据,学到的是更通用的几何表征,而不是某个数据集的偏置。实验也验证了这一点——联合训练后的GeoUP† 在多个基准上都有明显提升。

实验结果全面领先:五大基准上的SOTA表现

实验部分是GeoUP真正展示实力的地方——五个公开驾驶基准、三大感知任务再加一个规划迁移任务,全面达到了SOTA水平。实验设置上,检测在nuScenes、Argoverse 2、Waymo三个数据集上按官方协议评测,占用在Occ3D-nuScenes上评测,深度在KITTI和DDAD上评测。骨干网络采用VGGT-12,即从原始VGGT-24中每隔一层抽取组成的12层轻量版,时间窗口默认4帧。
先看nuScenes上的3D检测结果。GeoUP使用ViT-L骨干、800×320分辨率,以57.9% mAP和64.4% NDS超过了RayDN的54.1% mAP。联合多数据集训练后进一步提升到59.2% mAP和65.3% NDS。mAP代表平均精度均值,NDS是nuScenes官方综合评分,融合了检测精度和属性精度等多个维度。
表1:nuScenes验证集上3D目标检测主要结果。
表1:nuScenes验证集上3D目标检测主要结果。GeoUP†表示多数据集联合训练模型。
Argoverse 2上的优势更夸张——GeoUP只用了960×640输入,mAP就达到37.2%,而此前Far3D用ViT-L加1536×1536高分辨率才拿到31.6%。联合训练后直接干到43.6% mAP和33.8% CDS。注意Argoverse 2的感知范围更远、场景难度更大,低分辨率下反超高分辨率方法,可见几何基元表征的价值确实实实在在。
表2:Argoverse 2验证集上3D目标检测主要结果。
表2:Argoverse 2验证集上3D目标检测主要结果。
Waymo上同样全面领先。GeoUP以960×640输入在全类别mAP上达到67.0%,联合训练后70.7%。在Waymo这种数据规模大、标注严格、类别不平衡严重的基准上,这个分数相当能说明问题。
表3:Waymo验证集上3D目标检测主要结果。
表3:Waymo验证集上3D目标检测主要结果。
语义占用预测方面,GeoUP在Occ3D-nuScenes上以42.3% mIoU和47.0% RayIoU超越OPUS-V2-L的39.9% mIoU和45.2% RayIoU。RayIoU是按光线方向逐射线计算IoU(Intersection over Union,交并比)的指标,能比mIoU更精细地反映几何边界质量。四个阈值下的RayIoU全部领先,说明模型对空间边界的刻画更精确。
表4:Occ3D-nuScenes上语义占用预测结果。
表4:Occ3D-nuScenes上语义占用预测结果。8f和16f分别表示融合8帧或16帧时序信息。
深度估计同样亮眼。KITTI上Abs Rel(绝对相对误差)低至0.072,DDAD上更是从之前最优的0.185直接降到0.114。DDAD是包含长距离、多相机的大规模深度基准,绝大多数前视纯视觉方法都在这里挣扎,GeoUP的绝对相对误差几乎是之前最好方法的一半。
表5:KITTI与DDAD深度估计结果。
表5:KITTI和DDAD深度估计结果。
更值得关注的是下游规划迁移实验。把GeoUP作为视觉骨干接入DriveSuprim规划器,在NAVSIMv2基准上EPDMS达到90.5/93.0,明显超过Depth Anything骨干的87.1/90.5。这说明统一几何表征学到的不只是感知指标,对端到端规划也有实际价值。
表6:NAVSIMv2规划结果。
表6:NAVSIMv2规划结果对比。所有变体使用相同的DriveSuprim规划解码器和训练配置。
定性对比同样直观。论文把连续帧的3D检测结果画了出来:GeoUP对静态车辆和动态车辆的检测在四帧里始终稳定,而RayDN在部分帧则出现漏检或位置抖动。以下红框标注的是BEV视角下的对应车辆区域。
图4:连续帧3D检测定性对比。红框标出对应车辆区域,GeoUP保持稳定检测而RayDN出现抖动。
图4:连续帧3D检测定性对比。GeoUP对静态和动态车辆的检测更稳定。
图5:语义占用预测定性对比。GeoUP对道路布局和周围场景结构的还原优于OPUS-V2。
图5:语义占用预测定性对比。GeoUP保留了更完整的道路布局和场景结构。
占用预测的定性比较显示,GeoUP对道路结构和周围场景的还原更完整。此外,论文还把预测深度重建为三维点图,能明显看出车身、路面、路沿的结构保持得很好,说明表征确实继承了VGGT的重建能力。
图6:从预测深度重建的点图。GeoUP保持了VGGT继承的3D重建能力。
图6:从预测深度重建的三维点图,GeoUP保持了VGGT继承的3D重建能力。
综合来看,GeoUP在深度、检测、占用三大任务上全面领先并不是偶然的——同一个几何基元表征同时支撑三个读出口,相当于把三个任务从"三个模型三套几何"变成"一个模型一套几何",数据效率更高、跨任务泛化能力更强。消融实验也证实了核心组件的有效性:分解注意力相比全局注意力不仅计算更省,精度还更高;Plücker光线注入带来了约2个百分点的mAP增益;多任务联合训练相比单任务也有稳定提升。
表7:骨干设计消融实验。分解注意力和Plücker光线均带来有效提升。
表7:骨干设计的消融实验结果。Global表示原始VGGT全局注意力,View和Temporal表示分解的视角与时间注意力,Plücker Ray表示几何先验注入。

局限与展望:计算效率与统一解码器

虽然效果亮眼,GeoUP的短板同样明显。
运行效率是最大的现实瓶颈。论文给出了与任务特定baseline的FPS对比:GeoUP的推理速度远低于StreamPETR等单任务方法。即便用上token缓存减少重复编码,ViT-L级别的骨干加上多帧多视角注意力,计算开销依然相当大。对量产智驾来说,这样的推理速度需要配套蒸馏、剪枝、量化等优化手段才能上车。
表8:与任务特定Baseline的FPS对比。
表8:与各任务特定baseline的FPS对比。
表9:GeoUP模块级耗时拆解。
表9:GeoUP模块级耗时拆解。Ratio表示各模块在总延迟中的占比。
从模块耗时拆解来看,骨干网络占据了绝大部分推理时间,检测和占用头的额外开销反而相对可控。这说明效率问题的根源在共享骨干,优化的重点也应放在骨干的轻量化上。
另一个方向是"统一解码器"。目前三个读出口来自三种不同方法(DPT、RayDN、OPUS-V2),风格各异。论文没有在解码器层面做统一设计。未来如果能把深度、检测、占用统一到一个多模态query解码器中,整个系统会简洁很多,也更利于部署和维护。
此外,当前方案只验证了纯视觉设定,对极端天气(雨雪、夜间、逆光)和长尾场景的鲁棒性还需要进一步验证。与毫米波雷达、激光雷达的融合也是一个值得探索的方向。
从研究视角看,GeoUP最值得记住的一点是它证明了:让骨干网络自带几何,比在任务模块里补几何更高效。沿着这条路继续走,骨干轻量化、统一解码器、端到端联合调优,都有很大的探索空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面向自动驾驶环视感知,北航与北邮提出GeoUP框架,将视觉几何基础模型VGGT的3D重建表征改造成统一感知骨架,一个模型同时支持度量深度估计、3D目标检测和语义占用预测,在nuScenes、Waymo、Argoverse 2、KI
这篇工作最值得看的点是什么?GeoUP在nuScenes上达到57.9% mAP和64.4% NDS,在Argoverse 2上达到37.2% mAP和28.2% CDS,在Waymo上达到51.5% mAPL和67.0% mAP,均超过现有方法。多数据集联合训练进一步提升了性能。深度估计在KITTI和DDAD上均达到最优结果。
这篇工作的边界或风险在哪里?优点:(1) 将视觉几何基础模型成功适配到自动驾驶场景,实现了统一的3D感知表征;(2) 分解式注意力机制有效处理了流式多相机输入的时间和视角交互;(3) 多数据集联合训练策略充分利用异构标注。缺点:(1) 计算开销大,推理速度慢;(2) 感知头仍为任务特定设计,未实现完全统一的解码器。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出GeoUP框架,将视觉几何基础模型VGGT的重构导向潜表征适配到标定的流式多相机驾驶场景,通过分解自注意力、时间注意力和视角注意力,并注入标定感知的光线图编码,实现统一的度量深度估计、3D目标检测和语义占用预测。

实验合理度:★★★★☆

3D检测:mAP、NDS、CDS、LET-3D-APL/AP/APH;占用预测:mIoU、RayIoU;深度估计:Abs Rel、δ<1.25;规划:EPDMS

学术研究价值:★★★★☆

提出GeoUP框架,将视觉几何基础模型VGGT的重构导向潜表征适配到标定的流式多相机驾驶场景,通过分解自注意力、时间注意力和视角注意力,并注入标定感知的光线图编码,实现统一的度量深度估计、3D目标检测。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在NVIDIA H20 GPU上,输入分辨率672×224时,单帧处理速度为2.18 FPS,4帧处理速度为0.81 FPS。骨干网络占总延迟的66.5%(单帧)至87.8%(4帧)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 计算开销大,推理速度慢;(2) 感知头仍为任务特定设计,未实现完全统一的解码器。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球