← 返回 PaperDaily
视觉与图像
NeurIPS 2026新作ViCo3D:DINOv2让协同3D检测增益飙到1.8倍
V2X协同感知最烦的,不是“有没有信息”,而是“信息怎么不打架”。ViCo3D偏偏不去硬拗一致性,而是借DINOv2给点云BEV补语义,再做多尺度融合,结果协同增益直接拉满,思路很有意思。
龙哥读论文
发布于 2026-08-14 09:11:11
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: V2X协同感知最烦的,不是“有没有信息”,而是“信息怎么不打架”。ViCo3D偏偏不去硬拗一致性,而是借DINOv2给点云BEV补语义,再做多尺度融合,结果协同增益直接拉满,思路很有意思。
原论文信息如下:
🚗 V2X协作感知的“老问题”:特征不够“聪明”,协同难“互补”
车路协同这件事,表面上看是“多几个视角,答案应该更准”;真到工程里,常常变成“多几个视角,特征先打起来了”。问题不在于信息不够,而在于不同车、路侧设备看到的东西本来就不一样:角度不同、遮挡不同、密度不同,最后落到 BEV(Bird’s-Eye View,鸟瞰图)特征上,往往不是互补,而是“各说各话”。
传统的中间融合方法,大多依赖 LiDAR 主干网络从头训练 BEV 特征,再把多方特征拿来对齐、拼接、注意力融合。听起来很合理,实际却有两个老毛病:第一,LiDAR 特征通常更偏几何,语义先验不够;第二,强行追求跨端一致性,容易把本来有价值的差异抹平。说白了,协同感知不是“大家长得一模一样”,而是“每个人看见的东西能拼成完整真相”。
这篇论文先把这个矛盾挑明了:协同感知真正缺的,不是“更一致”,而是“更会互补”的表示 。这就把思路从“硬凑一致”拐到了“补语义、保差异、再融合”。
🤖 另辟蹊径:让“图像大师”DINOv2“看懂”3D点云?
ViCo3D 的脑回路很有意思:它没有把视觉基础模型 DINOv2 直接塞进点云里硬用,而是先把 LiDAR 点云投到 BEV 平面,构造成三通道“图像”,再让 DINOv2 去提取特征。这里的 DINOv2 是 自监督视觉基础模型 ,原本在大规模图像数据上预训练,擅长学到通用、稳健、语义丰富的视觉表示。论文引用的是 Oquab 等人的 DINOv2 工作。
这里的关键不是“拿 DINOv2 直接替换 LiDAR 主干”,因为那样大概率会翻车。论文自己也验证了:单独用 DINOv2 生成的 BEV 特征,检测效果会明显变差。原因很朴素,视觉模型虽然会看图,但它并不知道点云里的几何边界、局部结构和距离尺度到底有多重要。图像里“看着像车”不等于 BEV 里“能准定位车”。
所以 ViCo3D 采取的是“LiDAR 几何特征 + DINOv2 语义特征 ”双分支路线。前者负责检测任务最看重的几何精度,后者负责给 BEV 补上更通用的视觉先验。换句话说,LiDAR 分支像是地理老师,DINOv2 分支像是语文老师,前者讲位置,后者补语义,俩人一起上课,成绩才不偏科。
这里顺手解释两个缩写。BEV 是 Bird’s-Eye View,中文一般叫“鸟瞰图”或“俯视图”;VFM 是 Vision Foundation Model,中文是“视觉基础模型”。ViCo3D 的新意,就在于把 VFM 真正接进了 LiDAR 协同感知,而不是只在论文标题里蹭一下“基础模型”热度。
🛠️ 核心解法:双分支提取 + 多尺度融合,打通“任督二脉”
ViCo3D 的主体设计可以概括成一句话:先把点云变成 DINOv2 能理解的 BEV 图像,再把 DINOv2 的语义补丁和 LiDAR 的几何骨架拼起来,最后把多端信息按 ego 视角做协同融合 。看起来步骤不少,但每一步都在解决一个具体痛点。
第一条分支是 PointPillars 风格的 pillar 分支。它把点云按竖直柱体切分,在 BEV 网格上提取密集特征图,记作 FP。这部分的作用很直接:保留 LiDAR 在 3D 检测里最重要的几何信息,尤其是物体边界、位置和局部结构。
第二条分支是 DINOv2 分支。论文先把点云过滤到感兴趣区域,再投影到 BEV 网格,生成三通道图像:第一通道记录最大归一化高度,第二通道记录反射强度,第三通道记录点密度并做对数归一化。这样一来,原本稀疏、无序的点云,变成了一个结构化的二维输入,DINOv2 就能像看图一样提取特征,得到 FD。
这一步的妙处在于,它没有幻想“图像基础模型天生懂点云”,而是先给它搭了一个“翻译器”。BEV 图像不是 RGB 图像,但它至少把空间结构、局部纹理和密度变化保留下来了,足够让视觉模型发挥预训练优势。
问题来了。FP 和 FD 来自不同输入、不同目标、不同预训练背景,直接融合就像把“几何坐标系”和“视觉语义坐标系”硬塞一起,容易互相干扰。ViCo3D 先用两个可学习投影层把它们映射到共享空间,得到对齐后的特征,再进入后续融合。
这里的对齐不是为了把两者“压成一样”,而是为了让它们“可以比较、可以交互”。这点很关键。很多协同方法一上来就追求一致性,结果把互补信息也一起洗掉了。ViCo3D 的态度更像是:先让双方别吵架,再讨论谁补谁。
真正有技术含量的部分在这里。论文没有直接在高分辨率 BEV 上做 dense attention,因为 token 太多,显存会炸。作者给了一个很现实的数字:在 112×252 的特征图上,原始分辨率下注意力矩阵的显存开销会高到离谱;下采样 4 倍后,成本才变得可接受。于是,ViCo3D 先做低分辨率全局融合,再做高分辨率细节修复。
低分辨率阶段叫 LRG ,全称是 Low-Resolution Global Fusion,中文是“低分辨率全局融合”。它先把特征下采样、展平、加位置编码,再做自注意力和跨注意力。这里的跨注意力采用“PointPillars 主导”的方式,也就是让检测更稳的几何特征做查询,DINOv2 特征提供补充信息。这个设计很像“主菜不换,配菜升级”,既保住检测任务的底盘,又把视觉先验塞进去。
但只做低分辨率融合不够。论文在消融里已经说明,低分辨率全局交互虽然能提高召回,却会牺牲一些精度,原因就是局部边界和细粒度结构被压缩掉了。于是第二阶段 HRR (High-Resolution Refinement Fusion,高分辨率细化融合)登场。它不再上重型注意力,而是用轻量交互项 |F′P−F′D| 和 F′P⊙F′D 来刻画差异和互补,再经过卷积提炼出局部修复特征。
这一步很接地气:不和高分辨率注意力硬刚,改用轻量卷积把“差多少、补什么”说清楚。最后再把全局特征和局部修复特征拼起来,加上残差通路和动态门控,既保留稳定主干,又让新信息有机会进来。这个门控的思想很像协同感知里的交通灯:不是所有邻居信息都要照单全收,而是哪里缺、哪里补。
4)跨端协同:以 ego 为中心,接收“有用的残差”
在单车特征增强之后,ViCo3D 还接入了一个 Where2comm 风格的主动通信模块。它不会把整张 BEV 特征图都传出去,而是先预测哪些区域更值得通信,再只发送这些区域。这个选择非常工程化:协同感知不是“传得越多越好”,而是“传得越准越省”。
收到邻居特征后,系统把它们变换到 ego 坐标系,再做 ego-centric residual fusion。这里的核心思想是:ego 特征仍然是主干,邻居特征只补残差。门控网络会根据 ego 特征、邻居特征及其差异,判断哪些空间位置真的需要邻居帮忙。这样做的好处是,协同不是把主车特征淹没,而是“在主车视角上补盲区”。
📊 效果说话:性能全面SOTA,特征更“多样”,协同增益最大
实验部分基本把论文的主张撑住了。ViCo3D 在 DAIR-V2X 和 V2XSet 上都拿到了最好的结果,尤其是在更严格的 IoU 阈值下表现更稳,这说明它不只是“框出来了”,而是“框得更准了”。这点对 3D 检测很重要,因为松阈值下的高分并不稀奇,难的是在更苛刻的定位标准里还能站住。
更值得注意的是协同增益。论文在表3里把单车和融合两种设置放在一起看,ViCo3D 的提升幅度是最大的,尤其在 DAIR-V2X 上,融合后 AP 提升非常明显,说明它学到的特征确实更适合跨端对齐和互补。换句话说,别的方法也能协同,但 ViCo3D 更像“协同放大器”。
消融实验进一步把因果链条捋顺了。只用 DINOv2 特征时效果很差,说明视觉基础模型不能单独扛 LiDAR 检测;但把 DINOv2 和 PointPillars 融合后,效果就明显提升。再往后看,低分辨率全局融合负责找大范围上下文,高分辨率细化负责补边界和局部结构,协同模块则把邻居信息真正用起来。每一步都不是装饰,而是有实际贡献。
论文还做了特征空间分析,挺加分。图3显示,ViCo3D 的通道能量分布更均匀,不再把表示压在少数几个主通道上;图4的 PCA 结果也表明,ViCo3D 的前几个主成分解释的方差更少,说明特征子空间更分散、更丰富。这和前面的“互补而非一致”是对得上的。
这部分结果最让人舒服的地方在于:它不是“堆模块堆到分数上去”,而是每个模块都能解释清楚自己在做什么。实验和设计之间的对应关系比较紧,属于比较干净的论文写法。
💡 更深远的意义:用“通用语义”赋能“专用感知”
ViCo3D 的价值,不只是把某个数据集上的 AP 往上推了一点,更重要的是,它给 V2X 协同感知提供了一个很实用的方向:通用视觉基础模型不一定要直接接管 3D 感知,但完全可以作为“语义增强器”嵌入其中 。这比单纯训练一个更大的 LiDAR 主干更有想象力,也更符合现实工程约束。
当然,这条路也不是没有代价。首先,BEV 投影虽然把 LiDAR 变成了“图像可读”的形式,但这种转换仍然会损失一部分原始 3D 结构信息;其次,DINOv2 的收益依赖于投影方式和融合方式,换一个数据分布、换一个传感器配置,未必还能复现同样的效果;最后,论文虽然给出了较完整的消融和可视化,但对于更大规模、更复杂交通场景下的稳定性,还需要进一步验证。
不过,若从研究路线看,这个方向很值得继续挖。未来如果能把更强的视觉基础模型、更稳的跨模态对齐机制,以及更高效的通信策略结合起来,协同感知可能会从“拼特征”进一步走向“拼语义、拼上下文、拼决策”。那时候,车路协同就不只是多看几眼,而是真正开始“看懂彼此”。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是 V2X 协作感知里“特征难以互补”的问题。传统方法常常只追求跨端特征一致,但 ViCo3D 认为更重要的是让不同视角保留有用差异,再借助 DINOv2 补充语义,让协同真正产生增益。
DINOv2 分支为什么不能单独用? DINOv2 虽然是强大的视觉基础模型,但它原本不是为 LiDAR 3D 检测设计的。直接拿它做检测,容易丢掉点云里最关键的几何定位信息,所以论文采用的是“LiDAR 主干 + DINOv2 增强”的组合,而不是替换。
LRG 和 HRR 分别在干什么? LRG 是低分辨率全局融合,主要负责抓长距离依赖和全局上下文;HRR 是高分辨率细化融合,主要负责补局部细节和边界信息。前者解决“看得全不全”,后者解决“看得准不准”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把视觉基础模型接入 V2X 协同感知,这个切口比较新,不是简单堆一个大模型,而是围绕“语义增强 + 多尺度融合”做了完整设计。
实验合理度: ★★★★☆。对比、消融、特征分析都比较齐,尤其能解释“为什么协同增益变大”。不过不同方法的检测头并不完全统一,严格横向比较仍有一点现实复杂度。
学术研究价值: ★★★★☆。它给协同感知提供了一个很有启发的方向:基础模型不只服务 2D,也能作为 3D 协同表示的增强器,这对后续研究很有参考意义。
稳定性: ★★★☆☆。思路扎实,但 BEV 投影和跨模态融合仍依赖场景和数据分布,离“随拿随用”还有距离。
适应性以及泛化能力: ★★★☆☆。在 DAIR-V2X 和 V2XSet 上都有效,说明有一定泛化性;但是否适配更多传感器配置和更复杂道路环境,还需要更多验证。
硬件需求及成本: ★★★☆☆。DINOv2 加进来后,单车侧计算和显存开销都会上涨;论文通过低分辨率全局融合缓解了部分成本,但仍不是轻量方案。
复现难度: ★★★☆☆。主干思路清晰,模块也说得明白,但视觉基础模型、BEV 投影和协同通信都叠在一起,工程复现不会太省心。
产品化成熟度: ★★★☆☆。在车路协同、路侧算力较强的场景里有落地潜力,但要真正上车,还需要更严格的时延、稳定性和鲁棒性验证。
可能的问题: 思路漂亮,但对跨模态对齐和场景分布仍有依赖;若基础模型换代或传感器配置变化,效果是否稳定还需继续验证。
主要参考文献
1. Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Lu Zhang, Jiajun Deng, and Yanyong Zhang. ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models. arXiv:2607.12815v1, 2026.
2. Maxime Oquab et al. DINOv2: Learning Robust Visual Features without Supervision. 2023.
3. Lang et al. PointPillars: Fast Encoders for Object Detection from Point Clouds. 2019.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
车路协同、3D检测、V2X与大模型视觉语义交叉讨论,群里都能聊。