← 返回 PaperDaily
视觉与图像
视觉大模型+LiDAR:ViCo3D把SOTA又抬高了
这篇最有意思的地方,不是简单把 DINOv2 往点云里硬塞,而是先把 LiDAR 变成 BEV 图像,再用视觉大模型补语义、用多尺度融合补细节,最后还把协同增益做到了更高。它回答了一个很现实的问题:协同感知里,特征不一定越像越好,能互补才是真本事。
龙哥读论文
发布于 2026-08-14 09:11:11
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇最有意思的地方,不是简单把 DINOv2 往点云里硬塞,而是先把 LiDAR 变成 BEV 图像,再用视觉大模型补语义、用多尺度融合补细节,最后还把协同增益做到了更高。它回答了一个很现实的问题:协同感知里,特征不一定越像越好,能互补才是真本事。
原论文信息如下:
LiDAR协同感知的“新引擎”:为什么传统BEV特征不够?🤔
协同感知这件事,表面上看像“人多力量大”,实际做起来常常变成“人多嘴杂”。在车路协同场景里,不同智能体看到的世界并不一样:车端视角低、遮挡多,路端视角高、范围广,但两边的点云分布、密度和几何形态又差得很明显。传统做法大多把点云先编码成鸟瞰图特征 (BEV,Bird’s-Eye View,俯视图表示),再在特征层做融合。问题在于,这类特征往往太“几何脑”,能看出哪儿有墙、哪儿有车,却不太会“理解”场景语义,更难把不同智能体之间的互补信息真正吃干榨净。
这篇论文最有意思的地方,不是继续在传统 BEV 上“抠细节”,而是直接把视觉基础模型拉进来了。作者的判断很直白:协同感知里,特征不一定越像越好,能互补才是真本事 。这句话听着像鸡汤,实验里却真能打。论文在 DAIR-V2X 上把协同增益做到了比此前方法更高,单看融合收益,甚至能到前人方法的约 1.8 倍量级。
为了让读者先抓住主线,可以把 ViCo3D 的思路概括成一句人话:先把点云“翻译”成视觉模型看得懂的 BEV 图像,再把视觉语义和 LiDAR 几何特征揉在一起,最后在多智能体之间做更聪明的协同 。它不是拿 DINOv2 直接替代 LiDAR 编码器,而是把它当成一个“语义补丁”,专门补传统点云特征缺的那部分上下文和泛化能力。
解锁视觉大模型潜力:点云如何“伪装”成图像给DINOv2看?🗺️
这里先把核心概念说清楚。DINOv2 是一种视觉基础模型,完整名称是 Self-Distillation with No Labels, version 2 ,中文可以理解为“无标签自蒸馏视觉模型”。它在海量图像上预训练,擅长学到通用、稳定、语义丰富的视觉表示。问题是,LiDAR 点云天生不是图像,直接喂给 DINOv2,模型只会一脸问号。
ViCo3D 的第一步很巧:把点云投影到 BEV 平面,做成三通道“伪图像”。这三个通道分别记录高度 、反射强度 和点密度 。高度告诉模型哪里有立体结构,强度提供表面材质线索,密度则反映局部是否稠密、是否可能有物体边界。说白了,就是把原本“散装”的点云,整理成视觉模型更容易读懂的地图。
不过,作者并没有天真地认为“BEV 图像 + DINOv2”就能直接起飞。实验里已经证明,单独拿 DINOv2 特征去做检测,效果会明显掉队。原因也不难理解:视觉基础模型擅长的是通用语义,不是为 3D 定位量身定做的空间几何。它能帮你认出“像车的东西”,但不一定能精确告诉你“车边界在哪、中心点在哪、朝向如何”。所以 ViCo3D 不是替换,而是融合;不是让视觉模型单挑,而是让它给 LiDAR 打辅助。
双分支+多尺度融合:补齐语义与细节的“最后一块拼图”🧩
方法主体里最关键的是“双分支编码 ”。一条分支用 PointPillars 风格的 LiDAR 编码器提取几何特征,负责稳定的 3D 检测底座;另一条分支把 BEV 伪图像送进 DINOv2,专门提取更富语义、更有上下文的视觉特征。两条分支各干各的,最后再对齐到同一个特征空间里融合。这个设计挺务实:既不迷信大模型,也不把传统 LiDAR 扔掉。
这里的“对齐”也不是简单拼接。因为两个分支的输入形式、训练目标都不一样,直接拼只会让特征互相打架。作者先用 1×1 卷积、归一化和非线性激活,把两路特征映射到共享空间,再做多尺度融合。这样做的好处很朴素:先让大家说同一种“特征语言”,再谈合作,不然会议一开始就鸡同鸭讲。
多尺度融合分成两层。第一层是低分辨率全局融合 (LRG,Low-Resolution Global Fusion),先把 BEV 特征下采样,再做全局交互。这样做是为了控制计算量,因为原始 BEV 特征太密了,直接在高分辨率上做 attention,显存会先崩。论文里给了一个很实在的数字:如果直接在原始尺寸上做全局注意力,显存开销能高到离谱;而下采样 4 倍后,代价会降到可接受范围。
在 LRG 里,作者先做自注意力,捕获单个分支内部的长距离依赖,再用交叉注意力让 PointPillars 分支去吸收 DINOv2 的补充信息。这个顺序很关键:先稳住检测主干,再引入外部语义,避免一上来就把特征空间搅成一锅粥。它的逻辑不是“谁更强谁当主角”,而是“谁更适合定位,谁就先站稳;谁能提供补充,谁再来帮忙”。
第二层是高分辨率细节精炼 (HRR,High-Resolution Refinement Fusion)。低分辨率融合虽然能把全局关系拉起来,但细节会丢,尤其是边界和局部结构。作者没有继续硬上高分辨率 attention,而是改用更轻量的局部交互:把两路特征的差值和逐元素乘积显式拼出来,再用卷积模块压缩整合。这个做法很接地气,像是在说:全局关系我先看个大概,局部差异我再拿放大镜补一遍。
最后,ViCo3D 还加了一个残差式的空间门控,让融合后的特征不要彻底脱离原始 LiDAR 主干。这个设计挺聪明:DINOv2 提供“更会看”的能力,PointPillars 提供“更稳的定位底盘”,门控则负责决定某个位置到底该听谁的。协同感知里最怕的就是“补充信息”变成“噪声放大器”,门控就是用来防这个的。
协同增益暴涨1.8倍!ViCo3D在DAIR-V2X上刷新SOTA🚀
先看结果,再谈道理。ViCo3D 在 DAIR-V2X 和 V2XSet 上都拿到了当前最强表现之一,尤其是在 DAIR-V2X 上,协同增益非常显眼。论文给出的对比里,它在单车到协同的提升幅度上,明显超过了 Where2comm、INSTINCT 和 DI-V2X 等方法。换句话说,不只是最终分数高,“协同之后涨了多少” 这件事也更漂亮。
更值得注意的是表3。很多协同方法在融合后,提升往往集中在某个阈值上,或者只能靠“更宽松的 IoU”刷存在感。但 ViCo3D 在单体到融合的提升上更均衡,说明它学到的特征确实更适合跨智能体对齐和协作,而不是只在某个指标上碰运气。
论文里还有一个很有意思的观察:ViCo3D 的交叉视角特征相似度更低,但检测性能更高。很多人做协同感知时会下意识追求“特征越一致越好”,好像大家长得越像越容易合作。ViCo3D 直接把这个直觉拧了一下:不是越像越强,而是该一致的地方一致,该保留差异的地方保留差异 。这才是协同感知真正需要的平衡。
深度拆解:是特征对齐更重要,还是保留互补性更重要?🔬
这篇论文真正有观点的地方,不是“加了一个视觉大模型”,而是它对协同感知的一种判断:协同不等于同质化 。很多方法想着把不同智能体拉得越近越好,但 ViCo3D 的分析显示,过度追求一致性,可能会把本来很有价值的互补线索一起抹掉。特征空间里太整齐,未必是好事;有时候“有点散”,反而更能装下不同视角的信息。
消融实验也挺有说服力。只有 PointPillars 时,检测本身已经不错;只有 DINOv2 时,效果会掉得很厉害,说明视觉基础模型不能单独扛 3D 检测。但把两者融合后,指标稳定上涨,证明 DINOv2 的价值不在“单独出场”,而在“给 LiDAR 特征补语义”。这类结果其实很符合工程直觉:一个擅长空间定位,一个擅长语义泛化,硬要谁替谁,都会翻车;让它们分工合作,才是正解。
还有一个工程上很现实的问题:复杂方法能不能落地,往往不看论文画得多漂亮,而看它是不是“算得动”。ViCo3D 在这里没有乱来。作者通过低分辨率全局融合规避了高分辨率 attention 的显存爆炸,又用轻量局部卷积替代昂贵的密集交互,整体思路是偏务实的。它不是那种一上来就把 GPU 烤成炭的“学术烟花”,而是尽量把大模型能力塞进可用的协同感知管线里。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是车路协同里“不同智能体特征不好融合”的问题。传统 LiDAR 协同感知主要依赖几何特征,语义不足;ViCo3D 则借助 DINOv2 给 BEV 特征补上更丰富的视觉语义,再做多尺度融合和跨智能体协同。
DINOv2 为什么不能直接拿来做 3D 检测? 因为它本来是为图像设计的,擅长通用视觉语义,不擅长 LiDAR 的稀疏几何定位。直接用会掉性能,所以论文选择把它当作辅助分支,与 PointPillars 特征融合,而不是直接替代 LiDAR 编码器。
为什么论文强调“互补性”而不是“特征一致性”? 因为不同智能体看到的场景本来就不一样,强行变得太像,可能把有用的差异也抹掉。ViCo3D 的实验表明,跨视角特征相似度更低,并不妨碍检测更好,反而说明模型更会保留多视角带来的有效信息。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把视觉基础模型引入 LiDAR 协同感知,这个方向本身就挺新;更难得的是没有停留在“拿来主义”,而是把 BEV 伪图像、双分支融合、多尺度交互和自车中心协同串成了一条完整链路。
实验合理度: ★★★★☆
对比方法覆盖了单车、晚融合、中融合等主流路线,消融也比较完整;同时还分析了特征相似度和 PCA 结构,能把“为什么有效”讲得更像样,而不是只报数字。
学术研究价值: ★★★★☆
它给协同感知提供了一个很有启发的视角:不是一味追求特征对齐,而是要在对齐与互补之间找平衡。这个观点对后续多智能体表示学习很有参考价值。
稳定性: ★★★☆☆
方法结构不算离谱,但依赖 DINOv2 这类视觉基础模型,且跨模态适配仍有门槛。实际部署时,数据分布变化、传感器差异和算力限制都可能影响稳定性。
适应性以及泛化能力: ★★★★☆
对车路协同这类多视角场景比较友好,尤其适合 BEV 表示已经成熟的中间层融合框架;但是否能无缝迁移到更多传感器组合,还需要进一步验证。
硬件需求及成本: ★★★☆☆
双分支和多尺度融合都会增加计算成本,虽然作者已经尽量用低分辨率全局融合做了控制,但相比纯 PointPillars 仍然更重,不算轻量方案。
复现难度: ★★★☆☆
论文给了比较清楚的方法描述,但当前没有开源代码,DINOv2 适配、协同通信和多尺度融合都需要自己搭环境,复现成本不算低。
产品化成熟度: ★★★☆☆
思路有工程味道,但离大规模车路协同落地还差几步,尤其是实时性、通信开销、跨域泛化和稳定性验证,都是必须补齐的功课。
可能的问题: 论文思路完整,但对 DINOv2 的依赖较强,且主要验证集中在两个基准上。若要冲更高水平,最好补充更多场景泛化、通信成本和实时性分析。
主要参考文献
Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Lu Zhang, Jiajun Deng, and Yanyong Zhang. ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models. arXiv:2607.12959v1, 2026.
DINOv2: Self-Distillation with No Labels, version 2. Oquab et al., 2023.
PointPillars. Lang et al., 2019.
Where2comm. Hu et al., 2022.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!