← 返回 PaperDaily
视觉与图像
32.7%提升背后:VLM+规则工具箱混合评估新范式
自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!
龙哥读论文
发布于 2026-08-14 21:47:11
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏——DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!
原论文信息如下:
场景认知缺失:传统驾驶评估的“盲区”
想象一下,你正在路上开车,前方突然出现一个抛锚的卡车。为了绕过它,你借道逆行了一小段。这时候,一个严格的考官坐在副驾上,面无表情地在你的考卷上打了个大大的红叉——因为“不能压双黄线”。你是不是会觉得这个考官有点“一根筋”?他完全没考虑到,你是在一个连卡车都停了的紧急情况下,做出了一个合理且最安全的决策。
这正是当前大多数自动驾驶评估系统面临的尴尬境地。目前主流的评估方法有两种:一种是“模仿考试”,即计算预测轨迹与“人类专家”轨迹的相似度,偏差越小分越高;另一种是“交规考试”,即制定一系列硬性规则(如:不能压线、不能超速、与前车保持车距),全自动打分。
前者的问题在于,人类司机本身也有开得不好的时候,把他们的轨迹当绝对标准,等于默认了“我就是真理”,显然不科学。而后者,也就是基于规则的方法(例如被广泛使用的 EPDMS),虽然条理清晰、可复现,但它最大的问题就是——“死脑筋” 。
规则是死的,但路况是活的。在那些“长尾场景”(Long-Tail Scenarios,即不常见的、复杂的边缘情况)中,比如为了避让行人压实线、为了躲避障碍物稍微侵入对向车道,这些“不守规矩”的操作恰恰是优秀司机的表现。但传统的规则考官可不管这些,上来就是一通扣分,导致很多明明很合理的驾驶行为被判定为“不及格”。
正是为了解决这个问题,来自 英伟达 的研究团队提出了一个全新的思路——DriveJudge 。它不是要废除规则,也不是完全依赖人工智能的“感觉”,而是巧妙地让两者结合,当一个真正懂得“看情况”的驾校考官。
DriveJudge:像驾校考官一样“看情况”扣分
一个好的考官,不会只是盯着考试大纲机械打分。他会先看一眼路况:哦,前面有障碍物,这时候你选择绕行,虽然压实线了,但更安全、更高效,那就不扣分。DriveJudge 的设计哲学正是如此。
它的核心思想是,将“知道该怎么开”(场景理解)与“知道该怎么考”(规则计算)这两个环节解耦。
具体来说,DriveJudge 不再对所有的规则一视同仁。它会先调用一个强大的 视觉语言模型(VLM,Vision-Language Model) 来“看”一眼当前的路况。这个VLM就像一个经验丰富的老司机,能一眼识别出前方的修路区域、旁边的行人、或者临时的交通管制。然后,它根据看到的场景,决定哪些规则现在“适用”,哪些规则该“暂时停用”。
例如,对于“车道保持”这个规则,在正常巡航时,它至关重要;但在紧急避让时,它就可以被忽略。VLM会输出一个“门控向量”——一个由0和1组成的开关信号,告诉系统哪些规则开关应该被打开或关闭。之后,那些被激活的“安全卫士”规则函数(如检查是否会撞车、是否偏离路线等)才开始进行精确的数学计算和打分,最后汇总成一个总分。
这样一来,整个评估过程既有VLM带来的灵活性,又有规则计算带来的可解释性和高精度,彻底告别了以前的“死板”或“模糊”。
双轮驱动:VLM推理+规则基底如何协同工作?
DriveJudge 的牛逼之处,就在于它把两种听起来互不搭界的做事风格强强联合了。
一方面,它用一个微调过的 VLM(基于 Qwen-3 模型)来负责“软”的、语义层面的理解。VLM接收车载摄像头的画面以及渲染好的鸟瞰图(BEV),然后像人类一样去“看”懂这个场景,并凭借其强大的常识推理能力,判断出哪些规则此刻应该被激活。在这个环节,它像是一个懂得变通的艺术生。
另一方面,它又极度依赖经典、精确的规则函数来做“硬”的、物理层面的判断。一旦VLM决定了哪些规则“上岗”,这些数学函数就立刻接手,以一种确定性、可重复的方式计算碰撞风险、车道偏离度等关键指标。这些底层函数不会被VLM影响,它们只做冷冰冰的精确计算。在这个环节,它又回归了一个严谨的工程师身份。
不只是理论:35K+样本与开放标签的训练之旅
要让一个模型学会“看情况”,光靠嘴说可不行。英伟达团队做了一个很重要的工作——构建了一个大规模的、高质量的专用数据集。
他们从公开的 PhysicalAI-Autonomous-Vehicles 数据集中,精心挑选了那些最“刁钻”的场景。具体方法是,先用传统的规则指标去给人类司机的轨迹打分,专门挑出那些明明人类开得很好,却被糟糕的规则指标打了低分的片段。这些片段是典型的“法不责众”案例,也是训练 DriveJudge 的最佳素材。
最终,他们标注了 10,732 个片段,并从中提取了 33,577 个标准化的 2秒片段。每个片段都由人类判断其驾驶行为是否“合理”。其中,约 15.3% 被标记为驾驶失败。这个数据集规模巨大,且其重点关注复杂和长尾场景,为后续的评估模型训练提供了坚实的基础。
有了数据之后,DriveJudge 的训练分两步走:
首先,模型学习回答一个问题:“在这个场景下,我应该激活哪些规则?” 这相当于让模型跟着老师(人类标注)学习解题,快速掌握基本的决策模式。
然后,模型开始自我进化,学习如何更好地给出一个高分。强化学习阶段的目标非常明确:当比较两条轨迹时,DriveJudge 给出的评分顺序,必须与人类的偏好一致。如果人类更喜欢轨迹A,而DriveJudge却给了轨迹B更高分,它就会受到“惩罚”,从而不断调整自己激活规则的策略,直到与人类的口味完全吻合。
刷新SOTA:新指标如何赢过老将?
为了验证 DriveJudge 是否真的厉害,作者们设计了两个“考裁判”的基准任务。翻译成大白话就是:我们来评选一下,到底哪个驾照考官评分最准。
第一个任务是 驾驶质量分类 :让各种指标去判断一段驾驶行为是“好”还是“坏”,看它们的判断与人类专家的判断一致性如何。
第二个任务是 轨迹偏好选择 :给两条候选轨迹,让指标选出人类更喜欢的那一条。我们一起来看看结果吧。
从表1上看,传统规则的EPDMS的AUC是57.67,而DriveJudge-2B(2B参数版本)直接干到了77.95,提升超过20个点。8B版本更是达到了78.90。
那么,DriveJudge 相比于其他方法到底好在哪呢?通过一个消融实验(表3)可以看得更清楚:
从消融实验可以看出,只靠VLM直接打分(VLM-DirectScore),零样本时AUC只有50.06,加上微调也不过68.67,依然低于DriveJudge的77.95。这说明,如果不提供规则工具箱,即使VLM很强,但遇到需要精确空间判断的问题(如是否压线、距离边界多远),它的能力还是受限的。
最后,团队还用 DriveJudge 重新评估了目前最先进的一些自动驾驶策略模型(如 Hydra-MDP、DriveSuprim等)。结果发现,这些模型在传统的 EPDMS 分数下表现一般,但在 DriveJudge 评估下却拿到了更高的分数。这说明,当前很多好的策略模型其实已经比人们想象的要强,只不过以前的“考官”太死板,没发现它们的亮点。当然,这同时也反映出,现有的基准测试可能在逐渐“饱和”,新的评估标准显得至关重要。
未来之路:开启闭环驾驶与策略优化的新篇章
DriveJudge 的提出,可以说是为自动驾驶评估领域提供了一把全新的标尺。它不再是冷冰冰的扣分机器,而是一个懂得变通的智能评判官。虽然目前论文还主要集中在开环(open-loop)评估上,即拿一段已经存在的轨迹去打分,但作者们已经明确指出了下一步的方向——将 DriveJudge 作为奖励函数(Reward Function),直接用于训练策略模型。想象一下,让一个能看懂场景的考官去指导自动驾驶车学习,那效果肯定比死板的扣分要好得多。
当然,任何新方法都会有挑战。把复杂的VLM引入评估流程,意味着对计算资源的要求更高,其内部机理也更像是一个“黑盒”。未来如何让它更轻量化、更高效,将是推动其落地的关键。
龙迷三问
DriveJudge到底解决了什么问题? 它解决的是自动驾驶评估领域一个核心矛盾:传统的规则评估方法是“死的”,不懂变通,经常把“合理避让”等好的行为判定为“驾驶失败”;而纯VLM的方法虽然懂上下文但缺乏物理精确性,难以做精细的安全判断。DriveJudge把两者的优势结合起来,让VLM判断“要不要激活规则”,再让规则函数做精确的“物理题”。
论文中的“长尾场景”具体指什么? 长尾场景(Long-Tail Scenarios)指的是自动驾驶中那些不常见的、复杂的、边缘化的场景。比如路上有个突然出现的坑要绕行、红绿灯故障、旁边有紧急车辆需要让路等等。这些场景虽然不常发生,但一旦遇到,对驾驶能力就是极大的考验,也是当前评估模型最难搞定的地方。
DriveJudge和DriveCritic有什么区别? DriveCritic是一个典型的纯VLM偏好模型,它的目标就是给两条轨迹打分,判断人类更喜欢哪一条。它依赖VLM的“直觉”。而DriveJudge是一个更高级的智能体,它先“理解”场景,然后“选择”应该启动哪些规则工具箱,最后用这些工具去“计算”分数。所以,它不仅知道“哪个更好”,还知道“为什么好”,因为它能把结果归因到各个被激活的规则上(碰撞、车道偏移等),这正是核心差异所在。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
想法很新颖,将“工具调用”的思路引入评估领域,是一个很有价值的范式融合。不是简单的“VLM + 规则”,而是将规则当作可以调度使用的“工具”,这一思路很聪明。
实验合理度: ★★★★☆
设计了两大基准测试来评估“评估指标”,这在学术界是比较少的,实验设计周密,消融实验清晰,对比对象也很有代表性,包括模仿学习指标、规则指标和纯VLM指标,非常全面。
学术研究价值: ★★★★★
价值很高。这篇工作将“如何评价评价指标”这个底层问题摆上台面,并提出了一个可靠的解决方案。为后续自动驾驶以及其它机器人领域(如机器人操作)的评估工作提供了新思路、新标尺。
稳定性: ★★★☆☆
由于底层使用了确定性规则函数,对于已激活的规则,其评估是稳定的。但上层VLM的推理过程可能仍存在一定的随机性和不确定性。如果再引入RL的随机策略,稳定性可能会受到一些影响。
适应性以及泛化能力: ★★★★☆
由于模型是在长尾场景上训练的,因此在处理复杂路况上天然有优势。作者声称其框架对其他规则集(不局限于EPDMS)是通用的,这一点需要更多验证,目前看来很有潜力。迁移到新的国家、新的路况,可能需要重新微调VLM。
硬件需求及成本: ★★★☆☆
方案需要在推理中运行一个2B或8B的VLM模型,对算力有一定要求,不适合部署在非常边缘的嵌入式设备上。但在数据中心或云端用于模型评估,或者作为训练时的奖励模型,成本是可以接受的。
复现难度: ★★★☆☆
论文提到了基于开源模型Qwen-3和训练框架VERL,但数据集和训练代码尚未完全开源,要实现完全一样的复现还需要等作者团队放资源,有一定工作量。
产品化成熟度: ★★★☆☆
目前仍停留在学术验证层面,主要用于离线、开环的评估反馈。要成为安全系统的核心评判组件,还需要大量闭环测试和验证。未来如果能作为RL训练的奖励函数,产品化前景会很不错。
可能的问题: 主要问题在于目前只做了开环验证,对于闭环环境下的实时性和准确性缺乏探讨。同时,VLM的“幻觉”现象仍可能对规则激活的选择产生影响,这是一个已知的隐患。
主要参考文献
[11] Daigavane et al., "NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking", 2023.
[45] Scheel et al., "DriveCritic: A Novel Vision-Language Model for Autonomous Driving Evaluation", 2024.
[38] PhysicalAI-Autonomous-Vehicles Dataset.
[52] Qwen Team, "Qwen3: A Versatile Large Language Model Series", 2025.
[12] Shao et al., "DeepSeekMath: Pushing the Limits of Mathematical Reasoning", 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+北京+英伟达+龙哥) ,根据格式备注,可更快被通过且邀请进群。更有机会与龙哥深入探讨本期DriveJudge、VLM评估等前沿话题!