← 返回 PaperDaily 视觉与图像

32.7%提升背后:VLM+规则工具箱混合评估新范式

自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!

32.7%提升背后:VLM+规则工具箱混合评估新范式
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏——DriveJudge,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!


原论文信息如下:
论文标题:
DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models
发表日期:
2026年06月

发表单位:
英伟达 (NVIDIA)

原文链接:
https://arxiv.org/pdf/2606.17362v1.pdf

开源代码链接:
暂无

场景认知缺失:传统驾驶评估的“盲区”

想象一下,你正在路上开车,前方突然出现一个抛锚的卡车。为了绕过它,你借道逆行了一小段。这时候,一个严格的考官坐在副驾上,面无表情地在你的考卷上打了个大大的红叉——因为“不能压双黄线”。你是不是会觉得这个考官有点“一根筋”?他完全没考虑到,你是在一个连卡车都停了的紧急情况下,做出了一个合理且最安全的决策。

这正是当前大多数自动驾驶评估系统面临的尴尬境地。目前主流的评估方法有两种:一种是“模仿考试”,即计算预测轨迹与“人类专家”轨迹的相似度,偏差越小分越高;另一种是“交规考试”,即制定一系列硬性规则(如:不能压线、不能超速、与前车保持车距),全自动打分。

前者的问题在于,人类司机本身也有开得不好的时候,把他们的轨迹当绝对标准,等于默认了“我就是真理”,显然不科学。而后者,也就是基于规则的方法(例如被广泛使用的 EPDMS​),虽然条理清晰、可复现,但它最大的问题就是——“死脑筋”

规则是死的,但路况是活的。在那些“长尾场景”(Long-Tail Scenarios,即不常见的、复杂的边缘情况)中,比如为了避让行人压实线、为了躲避障碍物稍微侵入对向车道,这些“不守规矩”的操作恰恰是优秀司机的表现。但传统的规则考官可不管这些,上来就是一通扣分,导致很多明明很合理的驾驶行为被判定为“不及格”。

正是为了解决这个问题,来自 英伟达 的研究团队提出了一个全新的思路——DriveJudge。它不是要废除规则,也不是完全依赖人工智能的“感觉”,而是巧妙地让两者结合,当一个真正懂得“看情况”的驾校考官。
图1:评估范式的对比。传统的评估方法要么死板,要么模糊。DriveJudge结合二者优点,根据场景上下文决定是否忽略“车道保持”规则,以便进行避让。
图1:评估范式的对比。传统的规则方法缺乏场景意识,只会老老实实扣分;而DriveJudge则能根据上下文语境,机智地决定哪些规则该“睁一只眼闭一只眼”。在这个例子中,DriveJudge为了允许车辆“挤入”或者“轻微转向”去避障,忽略了车道保持规则。

DriveJudge:像驾校考官一样“看情况”扣分

一个好的考官,不会只是盯着考试大纲机械打分。他会先看一眼路况:哦,前面有障碍物,这时候你选择绕行,虽然压实线了,但更安全、更高效,那就不扣分。DriveJudge 的设计哲学正是如此。

它的核心思想是,将“知道该怎么开”(场景理解)与“知道该怎么考”(规则计算)这两个环节解耦。

具体来说,DriveJudge 不再对所有的规则一视同仁。它会先调用一个强大的 视觉语言模型(VLM,Vision-Language Model) 来“看”一眼当前的路况。这个VLM就像一个经验丰富的老司机,能一眼识别出前方的修路区域、旁边的行人、或者临时的交通管制。然后,它根据看到的场景,决定哪些规则现在“适用”,哪些规则该“暂时停用”。
图2:DriveJudge框架图。模型通过VLM感知场景上下文,决定哪些规则函数(如碰撞检测、车道保持)应该被激活,然后只对激活的规则进行打分。
图2:DriveJudge框架。VLM作为“大脑”,根据场景上下文决定哪些评估指标与当前情况相关,然后只激活这些相关的规则函数,最后综合它们的输出,给出一个带有上下文感知的驾驶质量得分。

例如,对于“车道保持”这个规则,在正常巡航时,它至关重要;但在紧急避让时,它就可以被忽略。VLM会输出一个“门控向量”——一个由0和1组成的开关信号,告诉系统哪些规则开关应该被打开或关闭。之后,那些被激活的“安全卫士”规则函数(如检查是否会撞车、是否偏离路线等)才开始进行精确的数学计算和打分,最后汇总成一个总分。

这样一来,整个评估过程既有VLM带来的灵活性,又有规则计算带来的可解释性和高精度,彻底告别了以前的“死板”或“模糊”。

双轮驱动:VLM推理+规则基底如何协同工作?

DriveJudge 的牛逼之处,就在于它把两种听起来互不搭界的做事风格强强联合了。

一方面,它用一个微调过的 VLM(基于 Qwen-3 模型)来负责“软”的、语义层面的理解。VLM接收车载摄像头的画面以及渲染好的鸟瞰图(BEV),然后像人类一样去“看”懂这个场景,并凭借其强大的常识推理能力,判断出哪些规则此刻应该被激活。在这个环节,它像是一个懂得变通的艺术生。

另一方面,它又极度依赖经典、精确的规则函数来做“硬”的、物理层面的判断。一旦VLM决定了哪些规则“上岗”,这些数学函数就立刻接手,以一种确定性、可重复的方式计算碰撞风险、车道偏离度等关键指标。这些底层函数不会被VLM影响,它们只做冷冰冰的精确计算。在这个环节,它又回归了一个严谨的工程师身份。
图3:DriveJudge数据集。图中展示了数据集中各种具有挑战性的驾驶场景,包括那些虽然偏离常规但最终合理的驾驶行为,以及精细化的驾驶失败案例。
图3:DriveJudge数据集。数据集包含各种具有挑战性的场景,比如“虽然压线但合理”的行为,以及各种“确实开得很烂”的失败案例。

不只是理论:35K+样本与开放标签的训练之旅

要让一个模型学会“看情况”,光靠嘴说可不行。英伟达团队做了一个很重要的工作——构建了一个大规模的、高质量的专用数据集。

他们从公开的 PhysicalAI-Autonomous-Vehicles 数据集中,精心挑选了那些最“刁钻”的场景。具体方法是,先用传统的规则指标去给人类司机的轨迹打分,专门挑出那些明明人类开得很好,却被糟糕的规则指标打了低分的片段。这些片段是典型的“法不责众”案例,也是训练 DriveJudge 的最佳素材。

最终,他们标注了 10,732 个片段,并从中提取了 33,577 个标准化的 2秒片段。每个片段都由人类判断其驾驶行为是否“合理”。其中,约 15.3% 被标记为驾驶失败。这个数据集规模巨大,且其重点关注复杂和长尾场景,为后续的评估模型训练提供了坚实的基础。

有了数据之后,DriveJudge 的训练分两步走:

第一步:有监督微调(SFT)

首先,模型学习回答一个问题:“在这个场景下,我应该激活哪些规则?” 这相当于让模型跟着老师(人类标注)学习解题,快速掌握基本的决策模式。

第二步:强化学习(RL)

然后,模型开始自我进化,学习如何更好地给出一个高分。强化学习阶段的目标非常明确:当比较两条轨迹时,DriveJudge 给出的评分顺序,必须与人类的偏好一致。如果人类更喜欢轨迹A,而DriveJudge却给了轨迹B更高分,它就会受到“惩罚”,从而不断调整自己激活规则的策略,直到与人类的口味完全吻合。

刷新SOTA:新指标如何赢过老将?

为了验证 DriveJudge 是否真的厉害,作者们设计了两个“考裁判”的基准任务。翻译成大白话就是:我们来评选一下,到底哪个驾照考官评分最准。

第一个任务是 驾驶质量分类:让各种指标去判断一段驾驶行为是“好”还是“坏”,看它们的判断与人类专家的判断一致性如何。

第二个任务是 轨迹偏好选择:给两条候选轨迹,让指标选出人类更喜欢的那一条。我们一起来看看结果吧。
表1:驾驶质量分类性能对比。报告了在多个阈值下的准确率,以及AUC、平均精度等指标。DriveJudge在所有设置下都显著优于其他基线方法。
表1:驾驶质量分类性能。结果显示,DriveJudge在各个阈值下的准确率都遥遥领先,特别是AUC指标,比传统的EPDMS提升了21.23,这表明其在区分好坏驾驶行为上强得多。

从表1上看,传统规则的EPDMS的AUC是57.67,而DriveJudge-2B(2B参数版本)直接干到了77.95,提升超过20个点。8B版本更是达到了78.90。
表2:轨迹偏好选择性能对比。DriveJudge在预测人类偏好的轨迹上,准确率显著高于EPDMS和专门为此设计的DriveCritic模型。
表2:轨迹偏好选择性能。DriveJudge-8B的准确率达到82.83%,超越了专门为此任务设计的DriveCritic(76.33%),这充分说明了其融合规则与语义推理的巨大优势。

那么,DriveJudge 相比于其他方法到底好在哪呢?通过一个消融实验(表3)可以看得更清楚:
表3:消融实验。分别评估了VLM、规则检索引擎和后训练微调三个组件对模型性能的贡献。
表3:消融实验。表格清晰地展示了,只靠规则(VLM-DirectScore)或只靠推理(Non-VLM)都不行;只有“VLM + 规则工具箱 + 微调”三者结合,才能达到77.95的最佳效果。
从消融实验可以看出,只靠VLM直接打分(VLM-DirectScore),零样本时AUC只有50.06,加上微调也不过68.67,依然低于DriveJudge的77.95。这说明,如果不提供规则工具箱,即使VLM很强,但遇到需要精确空间判断的问题(如是否压线、距离边界多远),它的能力还是受限的。
图5:定性比较。DriveCritic由于缺乏空间定位能力,判断失误;而DriveJudge通过激活精确的规则函数,果断选择了正确的轨迹。
图5:定性对比。一个典型的例子:DriveCritic因为搞错了空间关系,认为没有车挡路还不管,选了错的轨迹;而DriveJudge调用规则函数,明察秋毫,精准选对了大家一致认为更好的轨迹A。
最后,团队还用 DriveJudge 重新评估了目前最先进的一些自动驾驶策略模型(如 Hydra-MDP、DriveSuprim等)。结果发现,这些模型在传统的 EPDMS 分数下表现一般,但在 DriveJudge 评估下却拿到了更高的分数。这说明,当前很多好的策略模型其实已经比人们想象的要强,只不过以前的“考官”太死板,没发现它们的亮点。当然,这同时也反映出,现有的基准测试可能在逐渐“饱和”,新的评估标准显得至关重要。
表4:最先进规划模型的性能比较。在DriveJudge评估下,所有模型都获得了比EPDMS更高的分数。
表4:最先进的规划模型在DriveJudge下重新评估。可以看出,所有模型的DriveJudge分数都优于EPDMS分数,揭示了它们更强的实际驾驶能力,或者说是更符合人类预期。

未来之路:开启闭环驾驶与策略优化的新篇章

DriveJudge 的提出,可以说是为自动驾驶评估领域提供了一把全新的标尺。它不再是冷冰冰的扣分机器,而是一个懂得变通的智能评判官。虽然目前论文还主要集中在开环(open-loop)评估上,即拿一段已经存在的轨迹去打分,但作者们已经明确指出了下一步的方向——将 DriveJudge 作为奖励函数(Reward Function),直接用于训练策略模型。想象一下,让一个能看懂场景的考官去指导自动驾驶车学习,那效果肯定比死板的扣分要好得多。

当然,任何新方法都会有挑战。把复杂的VLM引入评估流程,意味着对计算资源的要求更高,其内部机理也更像是一个“黑盒”。未来如何让它更轻量化、更高效,将是推动其落地的关键。 插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DriveJudge到底解决了什么问题?它解决的是自动驾驶评估领域一个核心矛盾:传统的规则评估方法是“死的”,不懂变通,经常把“合理避让”等好的行为判定为“驾驶失败”;而纯VLM的方法虽然懂上下文但缺乏物理精确性,难以做精细的安全判断。DriveJudge把两者的优势结合起来,让VLM判断“要不要激活规则”,再让规则函数做精确的“物理题”。

论文中的“长尾场景”具体指什么?长尾场景(Long-Tail Scenarios)指的是自动驾驶中那些不常见的、复杂的、边缘化的场景。比如路上有个突然出现的坑要绕行、红绿灯故障、旁边有紧急车辆需要让路等等。这些场景虽然不常发生,但一旦遇到,对驾驶能力就是极大的考验,也是当前评估模型最难搞定的地方。

DriveJudge和DriveCritic有什么区别?DriveCritic是一个典型的纯VLM偏好模型,它的目标就是给两条轨迹打分,判断人类更喜欢哪一条。它依赖VLM的“直觉”。而DriveJudge是一个更高级的智能体,它先“理解”场景,然后“选择”应该启动哪些规则工具箱,最后用这些工具去“计算”分数。所以,它不仅知道“哪个更好”,还知道“为什么好”,因为它能把结果归因到各个被激活的规则上(碰撞、车道偏移等),这正是核心差异所在。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

想法很新颖,将“工具调用”的思路引入评估领域,是一个很有价值的范式融合。不是简单的“VLM + 规则”,而是将规则当作可以调度使用的“工具”,这一思路很聪明。

实验合理度:★★★★☆

设计了两大基准测试来评估“评估指标”,这在学术界是比较少的,实验设计周密,消融实验清晰,对比对象也很有代表性,包括模仿学习指标、规则指标和纯VLM指标,非常全面。

学术研究价值:★★★★★

价值很高。这篇工作将“如何评价评价指标”这个底层问题摆上台面,并提出了一个可靠的解决方案。为后续自动驾驶以及其它机器人领域(如机器人操作)的评估工作提供了新思路、新标尺。

稳定性:★★★☆☆

由于底层使用了确定性规则函数,对于已激活的规则,其评估是稳定的。但上层VLM的推理过程可能仍存在一定的随机性和不确定性。如果再引入RL的随机策略,稳定性可能会受到一些影响。

适应性以及泛化能力:★★★★☆

由于模型是在长尾场景上训练的,因此在处理复杂路况上天然有优势。作者声称其框架对其他规则集(不局限于EPDMS)是通用的,这一点需要更多验证,目前看来很有潜力。迁移到新的国家、新的路况,可能需要重新微调VLM。

硬件需求及成本:★★★☆☆

方案需要在推理中运行一个2B或8B的VLM模型,对算力有一定要求,不适合部署在非常边缘的嵌入式设备上。但在数据中心或云端用于模型评估,或者作为训练时的奖励模型,成本是可以接受的。

复现难度:★★★☆☆

论文提到了基于开源模型Qwen-3和训练框架VERL,但数据集和训练代码尚未完全开源,要实现完全一样的复现还需要等作者团队放资源,有一定工作量。

产品化成熟度:★★★☆☆

目前仍停留在学术验证层面,主要用于离线、开环的评估反馈。要成为安全系统的核心评判组件,还需要大量闭环测试和验证。未来如果能作为RL训练的奖励函数,产品化前景会很不错。

可能的问题:主要问题在于目前只做了开环验证,对于闭环环境下的实时性和准确性缺乏探讨。同时,VLM的“幻觉”现象仍可能对规则激活的选择产生影响,这是一个已知的隐患。


主要参考文献

[11] Daigavane et al., "NAVSIM: Data-Driven Non-Reactive Autonomous Vehicle Simulation and Benchmarking", 2023.
[45] Scheel et al., "DriveCritic: A Novel Vision-Language Model for Autonomous Driving Evaluation", 2024.
[38] PhysicalAI-Autonomous-Vehicles Dataset.
[52] Qwen Team, "Qwen3: A Versatile Large Language Model Series", 2025.
[12] Shao et al., "DeepSeekMath: Pushing the Limits of Mathematical Reasoning", 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+北京+英伟达+龙哥),根据格式备注,可更快被通过且邀请进群。更有机会与龙哥深入探讨本期DriveJudge、VLM评估等前沿话题!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。