← 返回 PaperDaily 视觉与图像

ACM MM 2026中科院新作:矿区端到端驾驶,碰撞率直降75%!

城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!

ACM MM 2026中科院新作:矿区端到端驾驶,碰撞率直降75%!
原论文信息如下:
论文标题:
UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes
发表日期:
2026年08月
发表单位:
University of Chinese Academy of Sciences, Institute of Automation Chinese Academy of Sciences, Waytous Inc.
原文链接:
https://arxiv.org/pdf/2608.09098v1.pdf

想象一台自动驾驶汽车从干净的城市快速路,被直接扔进一座露天矿场:没有车道线,没有路缘石,没有交通信号,连导航用的高清地图都变成废纸。路上跑的是几十吨重的矿用卡车和挥舞巨臂的挖掘机,扬尘一起,摄像头和激光雷达看到的画面自动打上马赛克。坡道、土堆、矿坑把地形切割成一片片巨大的盲区,传感器没有扫到的地方,很可能就是悬崖或者挡土墙。
这就是矿区自动驾驶的真实难度:不是“路况复杂一点”,而是整个环境的结构先验全部失效。城市端到端方案之所以好用,是因为车道线、路沿、红绿灯和高精地图提供了大量隐性约束;矿区没有这些,模型很容易把“看不见的区域”当成“可通行区域”,结果就是灾难性决策。更麻烦的是,矿区道路还会因为开挖、倾倒作业而频繁改变拓扑,今天能走的路明天可能就是深坑。这种环境下,规划器必须学会一件事:区分“看得见的空闲”和“看不见的风险”。
本论文要解决的就是这个难题。作者来自中科院自动化研究所、中国科学院大学等单位,论文被 ACM MM 2026 接收。方法上提出端到端规划器 UnsDrive,同步还开发了面向矿区的闭环仿真器 MineLoop。下面,从问题、方法到实验,一层层拆开讲。

矿区自动驾驶为何如此困难?

要搞懂这篇论文的价值,得先明白矿区场景和普通城市道路的差别到底有多大。露天矿的运输道路没有标线,没有护栏,没有路口信号灯,路面本身还在不停变化:今天在挖的台阶,下个月可能就变成一条临时坡道。矿区里的主要参与者——重型矿卡和挖掘机,尺寸和动力学特性跟乘用车完全不同,起步、转向、制动都有自己的一套逻辑。传感器还要忍受粉尘、振动、强逆光和极端气象的交替考验。
更关键的是地形遮挡。矿区到处是坡道、土堆、料堆和矿坑,地形本身就会把传感器视野切成碎片。城市里偶发的遮挡只是局部盲区,矿区里这种遮挡是常态,大量区域处于“完全没看到”的状态。现有端到端方法通常在鸟瞰视角特征上做规划,默认把没观测到的体素当作可通行区域;在结构化道路上这样假设问题不大,但在矿区,这个假设可能直接把车导向高墙或深坑。论文还把另一个痛点摆上台面:矿区自动驾驶缺少闭环评测环境。开环评测只管轨迹预测准不准,完全不考虑规划结果反馈到控制之后,误差会不会像滚雪球一样越滚越大。没有合适的闭环仿真器,任何方法都难检验真实落地效果。
图1:UnsDrive 在 MineLoop 中的闭环管线。
UnsDrive 在 MineLoop 中的闭环管线。MineLoop 通过传感器仿真提供同步的相机、激光雷达与自车状态观测;UnsDrive 将这些输入编码为智能体、鸟瞰视角和占用特征,并条件化一个基于流的规划器来生成未来轨迹;规划好的轨迹再转换成控制指令,反馈给仿真器,完成非结构化矿区环境下的闭环评估。
正因为这两重困境,论文没有只做一个算法就收工,而是把方法设计和评测工具打包一起做,构建了一套从算法到闭环验证的完整体系。

未知感知占用表示:让模型"知道不知道"

在深入方法之前,先补一个基础术语:占用表示。自动驾驶模型常把三维空间划分成一个个小体素,为每个体素预测“被占据”还是“空闲”,这就是占用网格。BEV(Bird’s Eye View,鸟瞰视角)则是把三维信息压到二维俯视图。城市方法为省计算,喜欢直接把三维占用压成 BEV,这在城市里够用,但矿区丢不得高度信息:坡道、高墙、料堆这些垂直结构,一旦被“拍扁”就很难区分。UnsDrive 的设计目标,就是构造一个未知感知的三维占用表征,把“没看到”这件事显式地告诉规划器。
表示构建分四步走。第一步是多帧可见性估计。为不引入额外可学习参数,论文直接用激光雷达几何来完成:把连续 N 帧的激光雷达扫描变换到当前自车坐标系,在体素网格中做射线追踪。对每一帧,射线终止处标记为占据,射线穿过且没有终止处标记为空闲,没有被任何射线碰到的体素则是未观测,占据优先级最高。为了缓解点云稀疏,多帧观测会被聚合,并对已确认的空闲体素做单个体素膨胀,填补小空洞的同时保留占据边界。论文用可见性分数定义体素被观测到的程度:
公式1:体素可见性分数
公式1:体素可见性分数 V(v) = n_obs(v) / N,其中 n_obs(v) 表示体素 v 在这 N 帧中被观测到的帧数。该分数取值范围在 0 到 1 之间,1 表示所有帧都观测到,0 表示从未被观测到。
第二步是可见性调制的语义概率。原始语义占用分支会为每个体素输出一组类别概率,例如“地面”“障碍物”“车辆”等;现在用可见性分数把这份概率“打折”并显式引入未知类:
公式2:可见性调制的语义概率
公式2:P_k(v) = V(v) · p_k^raw(v),P_unk(v) = 1 − V(v)。这里 k 遍历原始语义占用分支预测的各个类别,V(v) 是该体素的可见性分数。可见性越低,原始语义类别概率越被压缩,未知类概率越高;可见性越高,语义预测越可信。对规划器而言,非可通行概率由预定义障碍类累加后,在垂直方向做最大池化投影到 BEV;未知概率同样投影,以确保观测不确定性不丢失。
第三步是门控占用编码。调制后的分布虽然捕捉了语义不确定性,但它仍然是离散概率,和网络学到的占用特征各走各的路。论文用轻量门控单元把两者融合:占用特征先投影到 token 空间,未知概率经一个轻量 MLP 映射为不确定性嵌入,然后两者共同计算通道级门控向量:
公式3:门控向量计算
公式3:g(v) = σ(W_g[f_occ(v); u(v)] + b_g),其中 f_occ(v) 是投影后的占用特征,u(v) 是由未知概率 P_unk(v) 得到的不确定性嵌入,W_g 和 b_g 是门控层可学习参数。最终占用 token 把门控加权后的特征与时间语义投影相加:
公式4:最终占用 token 融合
公式4:F_occ(v) = g(v) ⊙ f_occ(v) + (1 − g(v)) ⊙ u(v) + W_P P(v),其中 W_P 是语义概率向量 P(v) 的线性投影。这样设计既保留了占用特征的几何上下文,又把语义和不确定性显式编码进 token。
第四步是体积化标记。三维体素 token 仍然密集,为避免直接压成 BEV 损失高度信息,论文沿垂直方向使用一维卷积压缩高度维,减小 token 数量的同时保留垂直轮廓;压缩后的体量再展平成 token 序列,配上可学习的三维位置编码。最终,BEV 特征、智能体特征和压缩后的占用 token 共同构成后续规划器的条件输入 C。这套表示的核心价值,用一句话概括就是让模型“知道自己不知道”——它不会再把盲区当坦途。在矿山这种遮天蔽日的环境里,这个能力比偶尔多涨几个点的精度更保命。
图2:UnsDrive 总览
图2:UnsDrive 总览。多视角图像与激光雷达被编码成 BEV、智能体和占用特征;未知感知占用模块用可见性信息修正占用线索;基于这些特征,连同自车状态、导航指令和目标点,流匹配规划器生成多模态未来轨迹。

流匹配规划器:多模态轨迹生成新范式

把未知感知占用表示建好之后,下一个问题是怎么用它生成安全轨迹。矿区没有车道线的强约束,规划问题天然是高度多模态的:同一时刻,司机可以选择向左绕行、减速等待、从另一侧通过等多种合理行为。如果规划器只会回归一个确定性输出,最后得到的轨迹常常是多个合理模式的“平均值”,既不像人开的,也可能压到障碍物。论文用条件流匹配(Conditional Flow Matching,CFM)来建模未来轨迹的条件分布。
CFM 的核心思想可以这样理解:给定一条专家真值轨迹,先随机采样一条噪声轨迹,再把噪声轨迹沿着线性插值路径逐步“搬运”到真值轨迹;网络的任务是学习这个搬运过程中每个时刻的速度场。推理时,从不同的随机初始轨迹出发,沿着学到的速度场积分,就能得到多条合理的候选轨迹。训练目标很直接,计算预测速度场与目标传输速度之间的均方误差:
公式5:条件流匹配训练损失
公式5:L_CFM = E[ || v_θ(τ_t, t, C) − u_t ||² ]。其中 τ_t 是噪声和真值轨迹在时间 t 的线性插值状态,u_t 是从噪声轨迹指向真值轨迹的传输方向,v_θ 是条件速度场网络,C 为前文得到的场景条件。相比扩散模型逐级去噪,线性概率路径的训练目标更简单,传输过程也更稳定。
在架构细节上,流状态先被嵌入成航点 token,并与场景条件 C 做级联交叉注意力。论文特别强调这种注意力的顺序:规划器先关注未知感知的三维占用 token,把安全和不确定性信息优先注入;再看二维 BEV 特征,补足全局空间上下文;最后才是智能体特征,捕捉动态交互。这个“安全优先—全局—交互”的递进顺序,是符合矿区驾驶直觉的设计。导航信息则通过特征线性调制(FiLM)注入,导航指令、目标点和自车状态分别编码后相加,得到统一指令嵌入 e_cmd,再对融合后的轨迹特征做仿射变换:
公式6:FiLM 导航条件注入
公式6:h_l = γ(e_cmd) ⊙ h̃_l + β(e_cmd),其中 h̃_l 和 h_l 是第 l 个 FiLM 块的输入和输出特征,γ、β 由指令嵌入 e_cmd 回归得到,⊙ 表示逐元素相乘。
光会生成多样性轨迹还不够,还得保证轨迹不闯祸。为此论文设计了占用轨迹一致性损失(Occupancy Trajectory Consistency,OTC)。具体做法是先把三维占用沿垂直方向池化成二维概率图,获得 BEV 上的非可通行概率 P_occ 和未知概率 P_unk;然后对轨迹上的每个航点做双线性采样,得到航点风险:
公式7:航点风险计算
公式7:r_i = P_occ(x_i, y_i) + α·P_unk(x_i, y_i),α 是控制未知区域惩罚权重的超参数,取值在 0 到 1 之间。OTC 损失则对对超过安全容忍度 ε 的风险进行惩罚:
公式8:占用轨迹一致性损失
公式8:L_OTC = (1/T) · Σ max(r_i − ε, 0),T 为轨迹航点总数。该损失让规划器在训练过程中主动回避不可通行区域和未观测区域,而不是无条件相信占用网络给出的“空闲”判断。
推理阶段,模型从多个随机初始化轨迹出发生成候选轨迹,再用不确定性感知打分器排序。打分项由三部分构成:学习到的轨迹质量分数、非可通行占用惩罚、未知区域惩罚。这样规划器在最终选轨迹时,不只看轨迹顺不顺滑,还会掂量这条路到底“看得清不清”。打分器的训练使用基于边距的排序目标:
公式9:排序打分损失
公式9:L_score = Σ_{k≠k_ref} max(0, s_k − s_{k_ref} + m),其中 s_k 表示第 k 条候选轨迹的得分,k_ref 是与真值轨迹最接近的候选,m 是排序边距。
最终,模型端到端联合优化占用分割、流匹配生成、安全约束和排序打分:
公式10:总训练损失
公式10:L = L_CFM + λ_occ·L_occ + λ_OTC·L_OTC + λ_score·L_score,其中 λ_occ、λ_OTC、λ_score 为各损失的平衡权重。这样一套组合拳,把生成多样性、可通行性、可见性和导航意向全部放进同一个可微框架,互相制衡,而不是各管一段。对矿区这种“看不到比看到更常见”的环境,这种耦合设计尤为关键。

MineLoop闭环仿真器:填补评测空白

光有算法还不够,矿区自动驾驶一直没有合适的闭环评测平台。城市里有 CARLA 这类成熟的仿真器,但矿区没有。论文于是自己动手造了一个:MineLoop。这个仿真器的定位类似 CARLA,但场景、车辆和运营逻辑全部是露天矿版本。
MineLoop 的场景源自实地勘察和无人机测绘数据,数字重建出矿山地形,并带有运输道路、坡道、交叉口、装载区、卸载区、临时作业区等矿区语义区域。行为引擎支持矿卡、挖掘机、装载机、工作车辆等重型设备建模,还能模拟跟车、超车、让行、排队和“装载—运输—卸载”的完整作业循环。扬尘、能见度骤降、光照变化、路面状态改变等矿山特有干扰也可以配置。感知仿真方面,车辆装有六路 1920×1080 相机,以 2Hz 运行,另有四台 128 线激光雷达,以 10Hz 运行,自车采用 16 自由度动力学模型。
MineLoop 最“对味”的一点是,它直接从场景几何和智能体状态生成占据、空闲、未观测三类标注,不需要人工标注,也因此能稳定监督占用乃至未知感知建模。闭环评估流程如图1所示:传感器数据进入 UnsDrive,规划轨迹转成控制指令,反馈给仿真器更新自车和周围智能体,再输出新一帧观测。整个过程循环往复,直到碰撞、长时间偏离道路、到达终点或超时终止。相比开环评测只比较轨迹误差,闭环能真实反映长程执行中误差累积的影响,这对矿区这种弱结构环境尤为重要。
图3:MineLoop 场景示例
图3:MineLoop 场景示例。图中展示了不同矿区条件下的代表性场景,包括运输道路、装卸区、交叉口和临时作业区等。

实验结果:全面超越现有方法

实验在开环和闭环两条线上展开。开环评测使用按 nuScenes 风格整理的矿区数据集,共 89 段场景、34229 帧,其中包含 11054 个关键帧,覆盖装载、运输、卸载全流程以及临时道路、T 型路口、装载区、卸载区等元素。闭环评测则在 MineLoop 上采用类 Bench2Drive 交互协议,任务包括运输道路跟随、避障、装载区驶离、卸载区靠近、临时作业区穿越等矿区专项科目。
开环结果见表1。对比方法包括占用世界模型 OccWorld、占用网络 OccNet、稀疏占用方法 SparseWorld,以及生成式规划代表 DiffusionDrive。从数据来看,所有基线在矿区场景里都有明显性能下滑,可见城市与矿区之间的领域鸿沟相当大。UnsDrive 则在全部指标上领先:平均 L2 误差 0.44 米,平均碰撞率 0.10%;相比最强的基线 SparseWorld,平均 L2 误差从 0.85 米降到 0.44 米,平均碰撞率从 0.33% 降到 0.10%。尤其是 3 秒时,L2 误差 0.61 米对 1.35 米,差距进一步拉大,说明规划器在长时域上的稳定性更突出。
表1:矿区数据集上代表性方法的开环评估对比
表1:矿区数据集上代表性方法的开环评估对比。指标包括 1s、2s、3s 和平均的 L2 轨迹误差(米,越低越好)以及碰撞率(%,越低越好)。
闭环结果见表2。UnsDrive 驾驶得分 84.25,成功率 68.56%,领先最强的 SparseWorld 分别达 6.89 分和 10.29 个百分点。闭环评测中,任何微小误差都会通过反馈回路累积放大,因此这个差距比开环数字更有说服力。在矿区这种传感器视野频繁受限的环境中,显式建模未知区域带来的收益在闭环长程执行里被进一步放大。
表2:MineLoop 上的闭环评估
表2:MineLoop 上的闭环评估。指标为驾驶得分(越高越好)和成功率(%,越高越好)。
图4展示了两个典型矿区场景下的轨迹可视化。每个场景上一行是专家真值轨迹,下一行是模型预测的多模态轨迹,红色为最佳预测,绿色为较差预测。可以看到,即使最差的候选轨迹,也基本不会硬闯不可通行区域。
图4:仿真中的定性结果
图4:仿真中的定性结果。两个典型矿区场景下的轨迹时序可视化,每个场景上一行为真值未来轨迹,下一行为预测的多模态轨迹;红色为最优预测,绿色为较差预测。
消融实验同样支撑了论文的核心论点。表3是开环关键组件消融:将未知感知机制移除或替换成朴素占用后,L2 误差和碰撞率都会明显反弹;去掉 OTC 损失,碰撞率显著上升;去掉排序打分损失,整体表现也出现退化。表4的闭环消融表明,驾驶得分和成功率上各组件都在发挥正向增益,其中未知感知表示和 OTC 损失的贡献最突出。看到碰撞率从 0.33% 一路压到 0.10%,很难不让人想再翻一遍方法部分,确认一下这套设计思路在矿区场景里是否真的这么立竿见影。
表3:关键组件消融实验
表3:关键组件消融实验。逐步去除未知感知、OTC 损失和评分模块后,L2 误差与碰撞率的变化情况。
表4:闭环组件消融实验
表4:闭环组件消融实验。驾驶得分与成功率随各组件移除的变化,未知感知表示与 OTC 损失贡献最大。

总结与展望

UnsDrive 的贡献可以归结为一条清晰的主线:把“未知区域”从占用表示的附属产物,提升为规划决策的核心要素。论文在算法侧用可见性调制和门控融合构造了未知感知占用表示,在规划侧用流匹配生成多模态轨迹,并用 OTC 损失与不确定性打分器确保轨迹不闯入不可通行或未观测区域;在评测侧则推出了 MineLoop 这个矿区专属闭环仿真器。方法、评测互相咬合,形成一个相对完整的闭环体系。
展望未来,矿区运输的自动化需求非常真实:矿山环境有固定的作业流程和高昂的设备成本,安全性和运营效率都急需提升。但当前所有实验都基于 MineLoop 仿真环境,距离实际露天矿部署还有一段路要走。后续如果能引入更多真实矿区数据、在硬件在环平台上验证,或者把未知感知机制推广到林区、灾后救援等类似非结构化场景,价值会进一步放大。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面向矿区非结构化场景,中科院等提出UnsDrive:显式建模未知、自由、占据三维空间,以流匹配生成多模态规划轨迹,并推出MineLoop闭环仿真器。开环L2误差0.44米、碰撞率0.10%;闭环驾驶得分84.25,全面超越现有方法
这篇工作最值得看的点是什么?在开环评测中,UnsDrive在所有指标上均取得最优结果,平均L2误差0.44m,平均碰撞率0.10%,显著优于最强基线SparseWorld(L2: 0.85m, 碰撞率: 0.33%)。在闭环评测中,UnsDrive取得驾驶分数84.25和成功率68.56%,分别超过最强基线SparseWorld达6.89和10.29个百分点。
这篇工作的边界或风险在哪里?优点:(1) 首次将未知区域显式建模引入端到端规划,有效解决非结构化场景中的部分可观测问题;(2) 采用条件流匹配替代扩散模型,训练更稳定、推理更高效;(3) 提出MineLoop闭环仿真器,填补矿区自动驾驶评测空白。缺点:(1) 所有实验均在仿真环境中进行,缺乏真实矿区场景验证;(2) 感知模块依赖预训练权重,端到端联合训练的计算开销较大;(3) 对极端天气和传感器故障的鲁棒性未充分验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种面向非结构化矿区场景的端到端规划框架,通过显式建模未知区域的占用表示,并基于条件流匹配生成多模态未来轨迹,实现安全可靠的自动驾驶规划。

实验合理度:★★★★☆

开环评测使用轨迹L2误差(1s/2s/3s及平均值)和碰撞率(1s/2s/3s及平均值);闭环评测使用驾驶分数(Driving Score)和成功率(Success Rate)。

学术研究价值:★★★★☆

提出一种面向非结构化矿区场景的端到端规划框架,通过显式建模未知区域的占用表示,并基于条件流匹配生成多模态未来轨迹,实现安全可靠的自动驾驶规划;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

论文未明确给出具体计算量数据。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2) 采用条件流匹配替代扩散模型,训练更稳定、推理更高效;(3) 提出MineLoop闭环仿真器,填补矿区自动驾驶评测空白。缺点:(1) 所有实验均在仿真环境中进行,缺乏真实矿区场景验证;(2) 感知模块依赖预训练权重,端到端联合训练的计算开销较大;

主要参考文献

Zeng N, Song R, Guo X, et al. UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes[C]//Proceedings of the 34th ACM International Conference on Multimedia (MM ’26), 2026. https://arxiv.org/pdf/2608.09098v1.pdf
DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving. arXiv 2025.
OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving. ECCV 2024.
OccNet: Scene as Occupancy for Embodied Intelligence. arXiv 2023.
SparseWorld: Towards End-to-End 3D Occupancy Prediction and Planning. arXiv 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球