← 返回 PaperDaily 视觉与图像

Mila等最新研究:告别仿真瓶颈!自博弈训练端到端自动驾驶,效率吊打行为克隆

在继2026年6月推送过‘自动驾驶新突破!LLM+端到端双系统让无人车学会"老司机"思维’之后,今天Mila、蒙特利尔大学等机构的研究者们又开辟了让AI在虚拟世界里‘自己跟自己飙车’以训练端到端驾驶的新范式。其核心在于用超高速模拟器Gigapixel实现像素级自博弈训练,显著提升了模型的闭环鲁棒性,是应对长尾安全问题的一记猛药。

Mila等最新研究:告别仿真瓶颈!自博弈训练端到端自动驾驶,效率吊打行为克隆
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
在继2026年6月推送过‘自动驾驶新突破!LLM+端到端双系统让无人车学会"老司机"思维’之后,今天Mila、蒙特利尔大学等机构的研究者们又开辟了让AI在虚拟世界里‘自己跟自己飙车’以训练端到端驾驶的新范式。其核心在于用超高速模拟器Gigapixel实现像素级自博弈训练,显著提升了模型的闭环鲁棒性,是应对长尾安全问题的一记猛药。


原论文信息如下:
论文标题:
Scaling Self-Play for End-to-End Driving
发表日期:
2026年06月

发表单位:
Mila, Universite de Montreal, Polytechnique Montreal, Torc Robotics, NYU Tandon School of Engineering, McMaster University, Princeton University

原文链接:
https://arxiv.org/pdf/2606.19641v1.pdf

开源代码链接:
https://github.com/montrealrobotics/gigapixel

项目链接:
https://montrealrobotics.ca/gigapixel/

想象一下,一个刚从驾校毕业,只看过道路回放视频的「菜鸟司机」,第一次上路就遇到了前方车辆突然急刹,他的反应大概率会是直直地撞上去。这就是当前主流的端到端自动驾驶模型训练范式——行为克隆(BC)的真实写照。它们坐在「冷板凳」上,通过观看数以万计的人类驾驶录像来学习,虽然可以掌握一部分驾驶技能,但由于从未在真实的闭环环境中实践过,一旦遇到训练数据中罕见的「长尾」情况,就极易因自身行为进入未知状态而引发一连串的失误。

为了解决这个固有问题,来自Mila、蒙特利尔大学、普林斯顿大学等机构的研究人员提出了一套名为Gigapixel的新框架,它把整个训练过程搬到高速模拟器中,让AI在虚拟世界里「自己跟自己斗智斗勇」,即通过自博弈(Self-Play)来学习鲁棒的端到端驾驶策略。你可能会问,自博弈在游戏领域早已不是什么新鲜事,为什么在自动驾驶里才刚起步?因为缺一个既能跑得快,又能提供像素级画面的模拟器。Gigapixel正是为此而生,它跑得飞快,每秒能处理5万个智能体的步骤,同时还能渲染出视角场景,让基于视觉的端到端模型得以直接训练。

基于自博弈的DAgger训练范式

在自动驾驶领域,主流做法是「看录像学习」——行为克隆(BC)。AI跟着人类开的轨迹进行模仿,看起来像那么回事,但一遇到录像里没见过的场景(比如前车急刹、侧方加塞),就很可能原地懵圈,犯下灾难性错误。问题的根源在于:AI从没在真正的闭环里自己开过,它不知道自己的错误行为会引发什么连锁反应。
要解决这个问题,最直白的思路就是让AI在模拟器中自己跟自己练——也就是自博弈(Self-Play)。不是说自博弈很火吗?AlphaGo、星际争霸、Dota2……但为什么自动驾驶领域一直没怎么用上?因为缺一个能同时满足两个条件的模拟器:(能跑上亿步)且能输出像素级画面(端到端模型需要相机图像)。之前的模拟器要么跑得飞快但只给矢量鸟瞰图(BEV),要么画面逼真但慢得像老牛拉破车。
Gigapixel团队的前一作Gigaflow已经证明了用自博弈RL(强化学习)在矢量BEV上训练能得到鲁棒的驾驶策略,但痛点在于——矢量化BEV跟端到端模型需要的原始摄像头图像是两码事。于是他们横向拓展,把模拟器升级为能渲染透视视角(perspective rendering)的高吞吐引擎,并提出了更高效的训练方案——自博弈DAgger
整个方法分为三条腿走路(见图2):
(a) 在矢量BEV模拟器中用自博弈RL训练一个教师模型(Teacher)。教师模型小而轻,运行方便,不怕RL的样本低效问题。它学到的驾驶行为非常稳健。
(b) 在Gigapixel的像素级模拟器中,用自博弈DAgger把教师的知识蒸馏给学生。所有场景里的AI车辆都由学生策略控制,教师则「暗中」给出轨迹标签。这种多智能体同时参与的方式,让每个模拟器步都能产出海量训练数据。
(c) 最后,通过轻量级感知适配,把学生从抽象的模拟器画面迁移到真实摄像头影像上。只微调感知模块的编码器,规划头不动。
图2:端到端驾驶的自博弈训练流程
图2:端到端驾驶的自博弈训练流程。(a)在抽象模拟器中用自博弈RL训练矢量化的教师;(b)在Gigapixel中通过自博弈DAgger把教师蒸馏给像素级学生,所有智能体由学生控制,教师并行产生轨迹标签;(c)通过配对的模拟-真实观测对微调感知骨干,将学生适配到真实影像。
为什么不自博弈RL直接训像素级模型?因为太慢了。看看图1,把DrivoR这种Transformer模型塞进RL循环,每一步都要前向+反向传播,每秒处理的步数骤降到几百。而教师模型只有270万参数,在矢量化状态上RL优化到250亿步都是可行的。所以用蒸馏代替RL,是现实的计算策略。
图1:Gigapixel吞吐量 vs 分辨率
图1:Gigapixel吞吐量 vs 分辨率。在1块NVIDIA A100L GPU上,对比不同渲染分辨率和策略架构下的智能体步数每秒(SPS)。当模型变大(如DrivoR),渲染不再是瓶颈,光栅化(Rast.)与光线追踪(RT)的差距变小。HUGSIM和RAP的吞吐量用其公开代码测得,慢了上千倍。
自博弈DAgger与普通DAgger最大的区别在于:普通DAgger里只有主车是学习策略控制的,周围车辆要么回放日志要么用固定规则行为;而自博弈DAgger里场景中所有车辆都由学习策略控制,这样产生的交互场景才是真正「活」的。当策略在进化,它遇到的交互也在进化,自然就把训练数据推向了更丰富的长尾区域。而且每步产生的样本数不是1份,而是N份(N为场景中受控的智能体数量),效率成倍提升。

自博弈DAgger的数学表达

标准的DAgger(数据集聚合,Dataset Aggregation)目标函数为:
其中dπstudent是学生策略下的状态分布,πexpert提供动作标签,L是动作损失。学生和专家可以通过不同的观测函数(Ostudent、Oexpert)来获取信息。
自博弈DAgger把单学生的状态分布扩展为所有智能体都由学生控制时的联合状态分布,并且对每个智能体i收集标签:
这里N是智能体数量,τi是教师为智能体i生成的轨迹目标。通过这种方式,每个模拟器步都产生了多份监督信号,训练效率大幅提升。
论文作者还在图3中直观比较了自博弈DAgger与直接自博弈RL的样本效率差距:
图3:自博弈DAgger vs 自博弈RL的样本效率对比
图3:自博弈DAgger vs 自博弈RL。在Gigapixel中训练CNN模型,自博弈DAgger(蓝线)仅用约3000分之一的步数就超越了直接RL的驾驶得分,逼近教师水平(虚线)。
插图

高性能像素级模拟器Gigapixel

自博弈之所以在自动驾驶里迟迟无法铺开,一个关键瓶颈就是模拟器的速度。之前的高吞吐模拟器(如Gigaflow、PufferDrive)只能给矢量鸟瞰图,端到端模型不认;而能出逼真画面(如CARLA、HUGSIM)的模拟器,每秒只能跑几十步,根本没法支撑自博弈所需的几十亿步训练。
Gigapixel的聪明之处在于:它做了一个简约但够用的模拟器。场景中的车辆、行人、骑手都用简单的立方体表示,车道线用细条,红绿灯用小球。看似简陋,但关键的几何关系和交互信息一个不少。用Madrona渲染引擎做批量化GPU加速,支持光栅化和光线追踪两种后端。
在单张A100L GPU上,Gigapixel的光栅化渲染器在512×512分辨率下,能达到超过5万智能体步/秒(SPS)的吞吐量,比HUGSIM快约1000倍,比RAP快约4000倍。即便用光线追踪,速度也远超其他像素级模拟器。而且随着模型复杂度增加(比如用Transfomer架构),渲染就不再是瓶颈了。图1已经展示了这个对比。
来直观感受一下Gigapixel的渲染效果(下图是光线追踪和光栅化的对比):
图7:光线追踪 vs 光栅化渲染对比
图7:光线追踪 vs 光栅化的Gigapixel渲染效果对比。光栅化吞吐量更高,但着色更简单;光线追踪视觉效果更丰富,但速度稍慢。两者都保留了必要的场景结构。
下面这个GIF展示了Gigapixel渲染器生成的ego视角像素视图(蓝色立方体为其他车辆,细线为车道线,彩色小球为交通灯):
Gigapixel渲染视角
Gigapixel渲染器生成的egocentric像素视图。蓝色立方体为车辆,细线为车道,彩色小球为交通灯。虽简约,但足够保留驾驶所需的几何与交互信息。

轻量级仿真到真实感知适配

在Gigapixel里训练好的学生模型,可以完美驾驭那些抽象的立方体世界;但一换到真实的摄像头影像上,画面风格完全不同,直接泛化会崩掉。怎么办?论文提出了一种轻量级感知适配方法,核心思想是:规划头(planning head)已经学到了鲁棒的闭环驾驶行为,不需要再动了;只需要把感知骨干(perception backbone)稍作调整,让真实影像映射到规划头能理解的隐空间即可。
具体做法:收集一对配对数据——真实影像和对应的Gigapixel抽象渲染图(通过把真实场景的智能体状态提取出来,交给Gigapixel渲染得到)。然后冻结规划头,微调感知骨干,使得真实影像提取的特征与抽象渲染图提取的特征尽可能一致。损失函数包含两部分:一个是,另一个是规划输出的一致性损失(沿用自博弈DAgger的规划损失)。
整个适配过程不需要任何人类轨迹标注,只需要配对的模拟-真实观测样本就行。这大大降低了迁移成本。

实验与结果分析

论文在多个基准上做了测评,包括光真实感的闭环仿真器HUGSIM和伪闭环基准NAVSIM-v2,以及Gigapixel自带的测试集。

HUGSIM闭环结果

HUGSIM是一个基于神经重建的逼真模拟器,难度分为Easy/Medium/Hard/Extreme四个等级。核心指标是HD-Score和Route Completion(RC)。结果见表1:
表1:HUGSIM闭环评估结果
表1:在光真实感HUGSIM模拟器中的闭环评估结果。分数按难度级别报告(E=Easy, M=Medium, H=Hard, X=Extreme)。RC=路径完成率,HD-Score为HUGSIM驾驶分数。Human Trajectory? 代表训练时是否使用了人类轨迹作为监督。粗体为最佳,下划线为次佳。
可以看到,Gigapixel-DrivoR(自博弈训练 + 感知适配后的DrivoR)在平均HD-Score上达到38.5,超过了所有基线,包括使用行为克隆的DrivoR(35.7)以及VAD、UniAD等方法。最值得一提的是回归版的Gigapixel-DrivoR-Reg比BC版的DrivoR-Reg提升了12.5个HD-Score点,相对提升高达60%。这说明自博弈DAgger对闭环驾驶的提升非常显著。
不过,在Extreme难度下,Gigapixel-DrivoR的分数(21.6)略低于DrivoR(32.5)。作者仔细分析了原因:DrivoR开得更,平均碰撞速度为5.27m/s,而Gigapixel-DrivoR只有1.95m/s。在极端对抗场景中,快车有时能冲过去避免碰撞,而慢车反而被堵住。但显然,开得慢且碰撞强度低是更安全的特性。

NAVSIM-v2结果

NAVSIM-v2是一个伪闭环基准(pseudo-closed-loop),重点考察Stage 2的EPDMS指标——这是最接近闭环执行鲁棒性的衡量。结果见表2:
表2:NAVSIM-v2 navhard结果
表2:NAVSIM-v2 navhard结果。Gigapixel模型在Stage 1指标上已经具备竞争力(无需人类轨迹),并且在Stage 2进一步提升了性能。
Gigapixel-DrivoR在Stage 2 EPDMS上达到50.1,而基础DrivoR只有48.3,且Gigapixel-DrivoR没有使用任何人类轨迹(Human Trajectory?列为空),也没有使用SimScale数据。这证明了自博弈训练带来的闭环鲁棒性。

消融实验与缩放实验

表3展示了在HUGSIM上对训练策略和感知适配设计的消融:
表3:消融实验
表3:在HUGSIM上的消融实验。所有变体均使用DrivoR-Reg。粗体为最佳,下划线为次佳。
关键发现:自博弈DAgger训练比单一DAgger(只有主车学习)和Behavior Cloning都好;加入感知L2损失并冻结规划头(最后一行)取得了最优结果33.2。如果去掉感知L2损失或者不冻结规划头,性能都会下降。
图4展示了扩展实验(Scaling Experiment),随着训练步数增加,自博弈DAgger训练的性能持续提升,而BC和单一DAgger提升缓慢甚至停滞:
图4:缩放实验
图4:缩放实验。对比不同训练策略在Gigapixel中的性能随步数变化。自博弈DAgger(红线)在所有步数下都优于BC(黑线)和单一DAgger(蓝线),而且随着步数增加,优势进一步扩大。

定性对比:自博弈 vs 行为克隆

论文提供了多组直观的闭环驾驶对比视频。图5展示了一个经典场景——前车减速停车,自博弈训练的DrivoR能提前减速并绕行通过,而BC训练的DrivoR直直地撞了上去:
图5:与前方减速车辆交互的定性对比
图5:定性对比——靠近减速前车时的闭环驾驶行为。上方(绿色):自博弈训练的DrivoR,在前车停止时减速并规划平滑的侧向轨迹,绕过停下的车辆。下方(红色):BC训练的DrivoR,直行计划,距离前车越来越近,最终追尾。
图6展示了另一种边缘情况——当车辆被挤到路肩附近时,自博弈策略能从容地转回车道,而BC策略则飞出道路:
图6:路肩边缘恢复行为对比
图6:路肩边缘的恢复行为。上方(绿色):自博弈训练的DrivoR缓慢转向,保持车辆在可行驶区域。下方(红色):BC训练的DrivoR未正确纠正,冲出路肩。
下面这个GIF拼接了多个场景,左边是自博弈策略,右边是行为克隆策略,差异非常明显:
自博弈 vs BC 多场景对比
自博弈策略(左侧) vs 行为克隆策略(右侧)在5个真实场景中的闭环驾驶对比。自博弈策略能提前减速、规划避让,而BC策略往往保持高速直行并导致碰撞。

局限性与未来展望

虽然Gigapipeline大法好,但也不完美。作者指出了几个局限性:
第一,Gigapixel的抽象渲染虽然保留了场景结构,但完全丢掉了纹理细节(路面标识、车型外观、天气光照等)。这就导致在感知适配时需要依赖配对数据来桥接,而配对数目的获取本身并不简单(需要从真实传感器数据中提取标签重建抽象场景)。
第二,在极端场景(Extreme难度)下,自博弈训练的模型偏向保守驾驶,虽然安全但容易被敌对智能体堵死。未来或许可以通过调整训练时的奖励偏好(Reward Preference)来鼓励策略在某些情况下更果断。
第三,目前的方法只在模拟器内验证了自博弈DAgger的扩展性,还没有在真实路测中大规模部署。从模拟到真实的鸿沟依然存在,虽然感知适配减轻了问题,但还不够完美。
未来方向包括:把自博弈训练从静物场景扩展到含动态交通灯和行人交互的更全场景;探索同时训练感知和规划的端到端联合优化;以及把该方法迁移到更多传感器模态(如激光雷达点云)。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DAgger是什么?和本文的Self-Play DAgger有什么不同?DAgger(Dataset Aggregation,数据集聚合)是一种经典的模仿学习算法。它让学习策略在环境中执行,收集它访问到的状态,然后让专家给这些状态标注动作,再把这些数据加到训练集中,反复迭代。这样学习策略可以不断「修正」自己去适应自己产生的状态分布。传统的DAgger只让主车学习,周围车辆是固定的;而Self-Play DAgger让场景中所有车辆都由学习策略控制,产生的状态分布更丰富,而且每步能得到N份训练数据(N为车辆数),效率更高。

Gigapixel的渲染速度为什么能这么快?关键在于两个设计:①场景元素极度简化——车辆用立方体、车道用细条、红绿灯用小球,省掉了大量的几何和纹理计算。②采用Madrona渲染引擎,这是一个批量的实体-组件-系统(ECS)框架,可以在GPU上同时渲染成千上万个独立场景。相比之下,RAP跑在CPU上,没有批量优化,所以慢了上千倍。HUGSIM虽然画面真实,但基于高斯泼溅的渲染需要复杂的重建和渲染管线,速度自然慢。

为什么要在三种不同的基准上评测?HUGSIM、NAVSIM-v2和Gigapixel内置评测有什么区别?Gigapixel内置评测是在同样的抽象仿真场景中直接测量驾驶得分,主要用来对比不同训练策略的样本效率。HUGSIM是一个光真实感的闭环仿真器,用真实世界场景重建而来,能更逼真地模拟传感器输入,考验sim-to-real迁移后的闭环表现。NAVSIM-v2是一个伪闭环基准(使用真实摄像头数据但带有扰动),它特别关注Stage 2的EPDMS指标,相当于在位置或朝向被扰乱的「危机时刻」测试策略的恢复能力。三种评测从不同角度检验了方法的有效性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

直接提出自博弈DAgger + 高吞吐像素模拟器的组合,解决了端到端驾驶闭环训练的关键瓶颈,创新点清晰且落地性强。

实验合理度:★★★★★

实验设计全面,覆盖了闭环伪闭环两种主流基准,做了充分的消融和缩放实验,定量定性对比齐全,结论可信。

学术研究价值:★★★★★

给出了自博弈在端到端驾驶中可扩展的实践路径,启发了后续把模拟器速度和保真度折衷的设计思路,贡献范式级。

稳定性:★★★★✰

自博弈策略在大多数场景下稳定且保守,但在极端对抗场景中略微保守;整体碰撞速度低,安全冗余好。

适应性以及泛化能力:★★★★✰

在HUGSIM和NAVSIM-v2上表现良好,均未使用人类轨迹;但模拟到真实场景的迁移目前依赖配对数集,泛化有待拓宽。

硬件需求及成本:★★★✰✰

训练时教师需要250亿步(成本较高),学生蒸馏需要150M步(需1-2天);但推理时模型大小适中,单张A100可跑。

复现难度:★★★★✰

代码和项目均已开源,环境依赖清晰;但Gigapixel渲染器基于Madrona引擎,有一定上手门槛。

产品化成熟度:★★★✰✰

现阶段更偏向研究验证,未在实车闭环测试过完整系统;感知适配的配对数集获取简化了迁移,但还需要更多real-world验证。

可能的问题:自博弈训练生成的极端场景仍然有限(主要由对抗模式构成),真正长尾的corner case(如非机动车违章、动物横穿等)覆盖率不足;感知适配依赖配对重建,精度受限于自动标签提取。

主要参考文献

[1] Luke Rowe et al. "Scaling Self-Play for End-to-End Driving." arXiv:2606.19641, 2026.
[2] Gigaflow: High-throughput batch driving simulator for vectorized BEV self-play. (Rowe et al.)
[3] Madrona: GPU-accelerated entity-component-system for massive parallel simulation.
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。