← 返回 PaperDaily 视觉与图像

nuPlan上新方法涨分23点:闭环错误变教材

自动驾驶最难的不是“会开”,而是“开错了怎么补课”。R2LPL把闭环里的错误当成教材,再用终身学习把知识存住,思路很务实,尤其适合关心落地和长期迭代的人。

nuPlan上新方法涨分23点:闭环错误变教材
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
自动驾驶最难的不是“会开”,而是“开错了怎么补课”。R2LPL把闭环里的错误当成教材,再用终身学习把知识存住,思路很务实,尤其适合关心落地和长期迭代的人。


原论文信息如下:
论文标题:
Learning from mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.29710v1.pdf
项目链接:
https://github.com/Engibacter/R2LPL

自动驾驶策略的“犯错”与“学习”循环

自动驾驶最尴尬的地方,不是“第一次开不会”,而是“已经会了,还是会犯错”。更麻烦的是,很多错误不是一次性翻车,而是闭环里一点点偏航、犹豫、误判,最后把车带进死胡同。R2LPL抓的正是这个痛点:让策略从自己的错误里继续学,而不是只盯着专家日志背题。
封面
图1:R2LPL整体框架图。流程很直白:先让当前策略在闭环里跑起来,再从错误里挖出可恢复的状态,接着检索出还能纠正的目标,最后把这些新知识写回策略,并通过终身学习把旧知识也保住。
这篇论文的核心观点其实很朴素:闭环错误不是垃圾数据,处理得好就是高价值教材。 传统模仿学习主要学专家怎么开,问题是专家日志覆盖不到策略自己会踩的坑;强化学习能从试错里学,但在自动驾驶这种安全敏感场景里,直接“乱试”代价太高。R2LPL试图走一条折中但更实用的路:先部署,再观察错误,再把错误转成可用监督,最后持续迭代。
这里先把几个缩写讲清楚。R2LPLRollout-Retrieval Lifelong Policy Learning,中文可理解为“部署-检索式终身策略学习”。文中还频繁出现 OCL,即 Online Continual Learning,中文是“在线终身学习”或“在线持续学习”。它想解决的不是一次训练后就完事,而是策略每次更新后都能继续学、继续记、继续变强。

方法论揭秘:R2LPL如何从错误中“淘金”

R2LPL不是简单地“把失败样本拿来继续训”。它更像一套筛矿流程:先挖矿,再筛矿,再炼金。因为闭环里并不是所有错误都值得学,有些状态已经来不及救,有些状态虽然看着危险,但其实没有明确可行动的纠正目标。把这些混在一起硬学,最后很可能学到一堆噪声,模型越训越拧巴。
这套方法的第一步叫 Rollout,也就是让当前策略在闭环仿真里实际跑一遍。这里的关键不是“跑得像不像专家”,而是“跑的时候会在哪些地方出问题”。论文把这些问题分成三类:Failure(已经发生的失败)、Risk(还没撞,但已经很危险)、Conflict(决策和参考行为明显冲突,比如该让不让、该停不停)。这种分法很务实,因为自动驾驶里的错误经常不是“瞬间爆炸”,而是先有风险,再有冲突,最后才失败。
第二步叫 Retrieval,也就是“检索纠正目标”。这一步最容易被误解成“找个专家动作替换一下就完了”,其实没那么粗暴。论文强调的是 可恢复性:不是所有出错状态都能纠正,只有那些还能在当前动作空间里找到合理修正方向的状态,才值得留下来当监督。换句话说,已经翻进沟里的车,和还在路边打滑的车,不是一回事。前者更多是事故,后者才是教材。
图2
图2:论文中的闭环错误挖掘与可恢复性筛选示意。核心意思是:先从闭环轨迹里找出失败、风险和冲突相关片段,再判断这些片段是否还能被有效纠正,避免把“救不回来的现场”硬塞给模型学习。
第三步是把可恢复状态转成训练信号。这里论文没有直接回归连续轨迹,而是沿用了一个更容易检索、也更适合回放的设计:基于轨迹锚点的打分式规划。锚点可以理解成一组候选未来轨迹,模型不是直接“画”出一条线,而是给每个候选轨迹打分,再选分数高的。这个设计很关键,因为一旦动作空间是有限候选集,就能把“纠正目标”表示成可存储、可回放、可再学习的监督信号,而不是一团说不清的连续值。
论文里真正有意思的地方,是它给不同来源的监督分配了不同权重。靠近专家日志的状态,更多依赖专家参考;接近闭环错误但仍可恢复的状态,则更强调规则与路径一致性;离专家太远、但仍有修正价值的状态,则主要靠闭环里定义的可行纠正目标。说白了就是:监督不是一刀切,越像“现场急救”,越要谨慎处理。
图3
图3:R2LPL的纠正目标构造逻辑。论文把闭环状态按“离专家有多远、还能不能修”分层,再为不同层次的状态生成不同强度的监督,目标是把噪声降下来,把真正有用的纠错知识留下来。
第四步是 Lifelong Policy Learning,也就是终身策略学习。这里的“终身”不是噱头,而是真要解决一个老问题:新学到的纠错知识,不能把旧知识冲没了。自动驾驶策略每更新一次,未来闭环里看到的状态分布就会变,下一轮又会冒出新的错误。如果只盯着最新一轮数据训练,模型很容易“今天会右转,明天忘了直行”。所以论文用了回放记忆,把历史纠正样本和当前轮次样本一起训练,同时还保留历史输出分布的约束,防止模型把以前学过的偏好直接洗掉。
更细一点看,R2LPL的记忆更新也不是简单按“谁最新就记谁”。论文给记忆样本设计了综合优先级:一边看这个样本有多难学,另一边看它在闭环里有多有用。然后采用分桶式的平衡回放,尽量避免某类场景把记忆容量全占了。这个设计很像训练一个学生,不是只把他最常错的题堆满抽屉,而是要让题型分布合理,既补短板,也不丢基础。
图4:R2LPL的终身学习与记忆回放机制。新一轮闭环纠错样本会和历史纠错样本一起进入训练,但记忆容量有限,因此论文用“难度 + 价值”的优先级来挑选最值得保留的样本。
如果把整套流程压缩成一句话,那就是:先让策略犯错,再把错误变成能学习的监督,最后靠记忆回放持续升级。 它不是在替代专家,而是在补上专家日志之外那块最难拿到、也最值钱的闭环经验。

实验数据说话:从“菜鸟”到“高手”的蜕变

实验部分最值得关注的,不是某一个孤立指标,而是它是否真的证明了“从错误中学习”这条路能走通。论文在 nuPlan 的闭环仿真基准上做了验证,重点看 Val14、Test14-hard 和 Test14-random,尤其是 最难的 Test14-hard。这个测试集长尾明显、场景更刁钻,最适合检验方法是不是只会在“熟题”上表演。
先说结论:R2LPL不是那种“涨一点点就开始喊革命”的工作,它在难场景上的提升相当实在。项目介绍里给出的结果显示,基础规划器在 Test14-hard 上经过 R2LPL 的多轮闭环学习后,非反应式协议下从 60.67 提升到 83.51,反应式协议下从 65.25 提升到 78.38。这个幅度不只是“分数好看”,而是说明闭环错误确实被转化成了有效纠错知识,且这种知识能被持续积累。
图5
图5:Test14-hard 上的主要闭环结果对比表。可以看到,R2LPL在最难场景上的提升最明显,说明它并不是只会在简单场景里刷分,而是真能啃长尾硬骨头。
更有说服力的是迭代曲线。论文展示了随着 ROCL 轮次增加,整体评分在持续上升,而碰撞、可行驶区域偏离等问题指标在下降。这个现象说明方法不是靠一次性“重训一把”碰运气,而是靠一轮轮闭环纠错、回放、再学习慢慢积累优势。对自动驾驶这种高风险系统来说,这种渐进式提升比“某一轮突然飙高”更可信,因为它更符合真实部署中的迭代节奏。
图6
图6:ROCL 轮次下的迭代改进趋势图。整体分数逐步抬升,碰撞与偏离类指标同步改善,说明“错误—纠错—记忆回放”的闭环确实在工作。
图7
图7:不同闭环协议和不同场景下的分项指标对比。论文希望证明的不只是总分上升,而是安全、舒适、进度这些维度都在一起变好,而不是“只会跑得快、不会刹车”。
从实验设计看,这篇论文比较加分的一点,是它没有把方法建立在“额外调用专家、现场在线标注”这种不现实前提上。它强调的是:闭环中自己产生的数据,自己再学回去。这个方向很适合大规模自动驾驶系统,因为真实部署里专家标签是贵的,闭环错误却是源源不断的。谁能把这部分数据吃干榨净,谁就更接近长期可持续迭代。
当然,实验也有边界。R2LPL依赖闭环仿真、锚点动作空间和可恢复性筛选,说明它当前更适合“有明确候选动作、可回放、可评分”的规划器框架。如果换成更自由的生成式规划器,或者场景分布和 nuPlan 差异很大,效果未必能直接照搬。但这并不削弱方法本身的价值,反而说明它抓住了一个工程上很关键的现实:先把能稳定落地的闭环学习机制做扎实,再谈更大一统的泛化。

总结与展望:迈向更聪明的自动驾驶

R2LPL最有意思的地方,不是它又堆了多少模块,而是它把一个很“脏”的现实问题讲明白了:自动驾驶策略一定会犯错,关键不是假装自己不会错,而是建立一套机制,持续把错误转成知识。这个思路对真实系统很有启发,因为上线后的模型不可能永远停留在训练集分布里,真正决定上限的,往往是它能不能从部署后遇到的新问题里继续进化。
不过,这条路也不是没有坑。第一,错误挖掘和可恢复性判断本身就带有规则和启发式成分,换到别的车道结构、别的地图风格、别的动作空间,筛选逻辑可能需要重做。第二,记忆回放虽然能缓解遗忘,但容量有限,长期运行后如何保持样本多样性,仍然是个老大难。第三,闭环仿真终究不等于真实道路,仿真里能修的,不一定在现实里也修得回来。
如果把这篇论文放到行业里看,它更像一套可持续迭代的工程框架,而不是一招打天下的万能公式。它告诉人们,自动驾驶策略的进步不一定非要靠更大的模型、更贵的标注,很多时候,先把“闭环里怎么学会不再犯同样的错”这件事做好,收益就已经很可观了。这个方向很适合做后续研究:比如把更丰富的场景语义纳入可恢复性判断,或者把检索到的纠错知识扩展到多模态规划器中,看看能不能把“自我纠错”做得更稳、更广。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是自动驾驶策略在闭环部署后,如何从自己的错误中持续学习的问题。重点不是再学一遍专家日志,而是把闭环里产生的失败、风险和冲突状态转成可回放、可训练的纠错知识。

R2LPL里的“可恢复性”是什么意思?意思是:不是所有出错状态都值得学,只有那些还能在当前动作空间里找到合理纠正目标的状态,才算“可恢复”。已经无法有效修正的状态会被过滤掉,避免把噪声当教材。

为什么还要做终身学习和记忆回放?因为策略每更新一次,未来看到的场景分布就会变,新的错误会出现,旧的知识也可能被遗忘。终身学习和回放机制的作用,就是让模型一边吸收新纠错知识,一边保住旧知识,避免“学了新的,忘了旧的”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不在于提出了全新的规划范式,而在于把“闭环错误→可恢复纠错→终身回放”串成了一个完整流程,工程味很足,也比较像真能落地的路线。

实验合理度:★★★★☆

在 nuPlan 的闭环协议上做验证,尤其盯住 Test14-hard 这种长尾难场景,实验设计是对题的;如果再补充更多跨数据集验证,说服力会更强。

学术研究价值:★★★★☆

它把“从自己的失败中学习”这个很现实的问题讲清楚了,对闭环决策、持续学习和自动驾驶规划都有启发,研究价值是有的。

稳定性:★★★☆☆

方法依赖闭环仿真、锚点动作空间和可恢复性筛选,稳定性比纯试错强,但离“随便换场景都能稳跑”还有距离。

适应性以及泛化能力:★★★☆☆

对 nuPlan 这类有结构化候选动作和闭环评测的任务很合适,但对更开放式的生成规划器,迁移成本会明显上升。

硬件需求及成本:★★★☆☆

训练和闭环 rollout 都有一定成本,不过它不需要在线专家标注,也不需要改模型架构,整体比“边跑边请专家”更现实。

复现难度:★★★☆☆

论文和项目给了较明确的框架思路,但依赖 nuPlan 数据集、devkit 和闭环环境,环境搭建不算轻松,属于“有代码能跑,但不算一键起飞”。

产品化成熟度:★★★☆☆

适合做闭环仿真中的持续优化模块,离真实道路端到端部署还需要更多安全验证、异常兜底和跨域测试。

可能的问题:可恢复性判定和记忆更新带有较强任务定制性,跨场景泛化仍需验证;闭环仿真提升显著,但真实道路上的收益还不能直接画等号。


主要参考文献

[1] Learning from mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving. arXiv, 2026.
[2] R2LPL project repository: https://github.com/Engibacter/R2LPL
[3] nuPlan benchmark and nuplan-devkit documentation.

自动驾驶最怕的不是不会开,而是开错了还不知道怎么改。R2LPL这类“从闭环错误里学”的思路,特别适合想把策略做得更稳、更能落地的读者。想看更多自动驾驶、机器人和端到端规划论文,欢迎加入龙哥读论文粉丝群,一起把复杂问题拆明白。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。