← 返回 PaperDaily 视觉与图像

博世自动驾驶视觉语言动作模型:A100近30fps且闭环成功率77.27%

论文基本信息 方法简称: 快速高效自动驾驶视觉语言动作模型(FIVE-VLA) 原文标题: FIVE-VLA: Fast and Effective Autonomous Driving with Recurrent Action Memory 主要署名单位: 博世 合作单位: Five AI Ltd. 首次公开: 2026年9月16日(arXiv v1)

论文基本信息

方法简称:快速高效自动驾驶视觉语言动作模型(FIVE-VLA)

原文标题:FIVE-VLA: Fast and Effective Autonomous Driving with Recurrent Action Memory

主要署名单位:博世

合作单位:Five AI Ltd.

首次公开:2026年9月16日(arXiv v1)

原论文:
https://arxiv.org/abs/2609.18623

龙哥导读

把大模型装进自动驾驶汽车,最容易被忽略的不是“它懂不懂路况”,而是两个很工程的问题:一帧画面要算多久?上一秒刚做过什么,它还记不记得?博世这篇FIVE-VLA没有继续堆模型,而是把高分辨率图像压缩到98个视觉标记,绕过无必要的文字生成,再用只有1700万参数的循环动作记忆保存时序信息。最终,6.41亿参数模型在A100上达到29.96帧每秒,并把闭环驾驶测试系统(Bench2Drive)成功率做到77.27%。

自动驾驶模型看到前车突然减速,真正要回答的并不是“画面里有什么”,而是“它正在变慢,而且我上一时刻已经开始制动,现在还应该怎样继续”。单张图像能告诉模型空间关系,连续动作却决定车辆能否平顺、安全地完成避让。

问题在于,很多视觉—语言—动作模型把大量算力花在图像标记和逐字生成上,却没有一个轻量、稳定的时序记忆。它们可能很会解释驾驶场景,但车不会等模型慢慢组织语言。FIVE-VLA最值得看的地方,就是同时处理“算得快”和“记得住”,而且把记忆放在最接近控制结果的动作侧。

图1:论文对时序记忆路线的比较。左侧以紧急制动说明连续信息的价值;中间展示滑动视觉窗口、Flex和QT-Former等视觉侧记忆;右侧展示循环动作记忆如何把上一时刻动作标记送回当前决策。来源:论文官方源码中的Figure 1。

一、自动驾驶大模型为什么容易“又慢又健忘”

视觉语言模型原本擅长看图、理解文字和回答问题。把它改造成自动驾驶系统后,模型还要输出车辆未来的路径与速度。好处是能够借用大规模预训练得到的语义理解能力;代价是原本为聊天和图文问答设计的计算链,并不天然适合几十毫秒一次的实时控制。

第一笔开销来自图像。论文输入的前视图分辨率为448×896。如果直接按常见的14×14小块切分,会产生2048个视觉标记。闭环视觉语言动作模型(SimLingo)使用像素重排和双图块处理后仍有512个标记,而且左右图块在视觉编码阶段缺少完整交互。视觉标记越多,后续语言模型的注意力计算越重。

第二笔开销来自文字。有些模型先自回归生成推理文本,再预测轨迹;即使只输出固定的“轨迹点”提示,也需要连续生成多个文字标记。对聊天来说,四个标记不算什么;对每一帧都要重新决策的驾驶系统来说,它们会变成重复等待。

第三个问题是记忆。把过去多帧图像全部拼进当前输入,计算量会随着历史长度增长,还可能超出视觉语言模型预训练时见过的标记规模。用额外模块压缩视觉历史,又会改变预训练骨干原有的接口,让有限的驾驶数据承担重新适配的压力。

更直接的做法是输入历史轨迹,但这也可能诱导模型走捷径:训练时看到的是专家车辆的完美历史,模型只要顺着过去运动外推就能降低误差;真正闭环运行时,历史却来自模型自己的不完美预测,小误差会不断积累。于是开环数字看起来更好,车辆实际闭环表现反而更差。

二、总体结构:98个视觉标记,一次前向直接出轨迹

FIVE-VLA的输入包括前视图、车辆当前速度、两个导航目标点和文字指令。输出分成两组:路径路点描述车辆应该往哪里走,按一米间隔采样;速度路点描述未来固定时间间隔内车辆应该怎样运动。两组结果分别服务于转向与加减速控制。

模型采用高效视觉语言模型(FastVLM)作为骨干。它的视觉编码器把卷积层和注意力层结合起来,卷积阶段逐步降低空间尺寸,再把更少的标记交给后续注意力计算。448×896图像最终只产生98个视觉标记,相比直接切分的2048个减少约21倍,相比前述基线的512个减少约5倍。

这里并不是简单把图片压糊。高效视觉骨干支持高分辨率预训练,整张宽图不需要被拆成互不交流的两块;视觉编码器只有约1.25亿参数。完整FIVE-VLA为6.41亿参数,明显小于论文比较的10亿、30亿和70亿参数模型。

在默认高效驾驶模式中,论文观察到一个朴素却有效的事实:用于触发轨迹预测的文字输出始终固定。既然每次都只是生成相同的“Waypoints:”标记,就可以把它们预先放进输入,直接让模型在一次前向计算后输出动作标记和轨迹。这一步不改变预测目标,却拿掉了逐字生成造成的串行延迟。

图2:FIVE-VLA总体结构。前视图经高效视觉编码器处理,速度、导航点和文字进入统一模型;橙色模块是循环动作记忆,使用上一时刻动作标记更新当前动作查询,最后分别解码路径路点和速度路点。来源:论文官方源码中的图2。

图2中最关键的是橙色支路。可学习的动作查询原本像一组空白提问:“未来路径和速度应该是什么?”循环动作记忆先读取上一时刻语言模型输出的动作标记,压缩成记忆状态,再让当前动作查询去关注这份记忆。当前画面仍是主要证据,但决策不必每一帧从零开始。

论文同时保留了带文字推理的驾驶模式和自由问答能力。需要解释时,模型可以先生成文字,再预测轨迹;需要实时控制时,则采用不生成文字的高效模式。这样的分工比强迫每一帧都写一段“思考过程”更符合车端实际:解释能力保留,但不让它绑架实时路径。

三、循环动作记忆:不存整段画面,只记决策留下的痕迹

循环动作记忆由两个轻量Transformer块组成。编码器对上一时刻更新后的动作标记做自注意力,得到记忆状态;解码器让当前可学习动作查询通过交叉注意力读取该状态。整个模块只有约1700万参数,远小于论文比较的Flex记忆模块和QT-Former方案。

它保存的不是“上一帧长什么样”,而是“模型上一时刻准备怎样行动”。这个选择非常贴近驾驶控制。前车是否逼近、车辆是否已开始让行、方向盘是否正在完成超车,最终都会在动作表征中留下痕迹。把这些痕迹送回当前决策,可以帮助模型维持连续意图,又避免不断叠加高维图像历史。

核心关系可以写成两步:先由记忆编码器把上一时刻动作标记At-1变成记忆Mt-1;再让当前动作查询Q通过记忆解码器读取Mt-1,得到送入语言模型的动作查询Q̃t。最后,当前动作标记At被解码为路径和速度,同时成为下一时刻的新记忆输入。

直觉上,它像驾驶员短时保留的“动作语境”。刚才已经判断前车减速并开始踩刹车,下一眼即使画面变化很小,也不必重新证明一次“前车正在减速”;模型只需要结合新画面判断刹车应继续、加深还是释放。记忆不是替代当前视觉,而是让连续决策有上下文。

为什么不直接输入过去3个或10个车辆位置?论文的对照很有意思。历史路点让真实数据上的开环平均误差更低,却让Bench2Drive闭环成功率从无记忆版本的73.03%降到64.39%或70.00%。模型容易复制专家历史;闭环时历史换成自己的预测,捷径就不可靠了。动作标记记忆使用的是模型内部状态,没有把专家轨迹直接塞给模型,闭环成功率反而提高到77.27%。

四、训练难点:连续数据太相似,记忆越长不一定越好

训练循环记忆需要把连续帧组成数据流。麻烦在于,相邻驾驶画面往往高度相似。当总批量固定时,序列越长,同一批次能容纳的独立场景越少,梯度的信息多样性随之下降。模型虽然获得更长时间上下文,却可能因为样本过于相关而学得更差。

论文固定批量为32,把序列长度从1增加到16。即使不启用记忆模块,只改变批次里的连续性,上述闭环测试的驾驶得分和成功率在长度超过2后就明显下降。这说明“把更多连续帧塞进训练”并非免费午餐,长序列本身就可能伤害训练质量。

图3:在总批量固定时,连续训练序列越长,批次中的独立数据流越少,驾驶得分与成功率随之下降。该实验解释了论文为何先训练主体,再单独微调循环动作记忆。来源:论文官方源码中的Figure 3(a)。

因此,FIVE-VLA采用两阶段训练。第一阶段不带循环动作记忆,先用更充分的独立样本训练视觉语言骨干、动作表示和轨迹解码器;第二阶段再加入记忆模块,并只微调记忆、语言模型和动作解码相关部分。这样既避免主体从一开始就被连续样本拖累,也让记忆学会在已有动作空间里工作。

新模块的初始化也很克制。记忆解码器的关键输出投影被置零,使模型刚开始微调时等价于“没有记忆”:当前动作查询仍沿残差连接直接通过。随着训练推进,记忆支路才逐步学会提供修正。这和许多参数高效微调方法先把新增残差设为零的思路一致,可以减少突然插入随机模块对原有能力的破坏。

训练序列长度只有4,但真实驾驶显然会持续更久。如果让递归状态无限累积,推理长度远超训练长度,记忆可能漂移;如果每4步彻底清空,关键上下文又会断掉。论文提出“记忆累积”:主实例负责当前预测,辅助实例从空状态开始预填;每经过一半训练序列长度,两者交接,让新实例接管。

图4:循环动作记忆的两种推理方式。简单重置会周期性丢失上下文;记忆累积通过主、辅实例交接,让接管者已经拥有一段近期状态,同时避免单条递归链无限增长。来源:论文官方源码中的Figure 3(b)。

消融结果支持这一设计。绕过记忆时驾驶得分为88.23、成功率72.42%;无限累积为89.74和73.94%;周期重置为90.21和75.91%;主辅交接的记忆累积达到90.95和77.27%。它不是靠“记得越久越好”,而是让推理时的有效序列长度尽量贴近训练分布。

五、闭环结果:220个场景里,成功率提高10个百分点

闭环训练使用约200万张通用驾驶模拟器(CARLA)图像,按每秒4帧计算约140小时驾驶数据,并带有驾驶推理与视觉问答标注。评估覆盖前述闭环测试和泛化驾驶测试系统(Fail2Drive)。前者包含220个超车、汇入、让行等挑战场景;后者同时测试分布内场景和动物、非常规停车车辆等泛化危险。

Bench2Drive使用驾驶得分和成功率。驾驶得分把路线完成度与交通违规惩罚结合起来;成功率要求整条路线完成且没有违规。FIVE-VLA得到90.95驾驶得分和77.27%成功率。相比前一代视觉语言动作基线SimLingo的85.07和67.27%,分别提高5.88分和10个百分点。

这组对比还有一个容易被忽略的地方:FIVE-VLA只使用单个前视相机,却超过了部分多相机方案,也在论文表格中超过一种同时使用相机和激光雷达的领先方法。但不同方法的训练数据、实现和传感器配置并不完全相同,更适合把它看作统一榜单上的强结果,而不是证明单目视觉在所有条件下都能替代多相机与激光雷达。

Fail2Drive的泛化分区更能观察模型遇到陌生危险时会不会迅速掉线。FIVE-VLA在泛化场景得到77.5驾驶得分、67.0%成功率,调和均值71.9;SimLingo对应71.7、55.0%和62.2。FIVE-VLA从分布内切换到泛化场景时,成功率相对降幅为20.0%,SimLingo为30.6%。

图5:Fail2Drive中的泛化场景示例,包含训练分布之外的障碍与非常规停车情况。图中呈现车辆观测和规划轨迹,用于观察模型面对陌生危险时的闭环决策。来源:论文官方源码中的Fail2Drive案例图。

循环动作记忆的贡献可以单独拆出来看。无记忆版本为88.49驾驶得分、73.03%成功率;加入记忆后提升到90.95和77.27%。提升最大的不是交通标志识别这类单帧任务,而是让行、超车和紧急制动:让行能力增加26.67分,超车增加7.40分,紧急制动增加6.11分,平顺性相对提升超过10%。

这恰好对应方法的设计目标。看清一个标志牌,当前画面通常已经足够;判断是否继续让行、何时完成超车、前车减速是否需要更强制动,都依赖连续变化。记忆带来的收益集中出现在真正需要时间判断的动作上,而不是所有分项一起机械上涨。

六、真实道路数据:开环更安全,但还不是道路闭环验证

论文还在英伟达真实道路自动驾驶数据上训练和测试。训练约860小时,测试约350小时。这里使用的是非反应式开环模拟:模型读取记录好的真实道路观测并预测轨迹,其他交通参与者不会因为模型的动作而改变行为。

单视角下,FIVE-VLA的三秒速度轨迹平均位移误差为0.402米,SimLingo为0.550米;有责碰撞违规率为0.78%,SimLingo为0.87%。四视角下,FIVE-VLA使用392个视觉标记,速度平均误差0.391米、有责碰撞违规率0.75%;SimLingo使用2048个标记,对应0.504米和0.82%。

图6:NVIDIA真实道路记录上的定性比较。上排展示停止交通前制动和跟随慢速养护车辆,下排展示绕开停放车辆与工程车辆;鸟瞰图中的交叉标记表示预测车辆轮廓发生重叠。这里是非反应式开环评估,不是车辆真实上路闭环测试。来源:论文官方源码中的定性比较图。

图6展示了记忆主要改善速度行为的直观例子:遇到停止交通或慢速车辆时,模型更早、更连续地调整速度;多视角则帮助判断侧方停放车辆和工程车的净空。论文数字也显示,加入动作记忆后,速度误差改善明显,而路径误差改善相对温和。

但这一部分不能直接解释为“真实道路安全率已经得到验证”。记录数据中的周围车辆不会响应模型的预测,车辆也没有真正执行控制后再产生下一帧。它能证明模型在真实视觉分布下给出的轨迹更接近记录、模拟违规更少,却不能替代真实车辆闭环、长尾交通互动和安全认证。

七、速度账:近30帧每秒意味着什么

论文在T4、A100和H200三类图形处理器上测试单视角吞吐。FIVE-VLA分别达到3.89、29.96和56.71帧每秒;前述10亿参数基线为0.50、7.99和14.14;另一种70亿参数模型在T4显存不足,在A100和H200上为0.98和2.13。

从组件消融看,更换高效视觉骨干后,T4速度从0.50提高到2.20帧每秒,同时成功率从68.18%升到73.03%;绕过固定文字生成后,速度进一步提高到5.35帧每秒,驾驶成绩不变;加入循环动作记忆后速度回落到3.89,但成功率提高到77.27%。

这是一笔很清楚的工程账:高效视觉编码和单次前向负责把延迟降下来,动作记忆用一部分速度换取时序能力。最终系统不是单项最快的无记忆版本,却在速度和闭环质量之间取得了更好的组合。

不过,A100近30帧每秒不等于整车控制链稳定达到30赫兹。论文测量的是模型吞吐,真实系统还包括图像采集、预处理、数据传输、控制器、冗余安全模块和车载硬件差异。T4被作者用作车端设备的代理,但它也不是具体量产平台。因此,这个数字证明模型推理已经进入更实用的范围,不代表完整车辆时延已经验收。

八、和SimLingo、DriveLM放在一起看:语言模型终于开始服从控制节拍

驾驶语言模型(DriveLM)把驾驶场景组织成图结构问答,强调对象关系、决策解释和语言推理,为“驾驶不仅要看,还要理解关系”提供了重要路线。它更像在建立驾驶认知与问答框架,重点并不是以轻量模型直接完成高频闭环控制。

SimLingo进一步把视觉、语言对齐与闭环驾驶连起来,是FIVE-VLA最直接的基线。它证明语言监督可以帮助视觉驾驶模型理解场景,但512个视觉标记、固定文字生成和缺少显式时序记忆,让速度与连续动作仍有改进空间。

FIVE-VLA补上的一环,是让语言模型架构适应控制系统的节拍:图像编码更轻,默认驾驶不再生成无必要文字,时序记忆不再堆历史图像,而是复用上一时刻动作标记。它没有否定语言推理,而是把“需要解释时说话”和“需要控制时立即行动”分成两个模式。

这条路线对机器人也有启发。机械臂、移动机器人和无人机同样面对连续观测、高频控制与语言理解之间的冲突。若任务的关键历史能在动作表示中保留,动作侧记忆可能比无限扩大视觉窗口更省算力,也更容易与已有视觉语言骨干兼容。

九、这篇论文仍有哪些现实距离

第一,最强闭环证据来自CARLA模拟环境。Bench2Drive和Fail2Drive覆盖丰富危险场景,适合比较方法,但真实道路还有传感器污染、地图误差、施工变化、人类驾驶博弈和硬件故障。模拟闭环领先是重要进展,不等同于公共道路安全证明。

第二,单前视相机仍会缺少侧后方空间信息。论文自己观察到,合流能力从加入记忆中获得的提升很小,原因更可能是视野不足而不是时间信息不足。记忆可以告诉模型“刚才发生了什么”,却无法凭空看到从侧后方进入的车辆。

第三,动作记忆会递归使用模型自己的内部状态。主辅实例交接缓解了超长序列偏移,但复杂交通中的长期错误累积仍值得继续测试。尤其当第一次判断已经错了,记忆可能帮助模型保持错误意图,也可能被新视觉纠正;论文现有实验还不能覆盖全部长尾情况。

第四,吞吐不是端到端车载时延。模型参数和帧率已经比多项基线友好,但量产部署还要看功耗、峰值显存、传感器同步、控制周期抖动、故障降级和安全冗余。工程团队不能只拿A100数字推算车端体验。

十、龙哥点评:这不是“车会聊天”,而是大模型终于学会少说快做

很多视觉语言动作模型的故事容易写成“模型更聪明了”。但真正部署时,聪明必须经过速度、连续性和控制接口三道门。FIVE-VLA的贡献不靠单一巨大模块,而是三项互相配合的取舍:减少视觉标记、删除固定文字生成、在动作侧加入小记忆。

龙哥尤其喜欢“动作侧记忆”这个判断。视觉历史包含的信息很多,但并非都与下一步控制有关;上一时刻动作标记已经是模型对场景理解后的压缩结果。记住这个结果,再用当前画面校正,符合控制系统对低延迟和连续性的共同要求。

更难得的是,论文没有只展示漂亮的开环误差。历史路点输入在开环更好、闭环更差的反例,提醒研究者不要把“预测更接近专家轨迹”自动翻译成“车辆开得更好”。自动驾驶最终是反馈系统:模型的输出会改变下一时刻输入,任何捷径都可能在闭环里被放大。

如果后续能在真实车辆闭环中验证长时间记忆稳定性,并与多视角感知、冗余安全控制结合,这条路线会更有说服力。就目前结果而言,FIVE-VLA已经给出一个很实用的方向:不是让驾驶大模型拥有更多历史,而是让它保留最值得记住的历史。

十一、龙迷三问

1. 29.96帧每秒是否意味着可以直接装车?

还不能这样下结论。这个数字是A100上的模型吞吐,说明推理效率显著改善。真实装车还要把摄像头、预处理、通信、控制器、安全冗余和车规硬件都算进去,并验证最坏情况下的稳定时延。

2. 动作记忆会不会让模型一直重复上一时刻的错误?

存在这种风险,所以当前视觉仍然是主要输入,记忆只是条件信息;论文还用主辅实例交接限制递归长度。现有闭环结果表明它总体提高了让行、超车和制动,但更长时间、更复杂真实道路上的错误累积仍需要进一步验证。

3. 为什么不保存历史视频,反而保存动作标记?

历史视频信息更完整,也更昂贵。动作标记已经压缩了模型对场景的判断,并且直接关联路径和速度。论文对比显示,视觉侧滑动窗口、Flex和QT-Former都没有超过动作记忆;这不代表动作记忆永远最优,但在当前数据量和骨干结构下,它的效率与闭环效果更平衡。

十二、总结

FIVE-VLA把448×896图像压缩为98个视觉标记,以一次前向计算直接输出路径和速度,再用轻量循环动作记忆连接前后时刻。641M参数模型在Bench2Drive取得90.95驾驶得分和77.27%成功率,在A100上达到29.96帧每秒。

比数字更值得记住的是设计原则:高分辨率感知不必等于海量视觉标记,语言模型用于控制不必每帧生成文字,时序理解也不必把全部历史图像重新送入模型。对连续决策系统来说,真正有效的记忆不是保存一切,而是保留会改变下一步动作的内容。

本文基于龙哥读论文检索系统(PaperDaily)与论文挖掘工具包(PaperMiner),并通过模型上下文接口(MCP)进行汇总整理。

本文为论文解读,方法与实验数字以原论文为准;模拟闭环和真实数据开环结果不等同于公共道路安全认证。

原论文链接已列于文首,建议结合全文阅读方法细节与实验设置。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球