← 返回 PaperDaily 视觉与图像

9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆

当自动驾驶世界模型还在像素级预测的"精细"与潜变量预测的"鲁棒"之间二选一时,比亚迪团队直接端出了一盘"混合大餐"——HyWorldVLA。预训练阶段同时预测像素和潜变量,既保住了细粒度时空建模,又继承了潜变量的抗噪能力。NAVSIM v1/v2双榜夺冠不是最惊艳的,雨雾场景下PDMS高达86.87(竞品仅60+)才真正让人眼前一亮。一句话:不做选择,全都要

9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆
原论文信息如下:
论文标题:
HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving
发表日期:
2026年07月
发表单位:
比亚迪股份有限公司(BYD Company Limited)
原文链接:
https://arxiv.org/pdf/2607.20988v1.pdf

自动驾驶世界模型的困局:像素 vs 潜变量,如何兼得?

想象一下,你正在训练一个自动驾驶模型,让它学会预测“下一秒路上会发生什么”。这就好比给车装上了一个“预知未来”的能力。在真实的驾驶环境中,车辆需要根据当前观测到的场景(摄像头画面、激光雷达点云等)和驾驶指令,推断出接下来几秒钟内可能发生的交通状况变化,并据此规划出安全合理的行驶轨迹。这种对未来动态的建模能力,正是自动驾驶世界模型(World Model)的核心任务。
目前,业界主要有两条技术路线来解决这个问题,但都像“鱼与熊掌”,难以兼得。 第一种是像素级(Pixel-based)世界模型。它的方法是把未来的每一帧画面都精确地预测出来。就像是一位超级精密的画家,要把未来场景的每一片树叶、每一缕光线都画下来。这种方法的优点是,它拥有极其丰富的细节,能帮助车辆像人类老司机一样,透过复杂交互和遮挡场景,理解物理世界的因果关系。例如,通过预测行人即将横穿马路的像素变化,模型可以提前预判风险。但它最大的“命门”是:极度脆弱。一旦遇到下雨、起雾、光照突变等“闹心事”,预测出的画面就会失真,导致驾驶决策跟着胡乱摇摆。就像画家眼睛进了沙子,画出来的东西自然就歪了。这种对输入噪声的敏感性,使得像素级模型在真实部署中面临严峻挑战。 第二种是潜变量(Latent-based)世界模型。它学聪明了,不去浪费时间预测每一个像素点,而是在一个“压缩特征空间”里进行抽象预测。这就像一个素描大师,只抓取场景中最核心的线条和轮廓,忽略掉雨水、雾气等细节噪音。因此它对环境变化非常鲁棒。但问题也随之而来:由于丢弃了像素级的精细信息,它在处理复杂场景时,常常会丢失关键的物理细节,导致场景理解能力受限,决策精度大打折扣。例如,它可能无法准确区分一辆静止的车辆和一辆正在缓慢移动的车辆,因为两者在潜变量空间中的特征可能非常接近。
图1:世界模型范式对比。(a) 像素级世界模型:迭代预测动作和图像,容易受场景噪声影响;(b) 潜变量世界模型:预测潜变量状态,时空动态建模能力弱;(c) 混合世界模型:本方法同时建模迭代的动作-图像预测和未来的潜变量状态预测。
图1:世界模型范式对比。(a) 像素级世界模型:迭代预测动作和图像,容易受场景噪声影响;(b) 潜变量世界模型:预测潜变量状态,时空动态建模能力弱;(c) 混合世界模型:本方法同时建模迭代的动作-图像预测和未来的潜变量状态预测。
龙哥解读:简单来说,像素级模型是“精准但敏感”,潜变量模型是“粗糙但皮实”。整个自动驾驶社区都在纠结:到底能不能把这俩的优点结合起来,造出一个“既有高清画质、又不怕风吹雨打”的理想模型?这种纠结并非没有道理,因为两种范式在数学上存在天然的张力:像素级预测要求模型保留所有高频细节,而潜变量预测则鼓励模型丢弃这些细节以换取鲁棒性。如何调和这一矛盾,成为世界模型研究的核心难题。 比亚迪HyWorldVLA论文,直接给出了答案。

HyWorldVLA:混合世界建模,精度与鲁棒性两手抓

HyWorldVLA的核心思想,用一个字概括就是:“”。它不像以前的工作那样“非黑即白”,而是提出了一种“混合世界建模”范式。这种范式的核心洞察在于:像素级预测和潜变量预测并非互斥,而是可以在不同的训练阶段和推理阶段中协同工作,各自发挥优势。 这个“端水大师”是怎么炼成的呢?它的策略是分阶段干活。具体来说,HyWorldVLA将训练过程拆解为三个清晰的阶段:首先是训练一个文本引导的视频VAE,为后续的潜变量预测提供高质量的压缩表示;然后是在预训练阶段同时进行像素级和潜变量级的双监督学习;最后在微调阶段,模型专注于潜变量预测,并将其与动作专家模块结合,生成最终的驾驶轨迹。
第一阶段(预训练):这是一个“双监督”学习阶段。模型既要学会预测未来的VAE(Variational Autoencoder,变分自编码器)潜变量特征,也要同时学会重构精确的未来像素帧。这就像让学生既要看懂抽象的逻辑符号(潜变量),又要能画出逼真的图画(像素)。像素级的重构就像一位严格的老师,不断纠正潜变量学习的偏差,防止模型学“劈叉”了。这种双监督机制确保了潜变量空间不仅保留了鲁棒性,还继承了像素级预测所必需的精细时空结构信息。 第二阶段(联合微调):经过第一阶段的基础夯实后,就可以“抄近路”了。此时,模型不再需要费力去重构像素,而是纯粹预测VAE潜变量特征。这个“速写版”的预测结果,会被送入一个专门的“动作专家”模块,来直接生成驾驶轨迹(一系列未来坐标点)。这种设计使得推理阶段的计算效率大幅提升,因为潜变量预测的计算量远小于像素级预测。
图2:HyWorldVLA 概述。HyWorldVLA 包含三个训练阶段。首先,在文本引导下训练视频 VAE 模型,对视频帧进行压缩和重构,从而为后续训练提供真值目标。在预训练阶段,由文本、图像和动作组成的序列被用于训练世界模型进行迭代预测,其中引入一个可学习的潜变量查询 Q 来聚合信息并预测未来的潜变量。在联合微调阶段,历史序列与 Q 一起被输入到VLM中以获取全局上下文和预测的潜变量,然后通过联合注意力机制传递给动作专家以生成动作。
图2:HyWorldVLA 概述。
这种设计的精妙之处在于:它完美利用了VAE潜变量空间的天生优势——鲁棒性。VAE(变分自编码器)在压缩视频帧时,会自然而然地抛弃掉那些不重要的场景噪声(比如雨点、雾气、光照变化),只保留最核心的语义和几何结构。因此,基于潜变量的预测天然就对噪声不敏感。同时,又因为模型的“基本功”(像素重构)是在预训练阶段打下的,所以它不会丢失掉那些对决策至关重要的物理细节。例如,一个行人的轮廓、一辆车的相对位置等关键信息,在像素重构的监督下被牢牢地编码进了潜变量空间中。 这就像一个既学过高清摄影(像素级),又学过抽象艺术(潜变量)的画家。在需要快速创作时,他直接画素描(潜变量预测),而且因为素描功底扎实,画出来的东西不仅形神兼备,还不会因为天气不好而手抖画歪。更重要的是,这种混合范式在数学上也是自洽的:预训练阶段的双监督损失函数确保了潜变量空间同时优化了重构精度和预测鲁棒性,从而在两者之间找到了一个最优的平衡点。

三大训练阶段揭秘:双监督预训练 + 潜变量联合微调


阶段一:文本引导的潜特征学习(VideoVAE训练)

HyWorldVLA的第一步,是训练一个高效压缩引擎——视频VAE。它的任务是把一段视频“压缩”成一个小得多但包含了核心信息的潜变量特征`z2`。这个压缩过程是“有损”的,目的是去除帧间的冗余静态信息。比如,背景楼房在前后几帧里几乎一样,这种信息就会被压缩掉,保留的是运动的车辆、行人等动态元素。具体来说,视频VAE的编码器将输入的视频帧序列(例如连续4帧)映射到一个低维的潜变量空间,而解码器则负责从这个潜变量中重建出原始视频帧。压缩比通常很高,例如将256x256的图像压缩到32x32的潜变量网格,每个网格点对应一个高维特征向量。 为了让压缩过程不丢失语义,论文巧妙地加入了文本引导。在编码器的每个模块里,都嵌入了文本交叉注意力(Text Cross-Attention),用来自Flan-T5的文本描述(比如“一辆红色汽车正在右转”)作为指引,帮助模型更好地理解什么是“重要”的信息。这种文本引导机制使得VAE在压缩时能够优先保留与驾驶任务相关的语义信息,例如交通标志、车辆类型和行人姿态,而忽略那些与任务无关的纹理细节。这能有效消除重影、边缘模糊等现象,极大提升对复杂交通场景的重建质量。 这个VAE通过多组件损失函数进行优化,主要包括重建损失`L_rec`(例如L1损失或感知损失)、对抗损失`L_GAN`(使用一个判别器来区分真实帧和重建帧,以提升视觉质量),以及KL散度正则化损失`L_KL`(约束潜变量分布接近标准正态分布,防止过拟合)。这三个损失函数共同作用,使得VAE既能精确重建,又能生成平滑且语义丰富的潜变量表示。

阶段二:双监督预训练

这是整个HyWorldVLA最核心的环节。在这个阶段,模型使用一个统一的VLM(Vision-Language Model,视觉语言模型)主干网络(基于Emu3)来同时预测未来的多模态信息。Emu3是一个强大的多模态预训练模型,能够处理文本、图像和视频等多种输入,并生成相应的输出。HyWorldVLA将其作为世界模型的主干,利用其强大的序列建模能力来捕捉驾驶场景中的时空依赖关系。 为了把图像、视频、动作和文本统一到一个序列里,论文采用了几个“离散化”技巧: - 视觉建模:基于VQGAN(Vector Quantized Generative Adversarial Network,向量量化生成对抗网络)将连续视频帧转化为离散的视觉`token`。VQGAN通过一个码本(codebook)将连续的图像特征映射到最接近的离散索引,从而将图像表示为一串整数序列。 - 动作建模:基于FAST(Fast Autoregressive Style Transfer,这里指一种动作离散化方法,原文引用自Pertsch等人)将连续的轨迹坐标转化为离散的动作`token`。这种方法将连续的轨迹(例如一系列(x, y)坐标)通过向量量化转换为离散的token序列,使得动作信息可以像文本一样被VLM处理。 - 语言建模:基于Emu3的`tokenizer`将驾驶指令转化为语言`token`。驾驶指令如“前方路口右转”被分词器转换为整数序列。 这些`token`被打包成一个长序列,例如:[语言token_1, ..., 语言token_N, 视觉token_1, ..., 视觉token_M, 动作token_1, ..., 动作token_K]。最关键的创新点在于,论文在序列中插入了一个可学习的潜变量查询`Q`。这个`Q`就像是一个“潜变量探测器”,它在序列中的隐藏状态会被一个`MLP`(多层感知机)解码器拿去预测未来的VAE潜变量特征`z2`。`Q`的位置被精心设计,使其能够聚合来自历史视觉和动作信息,从而预测未来时刻的潜变量。 整个预训练过程的损失函数包含四项: 1. 语言`token`预测损失(交叉熵损失) 2. 动作`token`预测损失(交叉熵损失) 3. 视觉`token`预测损失(交叉熵损失,权重为λ1) 4. 未来潜变量特征预测损失(例如L2损失,权重为λ2) 通过这种设计,模型在预测未来像素(精细建模)和预测未来潜变量(抗噪建模)之间找到了一个最佳平衡点。λ1和λ2是超参数,用于调节两种监督信号的相对重要性。论文通过实验发现,当λ1和λ2取值适当时,模型能够同时获得像素级预测的细节和潜变量预测的鲁棒性。

阶段三:联合微调(Co-fine-tuning)

经过预训练“喂饱”的VLM主干已经具备了优秀的潜变量预测能力。在微调阶段,论文不再进行像素级预测,而是让它只专注于预测潜特征。这些预测出的潜特征(来自`Q`的输出)与历史信息(历史轨迹、驾驶指令等)一起,被送入一个动作专家(Action Expert)模块。这个模块的设计目标是:将世界模型预测的未来状态信息,高效地转化为具体的驾驶动作。 这个动作专家通过一个联合注意力机制(Joint Attention Mechanism)与VLM主干进行交互。它接收来自VLM所有层的上下文信息以及预测的潜特征,最终通过一个`MLP`解码出连续的驾驶轨迹(即未来的坐标点)。联合注意力机制允许动作专家模块同时关注历史观测和未来预测,从而做出更明智的决策。例如,它可以根据预测的未来车辆位置,调整当前的方向盘转角。 为了验证方法的普适性,论文在动作专家模块中成功搭载了两种主流的轨迹动作生成范式:基于选择的方法(Selection-based)(如Hydra-MDP的轨迹打分方法)和基于生成模型的方法(Generative-model-based)(如流匹配Flow Matching方法),证明了其优秀的跨范式兼容性。基于选择的方法会预先生成一组候选轨迹,然后根据预测的潜变量和历史信息为每个轨迹打分,选择得分最高的轨迹。而基于生成模型的方法则直接学习从条件分布中采样出最优轨迹。 微调阶段的损失函数包括两项:基于流匹配的向量场回归损失(用于优化轨迹生成),以及潜变量预测损失(权重为λ3,用于保持世界模型的预测能力)。λ3的存在确保了在微调过程中,模型不会忘记预训练阶段学到的世界模型知识。

SOTA结果一览:NAVSIM v1/v2双榜夺冠

纸上谈兵终觉浅。HyWorldVLA在业界公认的NAVSIM v1和v2基准测试上,用数据狠狠地证明了自己的实力。NAVSIM是一个基于高保真仿真器的自动驾驶规划基准,它提供了标准化的场景和评估指标,被广泛用于衡量自动驾驶规划算法的性能。v1版本侧重于基本的驾驶能力,而v2版本则引入了更复杂的交互场景和更严格的评估指标。
在NAVSIM v1上,HyWorldVLA以90.59的PDMS(Predictive Driver Model Score,预测驾驶模型得分)打败所有对手,包括那些使用环视摄像头甚至激光雷达的“全副武装”选手。PDMS是一个综合评分,它同时考虑了驾驶的安全性、舒适性和效率。相比之下,当前最强的像素级世界模型DriveVLA-W0得分是90.2,纯潜变量世界模型则更低。这意味着HyWorldVLA用更少的传感器(仅一个前视摄像头),就取得了更好的效果。这一结果有力地证明了混合世界建模范式的有效性:它能够从有限的感知输入中提取出足够丰富的信息,以支持高水平的驾驶决策。 在更复杂的NAVSIM v2上,成绩同样亮眼。HyWorldVLA的EPDMS(Extended Predictive Driver Model Score,扩展预测驾驶模型得分)达到了89.71,大幅领先于其他方法,包括表现优异的ExploreVLA(88.8)和DriveWorld-VLA(86.8)。EPDMS在PDMS的基础上增加了对预测轨迹与真实轨迹一致性的评估,因此更能反映模型在复杂动态场景中的规划能力。HyWorldVLA在v2上的领先优势,进一步凸显了其在处理复杂交互和长尾场景方面的卓越能力。
表1:在NAVSIM v1上与当前最优方法的对比。缩写:1x Cam(单前视摄像头),Nx Cam(环视摄像头),L(激光雷达)。
表1:在NAVSIM v1上与当前最优方法的对比。缩写:1x Cam(单前视摄像头),Nx Cam(环视摄像头),L(激光雷达)。
表2:在NAVSIM v2上与当前最优方法的对比(包含扩展指标)。
表2:在NAVSIM v2上与当前最优方法的对比(包含扩展指标)。

消融实验分析:每个部件都不可或缺

为了搞清楚到底是哪个模块起了作用,论文做了详尽的消融实验,结果如下:
表3:在NAVSIM基准上的消融研究。
表3:在NAVSIM基准上的消融研究。
- 去掉像素重构能力(纯潜变量模型):PDMS直接下降到87.50,这证明了像素级预测这个“精细活”对于理解环境、生成精确动作至关重要。没有像素重构的监督,潜变量空间可能会丢失一些关键的几何细节,导致模型在需要精确控制的场景中表现不佳。 - 去掉潜变量抽象能力(纯像素模型):得分也跌到了89.91,证明潜变量预测确实能学到更高层次的语义,对提升性能有正面作用。纯像素模型虽然细节丰富,但容易受到噪声干扰,且计算成本更高。 - 去掉文本引导:得分降至90.35,说明文本信息能有效引导模型关注规划相关的语义。文本引导帮助VAE在压缩时保留与驾驶指令相关的关键信息,从而提升了后续世界模型预测的准确性。 - 去掉动作专家中的潜变量条件:得分降至90.29,说明将预测的未来信息显式地引入动作生成是有效的。如果动作专家只依赖历史信息,而无法利用世界模型预测的未来状态,其决策的预见性就会降低。 - 微调阶段去掉潜变量监督:得分降至90.17,说明在微调阶段继续保留潜变量预测损失,可以防止模型“过拟合”而导致语义退化。微调阶段如果只优化动作生成,世界模型的预测能力可能会逐渐减弱,从而影响长期规划的性能。 这些实验清晰地表明,HyWorldVLA的成功是“混合范式”中每一个部件的有机组合,而不是简单的拼凑。每一个组件——从文本引导的VAE,到双监督预训练,再到联合微调中的潜变量条件——都在最终的性能中扮演了不可或缺的角色。

噪声下的王者:雨雾场景依然稳健

前面提到,像素级模型的最大痛点是场景噪声。那么,HyWorldVLA在“坏天气”里的表现到底如何?论文专门构建了一个包含655个雨雾、光照不均等噪声场景的测试集,结果令人惊叹。这个测试集模拟了真实世界中常见的恶劣天气和光照条件,例如大雨、浓雾、强光直射和夜间低照度等,旨在评估模型在非理想条件下的鲁棒性。
如下图所示,在光照剧烈变化的情况下,即使是强如DriveVLA-W0的像素级模型,其行为也出现了巨大的摇摆(从右转变成了直行)。而HyWorldVLA无论光照怎么变,都能保持稳健的驾驶行为,轨迹几乎不变。在雨雾等大规模噪声干扰下,HyWorldVLA依然能做出正确的驾驶决策,而对比模型则要么表现得过于保守(龟速前进,影响交通效率),要么直接决策错误。这种鲁棒性来源于HyWorldVLA的潜变量预测机制:VAE在压缩输入帧时,已经自动过滤掉了雨滴、雾气等噪声,使得世界模型能够在“干净”的潜变量空间中进行预测,从而避免了噪声对决策的干扰。
图3:混合世界建模提升了对场景噪声的鲁棒性。(a) DriveVLA-W0在光照变化下表现出严重的行为差异,而本文方法则保持了显著的一致性。(b) DriveVLA-W0表现出过于保守的行为,牺牲了通行效率,而本文方法则能保持与人类驾驶一致的准确轨迹。
图3:混合世界建模提升了对场景噪声的鲁棒性。

数据说话:噪声测试集上的绝对碾压

表6是“噪声鲁棒性”的终极PK。数字是冷冰冰的,但也是最有力的。
表6:在NAVSIM基准上与其他方法的场景噪声鲁棒性对比。
表6:在NAVSIM基准上与其他方法的场景噪声鲁棒性对比。
- HyWorldVLA的PDMS高达86.87。 - 强大的像素级模型DriveVLA-W0:得分只有61.18,接近腰斩! - 驱动能力同样出色的DriveLaW:得分也只有67.49。 这个差距是极其夸张的。在正常的干净场景下,它们打得难分难解(PDMS都在90上下),但一遇到“脏活累活”,HyWorldVLA的混合范式的抗噪优势就被完全放大。这恰恰证明了论文的核心论点:纯像素级预测的脆弱性,在真实应用中是不可接受的;而混合范式是目前看来最有效的解决方案。这种鲁棒性的提升,对于自动驾驶的商业化落地至关重要,因为它直接关系到车辆在恶劣天气下的安全性和可靠性。 (忍不住放一个表情包)

总结:混合范式的潜力与未来方向

HyWorldVLA提出了一个简洁但极具差异化的思想:用像素级预训练打底,用潜变量预测进行推理,从而在精度和鲁棒性之间取得最佳平衡。它用一个前视摄像头在NAVSIM v1/v2上取得了双料冠军,并在噪声场景下展现出了碾压级的鲁棒性优势,完美解决了行业内长期存在的“像素vs潜变量”的困局。 龙哥认为,这个工作的意义不仅仅是刷了个榜,更重要的是为后续的自动驾驶世界模型研究指明了一个非常有前景的方向:不要试图在“精细”和“鲁棒”之间二选一,而是通过巧妙的多阶段训练,让模型同时拥有这两者。这种混合范式为未来研究开辟了多条道路,例如探索更高效的潜变量压缩方法、将混合范式扩展到多传感器融合场景,以及将其与因果推理相结合以处理更复杂的交互。 当然,论文也坦诚地指出了HyWorldVLA的局限性。例如,它有时会无法识别细小但关键的视觉线索(如刹车灯亮起的车辆在排队等红灯),导致误判;同时,在需要转弯时,单前视摄像头视野受限的缺陷也暴露无遗,可能导致压线或追尾。这表明,多模态融合的精细感知与因果推理,依然是未来自动驾驶研究皇冠上的明珠。未来的工作可以探索如何将HyWorldVLA与环视摄像头或激光雷达结合,以克服单目视觉的局限性,并进一步提升对小目标和长尾场景的感知能力。 图8:失败案例分析:捕捉关键小元素的缺陷。
图8:失败案例分析:捕捉关键小元素的缺陷。模型误将排队等待的车辆判断为慢速移动,并试图加塞,未能识别出前方红灯和刹车灯提示的排队等待状态。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

什么是VLA模型?VLA代表Vision-Language-Action(视觉-语言-动作)。它是一种端到端的自动驾驶范式,将摄像头的视觉输入、对人类语言指令的理解(如“前方右转”)和底层控制动作的输出统一在一个深度学习模型中进行学习。简单说,就是让车“看到、听懂、然后自己开”。VLA模型的核心优势在于其简洁性和可扩展性,它通过一个统一的框架处理多模态信息,避免了传统模块化方法中信息传递的损失。

文中反复提到的VAE和潜变量是什么?VAE是Variational Autoencoder(变分自编码器)的缩写。它是一种生成模型,其核心思想是学习如何将输入数据(比如一段视频)压缩成一个小而精的“特征码”,这个“特征码”就叫“潜变量”(Latent)。这个潜变量捕获了输入数据中最核心、最本质的语义和结构信息,同时会自动过滤掉冗余或随机的细节噪声。HyWorldVLA巧妙地利用了VAE的这个特性,让模型在潜变量空间里做预测,从而获得对噪声的鲁棒性。可以这样理解:VAE就像是一个智能的“信息蒸馏器”,它从海量的像素数据中提取出最精华的部分,而丢弃掉那些无关紧要的“水分”。

“像素级”和“潜变量级”世界模型的主要区别,能用一个比喻说明吗?可以。像素级世界模型就像是学画画时要求你临摹一模一样的照片,优点是画得非常像,栩栩如生。但缺点也很明显,照片上如果有污渍或噪点,你画出来的画也会跟着带污渍,而且画得巨慢。潜变量级世界模型则像是学习画漫画/速写,不需要画出每根头发丝,只需要提取出人物的神韵和关键轮廓。画的线条很简洁,很快,即使模特脸上有点水渍,也完全不影响画作。但缺点是,过于抽象的话,可能会丢失一些比如“衣服的纹理”这种细节信息。HyWorldVLA的混合范式,则相当于先通过临摹照片(像素级预训练)打下了扎实的造型基础,然后再用漫画速写(潜变量预测)的方式进行快速创作,因此既能保证形似,又能抵抗干扰。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次提出“混合世界建模”范式,非常直接地解决了像素级和潜变量级预测的根本矛盾,思想简洁有效,极具启发性。

实验合理度:★★★★✰

实验设计非常全面,包括主流SOTA对比、详尽的消融实验、专门的噪声测试集和定性展示。结果令人信服。

学术研究价值:★★★★★

该工作打破了传统范式的思维定势,为自动驾驶世界模型提供了全新的混合范式设计思路,研究价值极高。

稳定性:★★★★✰

在正常场景下表现稳定,在噪声场景下鲁棒性极强。但论文中提到的失败案例分析表明,对于小目标、细颗粒度信息的感知还有进步空间。

适应性以及泛化能力:★★★★✰

在NAVSIM基准测试上表现出色,且能兼容不同的动作专家机制,证明泛化能力不错。但如果换一个完全不同的场景(如港口、矿山),表现还需进一步验证。

硬件需求及成本:★★★✰✰

论文使用了强大的PPU集群(阿里云PPU),训练成本高昂。但推理时仅使用一个前视摄像头,且模型不是循环预测像素,效率理论上优于像素级模型。不过,具体落地对车端计算平台的算力要求仍是一个挑战。

复现难度:★★✰✰✰

论文提到了基于Emu3、VQGAN、Flan-T5等复杂模型,且训练策略涉及双阶段和多损失函数,复现门槛非常高。

产品化成熟度:★★★✰✰

该工作展示了强大的潜力,但论文坦诚指出的“小目标感知模糊”和“视野受限导致转弯问题”是通往产品级解决方案前必须解决的关键问题。

可能的问题:主要基于仿真环境NAVSIM进行评估,其在真实极端Corner Case下的表现尚待验证。另外,引入的多个训练阶段和复杂损失函数调优,对团队的工程能力要求极高。


主要参考文献

[1] Yu Q, Wu X, Xu H, et al. HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving. arXiv preprint arXiv:2607.20988, 2026.
[2] Rombach R, et al. High-resolution image synthesis with latent diffusion models. CVPR, 2022. (用于介绍Stable Diffusion图像VAE)
[3] Li Q, et al. DriveVLA-W0: A Vision-Language-Action Model for Autonomous Driving with World Modeling. ICLR, 2026. (作为像素级世界模型的主要对比基线)
[4] Wang Z, et al. Latent-WAM: Latent World Action Model for Autonomous Driving. 2026. (作为潜变量级世界模型的主要对比基线)
[5] 论文原链接: https://arxiv.org/pdf/2607.20988v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
还在纠结自动驾驶世界模型选像素还是潜变量?HyWorldVLA给出第三种答案:全都要!加入龙哥读论文粉丝群,和行业高手一起探讨端到端自动驾驶的最新进展。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:自动驾驶+地点+学校/公司+昵称,更快通过哦!目前包含自动驾驶、大模型、AI医疗等5个群,等你来聊!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。