世界模型的新玩法:视频生成只当训练老师,推理时直接扔掉
*表格超出部分左右可以滑动
Table 1: Comparison with state-of-the-art planners on the NAVSIM navtest benchmark. C denotes camera and L denotes LiDAR. The best learned result in each column is shown in bold.
隔离注意力掩码:如何让动作预测与未来帧彻底解耦
强化学习加持:从模仿到超越,PDMS提升1.2个点
灵活架构:视频专家随便换,动作专家随便扩
实验结果全面解读:91.5 PDMS登顶NAVSIM,零样本迁移nuScenes
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出SimWAM,将视频生成仅作为训练信号,通过隔离注意力掩码解耦动作专家与视频分支,训练后丢弃视频分支,仅保留轻量动作专家直接预测轨迹,并利用强化学习优化驾驶奖励。实验合理度:★★★★☆
PDMS(预测驾驶模型分数),包含NC、DAC、EP、TTC、C五个子指标;nuScenes上使用L2误差和碰撞率学术研究价值:★★★★☆
提出SimWAM,将视频生成仅作为训练信号,通过隔离注意力掩码解耦动作专家与视频分支,训练后丢弃视频分支,仅保留轻量动作专家直接预测轨迹,并利用强化学习优化驾驶奖励;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
推理延迟约518ms(A100 GPU,10步采样),视频分支在推理时完全移除复现难度:★★★☆☆
https://github.com/H-EmbodVis/SimWAM/产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:1)仅使用前视相机,未利用多视角信息;2)视频生成质量对性能有影响,轻量视频模型效果下降明显;3)RL训练需要额外的采样和奖励计算开销。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
视频老师傅带出来的驾驶小徒弟,上车后居然不用带老师傅😏 想和龙哥一起追踪这类又省又强的自动驾驶新范式?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+北京+华中科大+龙哥),根据格式备注,可更快被通过且邀请进群。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!