← 返回 PaperDaily 视觉与图像

自动驾驶行人预测新作:17.23ms跑出SOTA

自动驾驶最怕的不是“看不见”,而是“看见一堆却不知道信谁”。这篇 ADAPT 直接把多模态融合里的噪声问题摊开解决,稀疏注意力、动态路由、Mamba 三件套一起上,既准又快,工程味很足。

自动驾驶行人预测新作:17.23ms跑出SOTA
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
自动驾驶最怕的不是“看不见”,而是“看见一堆却不知道信谁”。这篇 ADAPT 直接把多模态融合里的噪声问题摊开解决,稀疏注意力、动态路由、Mamba 三件套一起上,既准又快,工程味很足。


原论文信息如下:
论文标题:
Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction
发表日期:
2026年07月
发表单位:
重庆大学;Daffodil International University;Multimedia University
原文链接:
https://arxiv.org/pdf/2607.12293v1.pdf
开源代码链接:
https://github.com/imamahasane/ADAPT
项目链接:
https://github.com/imamahasane/ADAPT
自动驾驶里最难的,不是“看见行人”,而是“看见之后,知道他下一秒会不会往前走”。这件事听起来像一句简单的人类直觉,落到机器上却很要命:光看图像不够,看速度也不够,姿态、边界框、语义地图、深度图都得一起上;更麻烦的是,多模态一多,信息不是越多越好,往往是越多越吵。
图1:ADAPT整体框架示意图。模型同时处理四种空间对齐的视觉模态和三种运动信号,再通过视觉编码、跨模态引导注意力、稀疏跨模态注意力和时间特征融合,预测行人是否会在未来1—2秒内过街。
这篇工作给出的答案很直接:不是把所有模态“平均对待”,而是让模型学会挑重点、少废话、快决策。它的名字叫 ADAPT,中文可以理解成“自适应域感知行人过街 Transformer”。名字有点长,但思路很朴素:先把视觉和运动信息各自处理好,再用稀疏注意力把真正有用的跨模态关系留下,把噪声交互删掉。

行人过街意图预测新突破: ADAPT模型如何精准预判下一步

先把问题说人话:行人过街意图预测,就是让车在行人还没迈出那一步之前,提前判断“他会不会过马路”。这不是炫技,是真正关乎安全。因为自动驾驶最怕的不是撞上“已经在路中间的人”,而是对“准备迈步的人”反应慢半拍。
ADAPT 的关键观察是:行人是否过街,不只看行人本人,还得看车、路、深度、语义环境和时间变化。于是它把输入做成了一个很“豪华但不乱”的组合:RGB 图像、局部深度图、全局语义分割图、全局深度图,再加上本车速度、行人边界框、骨骼姿态。简单说,就是既看“人长什么样”,也看“他在哪里、怎么动、车怎么开、周围是什么场景”。
图2:ADAPT的整体架构。视觉分支先提取四种图像模态的空间特征,运动分支编码速度、边界框和姿态序列,随后通过稀疏跨模态注意力进行融合,最后由时间特征融合模块输出过街概率。
论文里还有两个很实用的设定:一是只观察16 帧,也就是短时间窗口内做判断;二是预测目标是未来1—2 秒内是否过街。这个时间尺度很重要,太短没意义,太长又容易失真。自动驾驶要的是“来得及刹车”,不是“事后诸葛亮”。

多模态融合的困局: 现有方法为什么总是一片死寂的信息洪流?

多模态方法看起来很美,现实里却经常翻车。原因很简单:模态一多,模型就容易“谁都想听,谁都没听进去”。有些方法把每种模态都单独编码,再在最后粗暴拼接;有些方法用 dense attention(密集注意力)把所有模态两两交互,结果把有用信息和无用信息一起搅成了浆糊。尤其在交通场景里,某些模态在某个样本里很关键,在另一个样本里却可能只是噪声。
ADAPT 的批判点非常明确:不是模态越全越好,而是模态之间的交互要足够克制。比如,行人附近的局部深度和 RGB 更适合描述“这个人现在的状态”,全局语义图和全局深度更适合描述“周围交通环境是否允许他过街”。如果把这些信息一锅炖,模型会学到很多“看似相关、其实没用”的关联。
更现实的问题是效率。很多跨模态 Transformer 的交互复杂度是二次方,模态一多、时间一长,推理就开始变慢。自动驾驶不是实验室里的静态图片分类,车上跑得慢一点,可能就不是“精度掉一点”,而是“反应晚一点”。所以 ADAPT 不只追求准,还追求快。

核心解密: 稀疏注意力与自适应门控如何“拨云见日”?

ADAPT 的方法可以拆成五步,但核心其实是三件事:视觉先分层、运动单独建模、跨模态只保留最有信息量的连接
先说视觉分支。四种图像模态先经过一个共享权重的 Swin Transformer V2 Tiny 骨干网络。这里的 Swin Transformer V2 Tiny 可以理解成一个“轻量但会看局部和全局关系”的视觉特征提取器。共享权重的好处很直接:同样的骨干去看不同模态,参数更省,训练更稳,也更容易学到跨模态一致的空间模式。
接着是 CMGA,也就是 Cross-Modality Guided Attention,跨模态引导注意力。它先把局部视觉流和全局视觉流分开处理,再在每个流内部做通道注意力和空间注意力,最后通过一个可学习的路由门决定“这张样本更该信局部还是信全局”。这一步很像开车时的经验判断:近处行人动作更重要,还是远处路口语义更重要,得看现场情况,不能死板。
图1再次展示了 CMGA 的位置:它不是简单拼接,而是先把局部和全局视觉信息“分清楚、看明白”,再做自适应融合。这个设计的本质,是让模型别把所有视觉线索都当成同一回事。
运动分支则使用了 Mamba 状态空间模型。这里的 Mamba 是一种状态空间模型(State Space Model, SSM),英文全称是 Mamba State Space Model,中文可理解为“选择性状态空间模型”。它的优势在于能用线性复杂度建模长序列依赖,不像传统 Transformer 那样随着序列长度增长,注意力计算越来越贵。对行人意图预测来说,速度变化、边界框移动、姿态变化这些信号本来就是时间序列,用 Mamba 来吃这口饭,算是比较对路。
真正有意思的是 SCMA,也就是 Sparse Cross-Modal Attention,稀疏跨模态注意力。它不是让所有模态两两互看,而是先算出模态间的注意力分数,再只保留 top-k 个最强连接。论文里 k=2,意思是每个查询模态只看最有价值的两个伙伴,其他交互直接屏蔽掉。这个做法很像开会:不是每个人都必须发言,真正有用的意见留下,跑题的自动静音。
图2里的 SCMA 是整篇论文最“狠”的地方。它不是追求更多注意力,而是追求更少但更准的注意力。这个思路很反常识,但很工程:少算一些,反而更稳、更快,还能减少模态之间的互相污染。
最后是 TFF,也就是 Temporal Feature Fusion,时间特征融合。它用一个类似 ViT 的编码器,把 16 帧的跨模态表示再做一次时间聚合,输出最终的过街概率。这里的 CLS token 就是一个“全局总结位”,最后拿它去做二分类。到这一步,模型才真正完成从“看见一堆信息”到“给出一个判断”的过程。
从训练策略看,ADAPT 也挺讲究。它不是一上来就把所有模块一起猛训,而是采用三阶段渐进式微调:先冻结视觉骨干,让融合模块先学会怎么工作;再逐步解冻后层;最后全量微调并降低学习率。这个套路的好处是减少大骨干在小数据集上乱飘,尤其适合 JAAD 和 PIE 这种标注并不算巨大的场景。

性能与速度双丰收: 在JAAD与PIE数据集上的“碾压级”表现

先看结论:ADAPT 不是那种“只会刷分不管速度”的模型。它在 JAAD 和 PIE 上都拿到了当前很强的结果,而且推理延迟只有 17.23 毫秒/样本,和一些结构相近的方法相比,速度能快 2—4 倍。对自动驾驶来说,这个数字不是装饰品,是能不能上车的门槛之一。
表1:ADAPT在 JAADbeh 和 JAADall 上的定量结果。可以看到,它在准确率、AUC、F1、精确率和召回率上都处于最强一档,尤其是 AUC 和整体均衡性比较亮眼。
在 JAADbeh 上,ADAPT 的 AUC 达到 0.70,准确率 0.74;在 JAADall 上,AUC 进一步到 0.85,准确率 0.91。相比一些早期方法,提升不是“挤牙膏”,而是比较明确的跨档位进步。更重要的是,它没有只把某一个指标刷高,而是把 F1、Precision、Recall 一起拉起来,说明模型不是只会偏向某一类样本。
表2:ADAPT在 PIE 数据集上的结果。这里的表现同样稳,准确率 0.92,AUC 0.90,说明它在更复杂的连续驾驶场景里也能保持较强的判别能力。
PIE 的场景更丰富,驾驶速度、光照和交通状态变化更多。ADAPT 在这里拿到 0.92 的准确率和 0.90 的 AUC,说明它不是只会在某个数据集上“背题”,而是对跨场景的模式有一定泛化能力。虽然 F1 和召回率并不是所有指标都全面碾压,但整体已经足够说明:这套融合策略不是摆设。
图4:ADAPT在 PIE 上与其他方法的对比。无论看准确率还是 AUC,它都处在前列,说明稀疏跨模态融合并没有牺牲性能,反而把冗余交互压下去了。
图5:消融实验热力图。最关键的结论很清楚:去掉密集交互、去掉稀疏注意力、或者削弱跨模态融合,性能都会明显下滑,其中 SCMA 的影响尤其大。这说明它不是“锦上添花”,而是主干部件。
表4:计算开销对比。ADAPT 在保持较强精度的同时,参数量和推理成本更友好,说明它在工程部署上不是“实验室豪车”,而是有机会往量产边缘靠一靠的方案。
这里最值得肯定的是实验设计的完整性。作者不仅给了主结果,还给了消融和计算成本对比,这就让“为什么有效”这件事更可信。尤其是表4说明,ADAPT 的优势不是靠一味堆大模型堆出来的,而是靠结构设计和稀疏化策略换来的。

未来展望: 从“精准预测”到“场景理解”的下一程

ADAPT 这类方法的价值,不只在于把一个指标做高了,而在于它把一个老问题重新讲明白了:多模态融合不是堆信息,而是筛信息。这对自动驾驶、机器人感知、视频理解都很有启发。
不过它也不是没有边界。第一,模型依赖多种空间对齐模态,实际部署时如果深度、语义或姿态估计不稳定,性能可能会受影响。第二,稀疏注意力虽然更高效,但 top-k 的选择本身也是超参数,换场景后未必总是同一个 k 最优。第三,数据集规模和真实道路复杂度之间仍有差距,极端天气、遮挡、夜间、密集人群这些情况,仍然需要更强的鲁棒性验证。
如果把这项工作放到更大的行业语境里看,它其实在提醒一个很现实的方向:下一代感知模型,光比谁更大已经不够了,得比谁更会省着用信息。谁能把冗余交互砍掉、把关键线索保留下来,谁就更接近真正能上车的系统。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“多模态行人过街意图预测”里信息太多、噪声太多、推理太慢的问题。ADAPT 的思路不是把所有模态都拼起来,而是先分别编码,再用稀疏跨模态注意力只保留最有价值的交互,从而提高准确率和效率。

Mamba 和 Transformer 分别干什么?Mamba 负责编码速度、边界框和姿态这些运动序列,擅长长时序、线性复杂度;Transformer 主要负责最后的时间融合,把 16 帧的跨模态表示整合成一个最终判断。前者像“记住过程”,后者像“做总结”。

top-k 稀疏注意力为什么重要?因为不是每个模态之间的交互都有价值。top-k 只保留最强的两条连接,相当于给跨模态融合做“信息筛选”,既减少噪声,又降低计算量。对自动驾驶这种实时任务来说,这一步很关键。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

稀疏跨模态注意力 + 自适应门控 + Mamba 的组合不是凭空发明,但把它们放到行人过街意图预测里,确实把“怎么融合才不吵”讲清楚了。

实验合理度:★★★★☆

JAAD 和 PIE 双数据集验证,外加消融和计算成本对比,实验链条比较完整;如果能再补更多极端场景分析,会更硬。

学术研究价值:★★★★☆

它对多模态融合的“选择性注意”给了一个很清晰的样板,对后续交通理解、视频理解都有参考意义。

稳定性:★★★☆☆

结构设计偏稳,但依赖多种对齐模态,输入质量波动时鲁棒性还需要更多验证。

适应性以及泛化能力:★★★☆☆

跨数据集表现不错,但仍主要验证在两个经典基准上,离“全场景通吃”还有距离。

硬件需求及成本:★★★☆☆

比纯大 Transformer 友好,17.23ms/样本也说明效率不错;但多模态输入和视觉骨干仍然不算轻量。

复现难度:★★★★☆

代码已开源,框架依赖也写得比较清楚,复现门槛不算高;真正麻烦的是多模态数据预处理。

产品化成熟度:★★★☆☆

有工程落地潜力,适合做辅助预警模块;但要上车,还得补更多场景鲁棒性和失效边界测试。

可能的问题:方法思路扎实,但对多模态对齐质量依赖较强,极端场景与真实部署稳定性仍需进一步验证。


主要参考文献

Md Mahfuzur Rahman, Pengzhan Zhou, A. F. M. Abdun Noor, et al. Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction. arXiv:2607.12293v1, 2026.
项目与代码:https://github.com/imamahasane/ADAPT
原文链接:https://arxiv.org/pdf/2607.12293v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。