← 返回 PaperDaily 视觉与图像

MVPruner让多视角VLM提速4.97倍

多视角自动驾驶 VLM 的老毛病很现实:token 太多,推理就慢;token 剪太狠,车就容易“看走眼”。MVPruner 的关键不是硬砍,而是先看哪个视角更杂、再看哪个 token 更有任务相关性,思路比较像老司机先扫全景、再盯关键路口。

MVPruner让多视角VLM提速4.97倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
多视角自动驾驶 VLM 的老毛病很现实:token 太多,推理就慢;token 剪太狠,车就容易“看走眼”。MVPruner 的关键不是硬砍,而是先看哪个视角更杂、再看哪个 token 更有任务相关性,思路比较像老司机先扫全景、再盯关键路口。


原论文信息如下:
论文标题:
MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
发表日期:
2026年06月
发表单位:
长安大学;上海交通大学
原文链接:
https://arxiv.org/pdf/2606.27660v1.pdf

引出“多视角VLM推理慢”的问题

自动驾驶里的多视角视觉语言模型,听起来很高级,落地时却常常卡在一个很朴素的问题上:看得越全,算得越慢。前视、后视、左前、右前、左后、右后,一圈摄像头把环境包得严严实实,模型确实更容易“看清楚”,但视觉 token 也会像自助餐一样越堆越满,推理延迟跟着一路飙升。对自动驾驶来说,这不是“慢一点”的问题,而是“能不能及时刹车”的问题。
图1:移除三个不重要视角不会影响决策,但移除关键前视角会导致错误决策,说明不同视角的贡献并不一致。
图1:移除三个不重要视角不会影响决策,但移除关键前视角会导致错误决策,说明不同视角的贡献并不一致。
这篇论文的切入点很直接:别再把所有视角、所有 token 都当成同等重要。有些视角里信息密得像早高峰路口,有些视角里基本就是背景板;有些 token 只适合做全局铺垫,有些 token 则要在后面任务里“站出来说话”。MVPruner 要做的事情,就是把这种“谁更重要、什么时候更重要”变成一个在线可执行的剪枝策略,而不是靠拍脑袋统一砍掉。

揭秘“为什么多视角VLM剪枝不再‘一刀切’?”

传统 token 剪枝最省事的做法,就是给每个视角发同样的“减肥指标”,比如每个视角都砍掉 75%。问题在于,自动驾驶不是均匀分布的静态图片集,路口、红绿灯、前车、行人、盲区,信息密度完全不同。把前视和后视按同一标准处理,等于让“主视角”和“背景视角”一起接受同款裁员,结果往往不是更高效,而是更危险。
论文先指出了两个老问题。第一,很多方法只适合单视角场景,到了多视角输入时仍然“一视同仁”,忽略了不同视角的信息贡献差异。第二,很多剪枝策略只看单层、单次的 token 重要性,默认重要性是静态的,但多视角 VLM 的内部注意力其实会随着层数变化:浅层更像全景扫视,中层开始聚焦关键区域,深层则更偏向任务相关视角。换句话说,模型自己都在“换挡”,剪枝策略却还在用同一把尺子量到底,当然容易失真。🤨
这也解释了为什么论文没有继续堆一个“更强的静态打分器”,而是把重点放在动态视角重要性跨层信息需求上。简单说,先判断哪个视角信息更杂、更值得保留;再判断在当前推理阶段,哪些 token 真正和任务有关。这个思路比“统一砍一刀”更像真正的工程优化:先搞清楚哪里是主路,再决定哪条辅路可以让一让。

详解“MVPruner如何‘眼观六路,耳听八方’?”

MVPruner 的整体思路可以概括成一句话:前半程看“信息多不多”,后半程看“任务相关不相关”。这不是简单地把剪枝分成两次,而是把两个阶段的判断标准彻底分开,让剪枝行为跟着模型的推理节奏走。
图3:MVPruner整体框架。浅层根据视角内信息多样性分配预算并保留跨层持续有贡献的token,深层根据视角与指令文本的语义相似度分配预算并保留高跨模态注意力token。
图3:MVPruner整体框架。浅层根据视角内信息多样性分配预算并保留跨层持续有贡献的token,深层根据视角与指令文本的语义相似度分配预算并保留高跨模态注意力token。
图2:跨层行为观察。(a)任务相关视角识别准确率随层数变化;(b)文本到视觉注意力熵;(c)跨层注意力图可视化。
图2:跨层行为观察。(a)任务相关视角识别准确率随层数变化;(b)文本到视觉注意力熵;(c)跨层注意力图可视化。
图2其实是在给方法“找证据”。浅层时,模型对任务相关视角的识别还不稳定;层数加深后,识别准确率明显上升,注意力熵也逐渐下降,说明模型从“广撒网”转向“盯重点”。这就很适合做两阶段剪枝:浅层先保留信息多样性,深层再压缩到任务相关区域。要是反过来,一上来就按任务相关性猛砍,浅层还没建立起足够的全局语义,容易把后面需要的基础信息先删掉。

第一阶段:DRA,先看谁“信息更杂”

第一阶段叫 DRA,英文全称是 Diversity-aware Ratio Allocation,中文可以理解为“多样性感知的预算分配”。这里的“多样性”不是文艺说法,而是指一个视角内部 token 的差异度:如果同一视角里 token 彼此差别很大,说明它包含的信息更丰富,应该多留一些;如果 token 很相似,说明冗余更高,可以更大胆地压缩。
论文的做法很朴素:先计算同一视角内所有 token 两两之间的语义距离,再用每个 token 到其他 token 的最小距离来衡量它的“独特性”。独特性越高,说明这个 token 越不像“背景重复项”,越值得保留。随后把整个视角的独特性汇总成一个多样性分数,再按比例给不同视角分配保留预算。这个逻辑的好处是,预算不是平均发放,而是向信息更丰富的视角倾斜。比如前视角常常包含红绿灯、车道线、前车等关键线索,后视角可能更多只是跟车和环境背景,前者自然该拿更多“生存名额”。
这种设计的关键不是“按视角平均分”,而是先把视角当成不同的信息池,再决定池子里该留多少水。这一步解决的是“该从哪儿开始砍”的问题,而不是“砍多少 token”的机械问题。

第二阶段:IRA,开始盯住“任务相关”

到了深层,模型已经不需要再“广泛看热闹”,而是开始“精准找线索”。这时候第二阶段 IRA 就登场了,英文全称是 Instruction-aware Ratio Allocation,中文是“指令感知的预算分配”。这里的“指令”指的是文本问题或任务描述,比如“前方红灯会不会影响刹车”“后视镜里车辆是否在变道”等。
IRA 的核心是用文本与视觉 token 的注意力关系来估计每个视角的任务相关性。哪个视角和当前指令更贴近,哪个视角就拿更多预算。然后在这个视角内部,继续保留那些对文本注意力更高的 token。这样做的意义很直接:浅层先保证“场景别看漏”,深层再保证“问题别答偏”。
如果说 DRA 像是在给每个视角分“基础生活费”,那 IRA 就像是根据当天任务再发“专项补贴”。这套设计的妙处在于,它承认模型在不同深度里关注点不同,不再假设一个固定剪枝率能统治所有阶段。这个判断相当务实:自动驾驶里,模型真正需要的不是“平均聪明”,而是“在关键时刻别犯蠢”。

剖析“如何挑选‘既能独当一面,又能承前启后’的Token?”

如果只会“挑最重要的 token”,那还不够。因为有些 token 现在看起来不显眼,但它们可能是后面深层推理的铺垫。MVPruner 的第三个关键设计就是 CCTS,英文全称是 Cross-stage Contribution-aware Token Selection,中文可以叫“跨阶段贡献感知的 token 选择”
这个名字听着有点绕,但逻辑其实不复杂:一个 token 的价值,不只看它对当前层有没有帮助,还要看它能不能在后续层继续提供信息。论文把这个价值拆成两部分。第一部分是语义独特性,意思是这个 token 跟已保留 token 是否足够不一样;第二部分是任务相关性,意思是这个 token 跟文本指令有多贴近。两者相乘后,就得到一个“跨阶段贡献”分数。
图6:保留token的定量对比。更高更深的柱子表示更重要的视角,MVPruner在第一阶段为信息更丰富的视角分配更多token,在第二阶段为任务相关视角分配更多token。
图6:保留token的定量对比。更高更深的柱子表示更重要的视角,MVPruner在第一阶段为信息更丰富的视角分配更多token,在第二阶段为任务相关视角分配更多token。
这里最有意思的地方,是它并不是一次性做完所有选择,而是用一个贪心式的迭代过程:先选一个和任务最相关的 token 作为起点,再不断从候选集中挑出“既独特、又相关”的 token。这样做的好处是,保留下来的 token 不会高度重复,也不会只剩下一堆“看起来很像但其实没啥新信息”的冗余片段。说白了,它不是在挑“最像题目答案的那几个词”,而是在挑“既能当主角,也能给后面剧情铺路的词”。
这一步看起来像细节,实际上很关键。因为如果只保留“当下最显眼”的 token,模型可能会在浅层显得很省,但深层推理会缺根筋;如果只保留“多样性最高”的 token,又可能离任务目标太远,最后剪得挺漂亮,答得却很飘。CCTS 的价值就在于把这两种风险同时压住。
图7:保留token的可视化。更高更深的柱子表示视角重要性,方法会根据指令变化自适应调整预算分配。
图7:保留token的可视化。更高更深的柱子表示视角重要性,方法会根据指令变化自适应调整预算分配。

展示“实验效果如何‘又快又好’?”

这篇论文最值钱的地方,不是“剪了很多 token”,而是在大幅提速的同时,尽量不把精度打崩。毕竟剪枝方法如果只会让模型变快,但回答开始胡说八道,那就不是优化,是给系统埋雷。
表1:在DriveLMM-o1模型上,与SOTA方法的对比结果。
表1:在DriveLMM-o1模型上,与SOTA方法的对比结果。
表2:在DriveLM基准上与SOTA方法的对比结果。
表2:在DriveLM基准上与SOTA方法的对比结果。
表3:在MAPLM基准上与SOTA方法的对比结果。
表3:在MAPLM基准上与SOTA方法的对比结果。
表4:在STSnu基准上与SOTA方法的对比结果。
表4:在STSnu基准上与SOTA方法的对比结果。
表5:在90%剪枝设置下,DriveLMM-o1、DriveLM和MAPLM上的效率对比。
表5:在90%剪枝设置下,DriveLMM-o1、DriveLM和MAPLM上的效率对比。
先看 DriveLMM-o1。只保留 10% 视觉 token 时,MVPruner 还能保住 98.0% 的原始性能;保留 25% token 时,能保住 99.2%。更关键的是,在 90% 剪枝下,它在 Overall Reasoning 上比第二名 Prune2Drive 还高出 2.6 分,而且不需要离线超参数搜索。这个点很现实:少了那一套繁琐搜索,方法才更像能进系统的工程方案,而不是实验室里“调参调到天荒地老”的作品。
再看 DriveLM。10% token 下,MVPruner 保住了 98.5% 的原始性能;25% token 下,甚至达到 99.3%。这说明它不是单纯“砍得少所以保得住”,而是确实把冗余和关键内容分开了。尤其在 ChatGPT 评分、CIDEr、Match 等指标上,很多对比方法在高压剪枝下掉得很明显,而 MVPruner 还能把结果维持在原模型附近,说明动态预算分配确实起作用。
MAPLM 更能看出方法是不是“只会在单一任务里耍帅”。这个基准同时涉及多传感器输入,难度更高。结果显示,在 90% 剪枝下,FastV、SparseVLM、Prune2Drive 的性能掉得都比较明显,而 MVPruner 下降更小,说明它对多模态、多视角、多任务的适应性更强。说白了,方法不是只会在一张图上挑重点,而是真的能在复杂输入里找到“该留的那部分”。
STSnu 是视频基准,论文把每一帧都当作独立多视角输入来做剪枝。结果里,75% 剪枝时 MVPruner 甚至略微超过原模型,这个现象虽然幅度不大,但挺有意思:说明剪枝并不必然带来退化,只要删的是冗余而不是关键信息,模型反而可能更“清醒”。当然,这类“超过原模型”的结果通常也要谨慎看待,毕竟不同评估指标、数据波动和实现细节都会影响最终数值,不能把它理解成剪枝越狠越强。
表6:DriveLM基准上90%剪枝设置下各个剪枝模块的延迟分析。
表6:DriveLM基准上90%剪枝设置下各个剪枝模块的延迟分析。
效率表也很关键。DriveLM 上,原模型 prefilling 需要 1968ms,MVPruner 降到 395.6ms,达到 4.97× 加速;DriveLMM-o1 上 prefilling 也有 3.80× 加速。更重要的是,FLOPs、显存、吞吐量这些工程指标也都跟着改善。这里说明一个很实际的事情:剪枝不是只为了论文里的分数好看,而是为了让模型在真实系统里少占点算力、少等点时间、少烧点钱。
从消融和模块分析来看,论文也没有把效果全都归功于“我这个框架很强”这种空话,而是分别验证了阶段选择、预算分配和 token 选择策略的作用。尤其是不同层剪枝位置的比较,进一步支持了“浅层保多样性、深层保任务相关性”这套设计。换句话说,效果不是凭空冒出来的,而是和前面的观察、假设、模块设计一一对应,逻辑链条比较完整。👍

总结与未来展望

MVPruner 的价值在于,它没有把多视角剪枝当成“统一压缩”的简单问题,而是把它拆成了两个更符合真实推理过程的问题:哪个视角信息更丰富,以及当前阶段到底需要什么信息。这个思路一旦成立,很多多视角、多模态、长上下文场景都能借鉴,不只是自动驾驶能用。
不过,论文也有边界。第一,方法依赖视觉与文本之间的注意力和相似度估计,如果底座模型本身跨模态对齐不稳定,预算分配的质量也会受影响。第二,两阶段剪枝虽然比静态一刀切更聪明,但仍然需要在实现上处理好额外的计算开销,尤其是在线选择逻辑不能太重,否则省下来的算力会被策略本身吃掉。第三,当前实验主要围绕自动驾驶 VLM 展开,迁移到其他多视角任务时,是否还能保持同样的收益,还需要更多验证。
如果后续继续推进,这条线很可能会往两个方向走:一个是更细粒度的动态预算控制,让不同场景、不同问题、不同帧都能自适应分配 token;另一个是把剪枝和推理一起联合优化,避免“剪枝策略很漂亮,实际推理却不够省”的情况。对自动驾驶来说,真正有价值的方法从来不是最花哨的,而是最能在复杂场景里稳住精度、压下延迟、少出幺蛾子的那种。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?解决的是多视角自动驾驶 VLM 推理太慢的问题。它不是简单粗暴地删 token,而是根据视角信息多样性和任务相关性,动态分配保留预算,尽量做到“快”与“准”同时兼顾。

DRA、IRA、CCTS 分别是什么意思?DRA 是 Diversity-aware Ratio Allocation,中文是多样性感知的预算分配;IRA 是 Instruction-aware Ratio Allocation,中文是指令感知的预算分配;CCTS 是 Cross-stage Contribution-aware Token Selection,中文是跨阶段贡献感知的 token 选择。三者分别负责“先给谁更多预算”“后给谁更多预算”“具体留哪些 token”。

为什么它比一刀切剪枝更靠谱?因为多视角输入本来就不均匀,模型在不同层看到的重点也不同。一刀切默认所有视角、所有层都一样重要,现实里很容易删错位置;MVPruner 则是先看视角内部信息密度,再看文本指令相关性,更符合多视角 VLM 的真实推理过程。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“多视角剪枝”从统一规则推进到“分阶段、分视角、分任务”的动态策略,思路不算离经叛道,但确实抓住了真实痛点,属于比较扎实的改进型创新。

实验合理度:★★★★☆

在多个自动驾驶基准上验证,还补了效率、延迟、消融和可视化,基本能支撑核心结论;如果能再补更多跨底座模型的验证,会更稳。

学术研究价值:★★★★☆

对多视角 VLM 的推理机制分析比较到位,给“什么时候剪、剪谁、留什么”提供了可解释的依据,研究价值比单纯刷速度更高。

稳定性:★★★☆☆

对自动驾驶多视角场景看起来有效,但仍依赖跨模态注意力质量;底座模型若对齐不稳,预算分配也会跟着飘。

适应性以及泛化能力:★★★☆☆

在 DriveLM、DriveLMM-o1、MAPLM、STSnu 上都能跑出结果,说明有一定泛化性;但是否能平移到更复杂的通用多模态任务,还要继续看。

硬件需求及成本:★★★★☆

推理阶段明显降 FLOPs、降延迟、降显存,工程价值很实在;但训练和部署时仍需要维护两阶段剪枝逻辑,不是“零成本白捡”。

复现难度:★★★☆☆

论文给了方法和对比,但涉及多模型、多基准、多阶段策略,复现成本不算低;好在属于可工程化的方向,不是玄学技巧。

产品化成熟度:★★★☆☆

适合对延迟敏感的自动驾驶多视角问答或感知辅助模块,但要上车仍需做更严格的稳定性、边界场景和安全性验证。

可能的问题:方法依赖注意力与相似度估计,若底座对齐不稳或场景切换剧烈,动态预算可能失准;另外两阶段策略虽有效,但在线开销与收益比还需进一步量化。


主要参考文献

[1] MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving. arXiv, 2026.
[2] DriveLM, DriveLMM-o1, MAPLM, STSnu 等数据集与基准论文,见原文引用列表。

多视角VLM太“话痨”,token 一多就慢得离谱。想继续追自动驾驶、VLM剪枝、Agent 和前沿论文拆解,欢迎加入『龙哥读论文』星球,少走弯路,多看门道。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
自动驾驶、图像处理、大模型、机器人、AI医疗、AI金融都能聊,来群里一起把论文读明白、把代码找对路。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。