← 返回 PaperDaily 视觉与图像

VLA模型一剪就废?这篇论文用ΔW找到真冗余

VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。

VLA模型一剪就废?这篇论文用ΔW找到真冗余
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。


原论文信息如下:
论文标题:
Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
发表日期:
2026年06月
发表单位:
Chinese Academy of Sciences, University of Chinese Academy of Sciences, Shanghai Jiao Tong University, The University of Sydney
原文链接:
https://arxiv.org/pdf/2606.31382v1.pdf
开源代码链接:
https://github.com/Niannnnnn/VLA_Parameter_Redundancy_VLM2VLA
项目链接:
https://github.com/Niannnnnn/VLA_Parameter_Redundancy_VLM2VLA

VLA模型“一剪就废”?问题不在剪枝,而在“剪错了” | 来自VLM适应信号的洞察

VLA模型最尴尬的地方,不是“太大”,而是“太脆”。很多剪枝方法在别的模型上还能凑合,一到视觉-语言-动作模型这里,往往像拿剪刀碰瓷:剪之前看起来风平浪静,剪完直接任务崩盘。更麻烦的是,现有做法通常还得靠微调、低秩修补、强化恢复来“补作业”,这就让剪枝变成了一个先砸后补的工程活。
封面
图1:封面图。论文从“VLM到VLA适配过程中参数到底怎么变”这个角度,重新审视了VLA剪枝问题,核心不是盲剪,而是先判断哪些参数真的该删。
这篇工作给出的判断很直接:如果一个剪枝方案必须依赖恢复才能“看起来有效”,那被删掉的参数很可能根本不冗余,而是被误杀了。于是,论文把剪枝从“压缩问题”改写成了“诊断问题”,用适配过程中的参数变化信号去定位真正的冗余参数。这个思路很硬,也很适合工程落地场景。

现有方法为何“又蠢又笨”?

先把背景说人话。VLA(Vision-Language-Action,视觉-语言-动作模型)本质上是把大模型的视觉理解、语言理解能力,接到机器人动作控制上。它们通常不是从零训练,而是从预训练的VLM(Vision-Language Model,视觉-语言模型)适配而来。问题也正出在这里:这些模型体量大、结构复杂,很多参数看上去“存在感不强”,但真删的时候,模型立刻翻脸。
传统剪枝通常默认一件事:参数之间有明显冗余,删掉一部分,性能最多掉一点,再靠微调补回来就行。但VLA里经常不是这么回事。动作策略对跨模态对齐极其敏感,尤其是投影层、语言主干、视觉主干之间的协同,一旦剪掉了关键通路,模型不是“差一点”,而是“直接不会干活”。
论文把这个现象概括得很到位:现有方法常常把“恢复成功”误当成“剪枝成功”。实际上,恢复只是说明模型还能重新学回去,不代表原先删掉的真是冗余参数。换句话说,很多方法不是在做“精准减肥”,而是在“先把胳膊砍了,再问能不能长回来”。
图1:Prismatic与OpenVLA之间的相对参数分歧可视化
图2:Prismatic(VLM)与OpenVLA(VLA)之间的相对参数分歧可视化。颜色越深,表示适配后参数变化越大;子图展示了不同模块在注意力头和FFN通道粒度上的变化分布。
从图2可以直观看出,VLM到VLA的参数变化并不是“均匀抖一抖”,而是有很强的结构性。比如OpenVLA里,语言模型、视觉主干、投影器的变化模式完全不同;有的层更新很猛,有的层几乎不动。这就说明一个事实:不同模块承担的功能不同,参数变化的意义也不同。如果还用一把尺子衡量所有参数,剪错几乎是必然的。

强依赖“恢复”的背后是剪掉了关键参数

论文先做了一个很关键的诊断实验:不做任何恢复,直接把不同分歧程度的参数剪掉,看看模型会怎样。这里用了一个重要缩写:SR,即 Success Rate,中文是成功率,是LIBERO基准上最核心的指标。
表1:微调前后模型性能对比
表1:微调前后模型性能对比。LIBERO-Spatial基线成功率为84.7%。
结果很扎眼:一旦直接剪掉低分歧参数,模型在微调前几乎当场“失能”,成功率可以掉到接近零。可是一旦接上LoRA微调,性能又能回去,甚至接近原始水平。这里的 LoRA 是 Low-Rank Adaptation,中文叫低秩适配,本质是给模型补一个轻量修复器。
这就暴露了传统剪枝的一个老毛病:它不区分“冗余参数”和“关键参数”。只要后面能恢复,前面剪得多狠都像“没事”;但这“没事”不是因为删得对,而是因为后面又把功能补回来了。论文把这种现象称为恢复依赖型范式的伪成功。
图3:恢复难度的因果分析
图3:恢复难度的因果分析。横轴是剪枝比例,纵轴是恢复所需的收敛步数。剪得越多,恢复越难,说明破坏越深。
图3进一步说明,剪枝比例越高,恢复所需步数越多。这不是偶然,而是说明高比例剪枝会造成更深层次的结构扰动。换句话说,恢复不是“免费午餐”,而是在给错误剪枝付维修费。

新范式:用ΔW信号精确定位真正的冗余参数

论文真正的核心,不是“怎么剪”,而是“怎么判断该剪谁”。它引入了适配差分信号 ΔW,也就是 VLM 参数和 VLA 参数之间的差值。这里的 ΔW 不是简单的数值差,而是把“从通用视觉语言能力到机器人动作能力”的重组痕迹当成线索。
直白一点说,哪些参数在适配时变化大,哪些变化小,都不是随机的。论文观察到,变化模式在不同模块里有明显异质性:有的注意力头变化大,说明它们在重组功能;有的FFN通道变化大,说明它们在承接动作语义映射;还有一些模块变化很小,可能只是“跟着模型混日子”。
图2:PaLI-Gemma与π0.5之间的相对参数分歧可视化
图4:PaLI-Gemma(VLM)与π0.5(VLA)之间的相对参数分歧可视化。与OpenVLA类似,不同层和不同模块的变化强度差异很大,但整体结构更规整。
图4说明,哪怕都是VLM到VLA适配,不同架构的“改造痕迹”也不一样。OpenVLA和π0.5的差分分布都不是随机噪声,而是带着模块职责的烙印。论文于是把 ΔW 当成一个结构化信号:不是看谁参数大,而是看谁在适配中真正承担了功能迁移。

发现模块异质性:不同组件对剪枝的“耐受度”天差地别

论文最值得记住的结论之一,就是模块异质性。简单说,不同组件对剪枝的耐受度完全不一样,不能一刀切。
表2:OpenVLA中VLM-VLA参数分歧对不同模块的影响
表2:OpenVLA中VLM-VLA参数分歧对不同模块的影响。高分歧和低分歧策略在不同模块上表现差异极大,说明“分歧大不一定能剪,分歧小也不一定能留”。
表3:π0.5中VLM-VLA参数分歧对不同模块的影响
表3:π0.5中VLM-VLA参数分歧对不同模块的影响。语言模型和视觉塔的行为也不一样,进一步证明冗余标准必须分模块制定。
从表2和表3能看出几个很扎眼的现象。第一,语言模型里的某些注意力头或FFN通道,一旦剪掉低分歧部分就会直接崩;反过来,剪高分歧部分反而更安全。第二,视觉模块里有些子模块对分歧信号并不敏感,说明它们可能承担的是辅助信息。第三,投影器模块非常脆,属于“碰一下就响”的瓶颈层,不能乱动。
表4:弱耦合模块的剪枝鲁棒性
表4:OpenVLA中弱耦合模块的剪枝鲁棒性。投影器在较高剪枝比例下几乎不可随便动,而某些视觉补充模块即使被大幅裁剪,也还有一定余量。
表4把“模块职责”讲得更明白:投影器是跨模态对齐的桥梁,桥不能乱拆;某些视觉补充模块则更像备胎,删一点问题不大。这类结论对工程很有价值,因为它告诉部署者,不是所有参数都值得同等保护,真正该保护的是那些一旦破坏就会引发连锁反应的关键模块。

无需微调恢复!新方法轻松压缩VLA模型并保持90%性能

在前面把“谁该剪”摸清之后,论文终于把它落成了一个真正可用的方案:多模块联合剪枝。它不是简单地按一个全局阈值砍参数,而是根据不同模块的功能角色,分别控制保留和裁剪比例,再把这些局部决定拼成整体策略。
这就像修车。传统方法是“看哪儿脏就先拆哪儿”,这篇论文则是先看发动机、变速箱、刹车系统各自的功能,再决定动哪一块。结果很现实:不需要后置恢复,模型就能在压缩后保住大部分能力。
表5:OpenVLA剪枝后的任务成功率
表5:OpenVLA剪枝后的任务成功率。传统方法在无恢复条件下几乎全线崩盘,而本文方法在压缩参数和内存的同时,仍能保住较高成功率。
表6:π0.5剪枝后的任务成功率
表6:π0.5剪枝后的任务成功率。即便在更轻量的π0.5上,本文方法依然能把内存从7.3GB压到5.6GB,同时保持接近九成的原始表现。
这里的结果很关键:在同等恢复-free(无恢复)条件下,LLM-Pruner、FLAP、Wanda这类方法基本都扛不住,性能直接塌。相比之下,本文的Moderate方案在OpenVLA上能保住约62.3%的平均成功率,在π0.5上还能保住约89.0%的平均成功率。对于机器人策略部署来说,这意味着剪枝不一定非得先把模型打残再救回来,只要冗余判断足够准,直接压缩也能站得住。
如果把这项工作的价值浓缩成一句话,那就是:它把VLA剪枝从“事后修复”拉回到“事前识别”。这一步看似只是方法论调整,实际意义却很大,因为它直接影响到机器人模型能不能在边缘设备、低算力平台和资源受限场景里稳定运行。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是VLA模型“剪枝后容易崩、崩了还得恢复”的老问题。论文认为,真正的问题不是参数太多,而是传统方法没分清哪些参数真冗余、哪些参数在适配中已经变成了关键功能通路。

ΔW到底是什么意思?ΔW是VLM参数和VLA参数之间的差分信号,也就是适配过程中参数变化的痕迹。论文把它当作“功能重组的证据”,用来判断哪些参数更可能承担了动作生成中的关键角色。

为什么说恢复依赖是个危险信号?因为恢复只能说明模型还能补救,不说明剪得对。若一个剪枝方案必须依赖后续微调才能恢复性能,往往意味着它删掉的并不是真正冗余的参数,而是关键参数。

如果还有哪些地方想继续掰开揉碎,欢迎在评论区继续追问。

龙哥点评

论文创新性分数:★★★★☆

这篇工作的创新点不在“发明一个更花哨的剪枝器”,而在于把VLA剪枝重新定义成一个诊断问题,用ΔW去判断冗余与否。思路不算玄学,胜在抓住了真实痛点。

实验合理度:★★★★☆

实验设计围绕“无恢复直接剪枝”展开,这一点很有说服力,因为它正好能区分“真冗余”与“靠恢复补救”。不足是仍主要集中在LIBERO基准,跨任务泛化还需要更多验证。

学术研究价值:★★★★☆

价值在于揭示了VLM到VLA适配中的参数演化规律,并指出“模块异质性”不能被忽略。这个结论对后续做VLA压缩、可解释性和结构分析都有启发。

稳定性:★★★☆☆

方法在恢复-free条件下已经证明可用,但对不同VLA架构、不同任务分布的稳定性还不算完全封死。投影器这类瓶颈模块尤其敏感,落地时要非常谨慎。

适应性以及泛化能力:★★★☆☆

在OpenVLA和π0.5上都有效,说明不是只对单一模型“碰巧管用”。但是否能迁移到更多机器人策略、更多视觉编码器,还需要进一步实证。

硬件需求及成本:★★★★☆

剪枝后显著降低参数量和显存占用,部署成本更友好;但前期还需要做ΔW统计、模块分析和策略设计,属于“前面费工,后面省电”。

复现难度:★★★☆☆

代码已开源是加分项,但仍依赖上游VLA仓库、环境配置和机器人基准,复现门槛不算低。对普通研究者来说,环境搭建比算法本身更像体力活。

产品化成熟度:★★★☆☆

在资源受限的机器人部署场景里有明确价值,但要上产品还得补足跨场景鲁棒性、任务覆盖度和安全验证。适合做“可控压缩”,不适合盲目上车。

可能的问题:结论主要建立在LIBERO与特定VLA架构上,跨数据集和跨机器人平台的稳健性还需继续验证;另外,模块级规则虽有效,但策略设计仍有一定人工经验成分。


主要参考文献

[1] Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu. Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation. arXiv, 2026.
[2] 代码仓库: https://github.com/Niannnnnn/VLA_Parameter_Redundancy_VLM2VLA
[3] 原文链接: https://arxiv.org/pdf/2606.31382v1.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。