← 返回 PaperDaily
视觉与图像
VLA模型一剪就废?这篇论文用ΔW找到真冗余
VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。
龙哥读论文
发布于 2026-08-17 00:20:05
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。
原论文信息如下:
VLA模型“一剪就废”?问题不在剪枝,而在“剪错了” | 来自VLM适应信号的洞察
VLA模型最尴尬的地方,不是“太大”,而是“太脆”。很多剪枝方法在别的模型上还能凑合,一到视觉-语言-动作模型这里,往往像拿剪刀碰瓷:剪之前看起来风平浪静,剪完直接任务崩盘 。更麻烦的是,现有做法通常还得靠微调、低秩修补、强化恢复来“补作业”,这就让剪枝变成了一个先砸后补的工程活。
这篇工作给出的判断很直接:如果一个剪枝方案必须依赖恢复才能“看起来有效”,那被删掉的参数很可能根本不冗余,而是被误杀了 。于是,论文把剪枝从“压缩问题”改写成了“诊断问题”,用适配过程中的参数变化信号去定位真正的冗余参数。这个思路很硬,也很适合工程落地场景。
现有方法为何“又蠢又笨”?
先把背景说人话。VLA(Vision-Language-Action,视觉-语言-动作模型)本质上是把大模型的视觉理解、语言理解能力,接到机器人动作控制上。它们通常不是从零训练,而是从预训练的VLM(Vision-Language Model,视觉-语言模型)适配而来。问题也正出在这里:这些模型体量大、结构复杂,很多参数看上去“存在感不强”,但真删的时候,模型立刻翻脸。
传统剪枝通常默认一件事:参数之间有明显冗余,删掉一部分,性能最多掉一点,再靠微调补回来就行。但VLA里经常不是这么回事。动作策略对跨模态对齐极其敏感,尤其是投影层、语言主干、视觉主干 之间的协同,一旦剪掉了关键通路,模型不是“差一点”,而是“直接不会干活”。
论文把这个现象概括得很到位:现有方法常常把“恢复成功”误当成“剪枝成功”。实际上,恢复只是说明模型还能重新学回去,不代表原先删掉的真是冗余参数。换句话说,很多方法不是在做“精准减肥”,而是在“先把胳膊砍了,再问能不能长回来”。
从图2可以直观看出,VLM到VLA的参数变化并不是“均匀抖一抖”,而是有很强的结构性。比如OpenVLA里,语言模型、视觉主干、投影器的变化模式完全不同;有的层更新很猛,有的层几乎不动。这就说明一个事实:不同模块承担的功能不同,参数变化的意义也不同 。如果还用一把尺子衡量所有参数,剪错几乎是必然的。
强依赖“恢复”的背后是剪掉了关键参数
论文先做了一个很关键的诊断实验:不做任何恢复,直接把不同分歧程度的参数剪掉,看看模型会怎样。这里用了一个重要缩写:SR ,即 Success Rate ,中文是成功率 ,是LIBERO基准上最核心的指标。
结果很扎眼:一旦直接剪掉低分歧参数,模型在微调前几乎当场“失能”,成功率可以掉到接近零。可是一旦接上LoRA微调,性能又能回去,甚至接近原始水平。这里的 LoRA 是 Low-Rank Adaptation ,中文叫低秩适配 ,本质是给模型补一个轻量修复器。
这就暴露了传统剪枝的一个老毛病:它不区分“冗余参数”和“关键参数” 。只要后面能恢复,前面剪得多狠都像“没事”;但这“没事”不是因为删得对,而是因为后面又把功能补回来了。论文把这种现象称为恢复依赖型范式的伪成功。
图3进一步说明,剪枝比例越高,恢复所需步数越多。这不是偶然,而是说明高比例剪枝会造成更深层次的结构扰动。换句话说,恢复不是“免费午餐”,而是在给错误剪枝付维修费。
新范式:用ΔW信号精确定位真正的冗余参数
论文真正的核心,不是“怎么剪”,而是“怎么判断该剪谁”。它引入了适配差分信号 ΔW ,也就是 VLM 参数和 VLA 参数之间的差值。这里的 ΔW 不是简单的数值差,而是把“从通用视觉语言能力到机器人动作能力”的重组痕迹当成线索。
直白一点说,哪些参数在适配时变化大,哪些变化小,都不是随机的。论文观察到,变化模式在不同模块里有明显异质性:有的注意力头变化大,说明它们在重组功能;有的FFN通道变化大,说明它们在承接动作语义映射;还有一些模块变化很小,可能只是“跟着模型混日子”。
图4说明,哪怕都是VLM到VLA适配,不同架构的“改造痕迹”也不一样。OpenVLA和π0.5的差分分布都不是随机噪声,而是带着模块职责的烙印。论文于是把 ΔW 当成一个结构化信号 :不是看谁参数大,而是看谁在适配中真正承担了功能迁移。
发现模块异质性:不同组件对剪枝的“耐受度”天差地别
论文最值得记住的结论之一,就是模块异质性 。简单说,不同组件对剪枝的耐受度完全不一样,不能一刀切。
从表2和表3能看出几个很扎眼的现象。第一,语言模型里的某些注意力头或FFN通道,一旦剪掉低分歧部分就会直接崩;反过来,剪高分歧部分反而更安全。第二,视觉模块里有些子模块对分歧信号并不敏感,说明它们可能承担的是辅助信息。第三,投影器模块非常脆,属于“碰一下就响”的瓶颈层,不能乱动。
表4把“模块职责”讲得更明白:投影器是跨模态对齐的桥梁,桥不能乱拆;某些视觉补充模块则更像备胎,删一点问题不大 。这类结论对工程很有价值,因为它告诉部署者,不是所有参数都值得同等保护,真正该保护的是那些一旦破坏就会引发连锁反应的关键模块。
无需微调恢复!新方法轻松压缩VLA模型并保持90%性能
在前面把“谁该剪”摸清之后,论文终于把它落成了一个真正可用的方案:多模块联合剪枝 。它不是简单地按一个全局阈值砍参数,而是根据不同模块的功能角色,分别控制保留和裁剪比例,再把这些局部决定拼成整体策略。
这就像修车。传统方法是“看哪儿脏就先拆哪儿”,这篇论文则是先看发动机、变速箱、刹车系统各自的功能,再决定动哪一块。结果很现实:不需要后置恢复,模型就能在压缩后保住大部分能力。
这里的结果很关键:在同等恢复-free(无恢复)条件下,LLM-Pruner、FLAP、Wanda这类方法基本都扛不住,性能直接塌。相比之下,本文的Moderate方案在OpenVLA上能保住约62.3%的平均成功率,在π0.5上还能保住约89.0%的平均成功率。对于机器人策略部署来说,这意味着剪枝不一定非得先把模型打残再救回来 ,只要冗余判断足够准,直接压缩也能站得住。
如果把这项工作的价值浓缩成一句话,那就是:它把VLA剪枝从“事后修复”拉回到“事前识别” 。这一步看似只是方法论调整,实际意义却很大,因为它直接影响到机器人模型能不能在边缘设备、低算力平台和资源受限场景里稳定运行。
龙迷三问
这篇论文到底解决什么问题? 它解决的是VLA模型“剪枝后容易崩、崩了还得恢复”的老问题。论文认为,真正的问题不是参数太多,而是传统方法没分清哪些参数真冗余、哪些参数在适配中已经变成了关键功能通路。
ΔW到底是什么意思? ΔW是VLM参数和VLA参数之间的差分信号,也就是适配过程中参数变化的痕迹。论文把它当作“功能重组的证据”,用来判断哪些参数更可能承担了动作生成中的关键角色。
为什么说恢复依赖是个危险信号? 因为恢复只能说明模型还能补救,不说明剪得对。若一个剪枝方案必须依赖后续微调才能恢复性能,往往意味着它删掉的并不是真正冗余的参数,而是关键参数。
如果还有哪些地方想继续掰开揉碎,欢迎在评论区继续追问。
龙哥点评
论文创新性分数: ★★★★☆
这篇工作的创新点不在“发明一个更花哨的剪枝器”,而在于把VLA剪枝重新定义成一个诊断问题,用ΔW去判断冗余与否。思路不算玄学,胜在抓住了真实痛点。
实验合理度: ★★★★☆
实验设计围绕“无恢复直接剪枝”展开,这一点很有说服力,因为它正好能区分“真冗余”与“靠恢复补救”。不足是仍主要集中在LIBERO基准,跨任务泛化还需要更多验证。
学术研究价值: ★★★★☆
价值在于揭示了VLM到VLA适配中的参数演化规律,并指出“模块异质性”不能被忽略。这个结论对后续做VLA压缩、可解释性和结构分析都有启发。
稳定性: ★★★☆☆
方法在恢复-free条件下已经证明可用,但对不同VLA架构、不同任务分布的稳定性还不算完全封死。投影器这类瓶颈模块尤其敏感,落地时要非常谨慎。
适应性以及泛化能力: ★★★☆☆
在OpenVLA和π0.5上都有效,说明不是只对单一模型“碰巧管用”。但是否能迁移到更多机器人策略、更多视觉编码器,还需要进一步实证。
硬件需求及成本: ★★★★☆
剪枝后显著降低参数量和显存占用,部署成本更友好;但前期还需要做ΔW统计、模块分析和策略设计,属于“前面费工,后面省电”。
复现难度: ★★★☆☆
代码已开源是加分项,但仍依赖上游VLA仓库、环境配置和机器人基准,复现门槛不算低。对普通研究者来说,环境搭建比算法本身更像体力活。
产品化成熟度: ★★★☆☆
在资源受限的机器人部署场景里有明确价值,但要上产品还得补足跨场景鲁棒性、任务覆盖度和安全验证。适合做“可控压缩”,不适合盲目上车。
可能的问题: 结论主要建立在LIBERO与特定VLA架构上,跨数据集和跨机器人平台的稳健性还需继续验证;另外,模块级规则虽有效,但策略设计仍有一定人工经验成分。
主要参考文献
[1] Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu. Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation. arXiv, 2026.
[2] 代码仓库: https://github.com/Niannnnnn/VLA_Parameter_Redundancy_VLM2VLA
[3] 原文链接: https://arxiv.org/pdf/2606.31382v1.pdf
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群