← 返回 PaperDaily 视觉与图像

工业机器人也能LoRA?r=32逼近全量微调

这篇论文不讲虚的,直接盯住工业机械臂最现实的问题:显存不够、全量微调太贵、LoRA到底能不能顶住。结果很有意思,r=32 基本就到头了。

工业机器人也能LoRA?r=32逼近全量微调
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文不讲虚的,直接盯住工业机械臂最现实的问题:显存不够、全量微调太贵、LoRA到底能不能顶住。结果很有意思,r=32 基本就到头了。


原论文信息如下:
论文标题:
On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
发表日期: 2026年07月
发表单位: Technische Hochschule Nürnberg Georg Simon Ohm; Siemens AG; Fraunhofer Institute for Integrated Circuits (IIS)
原文链接: https://arxiv.org/pdf/2607.10172v1.pdf
开源代码链接: 原文提到已开源训练代码和硬件集成,但未给出明确仓库链接
项目链接: 没有
开源数据集链接: 没有

LoRA微调VLA模型,工业机器人也能用上大模型?

工业机器人最怕什么?不是不会干活,而是换个零件、换个工位、换个姿态,就得重新调一遍。传统自动化擅长“重复一万次”,但一旦任务变了,工程师就得回来救火。VLA 模型(Vision-Language-Action,视觉-语言-动作模型)想做的事很直接:让机器人看图、听指令、直接出动作,少写死规则,多靠学习。
但现实很骨感。大模型上机器人,不只是“能不能跑”的问题,而是显存够不够、数据能不能留在本地、微调成本能不能落地的问题。全量微调(FFT,Full Fine-Tuning,中文可理解为全参数微调)当然最自由,可代价也最狠:参数全开,显存也跟着全开。论文这次盯住的就是这个痛点,研究 LoRA(Low-Rank Adaptation,低秩适配)到底能不能把工业机械臂的 VLA 微调做得又省又稳。
图1:实验硬件平台。UR5e 机械臂、GELLO 遥操作器与双目相机配置。
图1:实验硬件平台。UR5e 机械臂、GELLO 遥操作器与双目相机配置。
这套实验并不花哨,反而很“工业”:UR5e 机械臂配 Robotiq 夹爪,两个相机分别看全局和手腕视角,专家演示用 GELLO 遥操作采集。说白了,就是把真实工厂里那种“看得见、摸得着、得干活”的场景搬上来了,而不是拿个玩具桌面任务糊弄读者。这个设定很重要,因为 LoRA 在大模型里好不好用,最后都得回到一句话:在真机上能不能稳住

零样本不可靠,但LoRA r=32就能媲美全量微调?

论文先做了一件很朴素但很关键的事:先别谈玄学,先看零样本到底行不行。结果很直接——零样本基本不行。对于工业装配这种任务,模型从通用预训练世界来到具体机械臂世界,存在明显的 embodiment gap(具身差距):看得懂,不代表能把螺栓插进去;会说话,不代表能把动作做准。
于是论文把主角换成 π0:一个 flow-matching VLA。这里顺手解释一下,flow-matching 可以理解成一种“连续地往正确动作方向推”的生成方式,不像自回归模型那样一个 token 一个 token 地吐动作,而是一次性预测一段动作轨迹,更适合高频控制。π0 里又把系统拆成两块:VLM backbone 负责理解图像和语言,action expert 负责把理解转成连续控制。这个拆法很像“前台接单,后台干活”,分工明确,但也意味着微调时到底该把适配能力放哪儿,不能瞎来。
图2:四个装配任务概览,展示初始状态(左)与目标状态(右)。上:螺栓插入简单版/困难版;下:抓取放置/轴承压装。
图2:四个装配任务概览,展示初始状态(左)与目标状态(右)。上:螺栓插入简单版/困难版;下:抓取放置/轴承压装。
这四个任务很会挑:有只要求位置精度的,也有要求姿态对齐的;有要从一堆零件里找对目标的,也有接触丰富、需要持续施力的压装任务。换句话说,它不是只测“能不能拿起来”,而是测“能不能像个真正的工位员工一样把事情做完”。

实验解析:从秩扫描到参数分配,LoRA如何做到与FFT无显著差异

这篇论文最值钱的地方,不是“LoRA 能不能用”,而是它把问题拆开了:LoRA 的 rank 到底多大够用?参数该分给谁?冻结谁会出事? 这几个问题比单纯报一个分数更像工程问题,也更接近真正部署时的纠结。
表1:评估配置总览。所有 LoRA 运行都使用 α=r。
表1:评估配置总览。所有 LoRA 运行都使用 α=r。
先看配置。作者扫了 r=8、16、32、64、128、256 这些 rank,还专门做了两种不对称分配:一种偏 VLM,一种偏 action expert。再加上冻结 VLM、冻结 SigLIP 视觉编码器、只给 SigLIP 上 LoRA 等消融,基本把“适配能力该放哪儿”这件事掰开揉碎了。
训练设置也比较标准:AdamW、余弦学习率、30 步动作视野,LoRA 只改 query、key、value、output 和前馈层。这里有个细节很重要:论文把 LoRA 的缩放系数设成 α=r,也就是让 α/r 保持常数。这样 rank 才是唯一变化变量,避免“rank 变了,缩放也跟着变,最后谁在起作用都说不清”的尴尬。
图3:平均任务进展随 LoRA 秩变化的关系图(r=8 到 256)。虚线和阴影带表示 FFT 的均值和 95% 自助法置信区间。
图3:平均任务进展随 LoRA 秩变化的关系图(r=8 到 256)。虚线和阴影带表示 FFT 的均值和 95% 自助法置信区间。
结果先说结论:r=32 基本就是拐点。从 r=8 到 r=32,性能明显上升;再往上加 rank,收益开始变平,像是把油门踩到底,车速却没怎么再涨。论文里用的是 Average Task Progress(ATP,平均任务进展),不是简单的成功/失败二分类,因为工业任务里“差一点完成”和“完全没做成”之间差别很大,ATP 更能反映真实进度。
更关键的是,统一 LoRA 配置在 r>32 时,性能已经落进 FFT 的 95% 置信区间里,统计检验也没有发现显著差异。说人话就是:在这套任务、这台机器人、这组数据上,LoRA 没输给全量微调。这不是“差不多吧”的口嗨,而是做了 Mann-Whitney U 检验和 Holm-Bonferroni 校正后的结论。
表2:在 60k 步时的整体 ATP,以及与 FFT 的 Mann-Whitney U 检验结果。
表2:在 60k 步时的整体 ATP,以及与 FFT 的 Mann-Whitney U 检验结果。
再看参数分配。VLM-heavy 和 AE-heavy 两种非均匀分配都没有比统一 r=32 更好,甚至在数值上还略吃亏。这个结论很朴素:别以为把预算全砸给某一边就能赢。VLM 需要改,动作专家也需要改,偏科反而容易浪费容量。
论文还做了一个很“扎心”的对照:只冻住 VLM、只训练动作专家,性能直接掉到接近废掉;把 SigLIP 视觉编码器冻住,结果也很差。更离谱一点的是,给 SigLIP 也套 LoRA,性能只恢复了一部分,还是明显不如直接全量微调 SigLIP。也就是说,工业具身适配不是单纯的“控制器调一调”就够了,视觉理解和语义对齐都得跟着变
表3:各配置的可训练参数量与模型 VRAM 占用。VRAM 估计包含参数与优化器状态,不含激活显存。
表3:各配置的可训练参数量与模型 VRAM 占用。VRAM 估计包含参数与优化器状态,不含激活显存。
工程上最有意思的地方来了。LoRA r=32 时,训练参数只占 FFT 的一小部分,静态峰值显存从 36.2 GiB 降到 10.8 GiB。注意这里还没算激活显存,真跑起来会更复杂,但方向已经很明确:LoRA 把“必须上数据中心 GPU 才能训”这件事往下拽了一大截。对于要守住数据本地化、又不想把训练数据搬去云上的工业场景,这个价值是实打实的。

瓶颈在哪?视觉编码器才是关键,VLM和动作专家都离不开

如果只看表面,可能会以为“动作控制难,所以只要把动作专家训好就行”。论文偏偏把这条直觉打了个对折:真正的瓶颈不只在动作头,视觉侧和语义侧都在拖后腿
先说 VLM。冻结 VLM 后,模型几乎没法完成任务,这说明机器人不是只需要“手更稳”,还需要“脑子会转”。工业装配里,语言指令往往很短,但场景里干扰很多:同类零件、相似孔位、遮挡、姿态偏差,都会让视觉-语言对齐出问题。VLM 不适配,动作再强也像拿着错误地图的司机,油门踩得再猛也可能开沟里。
再说 SigLIP。SigLIP 是 Sigmoid Loss for Language Image Pre-training 的缩写,中文可理解为“用于语言-图像预训练的 Sigmoid 损失方法”。它是视觉编码器,负责把图像变成模型能读懂的表示。论文发现,SigLIP 不能随便冻。一旦冻结,性能就大幅下滑;即便只给它上 LoRA,也还是不如全量微调。这说明工业场景的视觉域偏移并不小,低秩适配未必够用,尤其当目标环境和预训练视觉分布差得比较远时。
图5:各 transformer 层中,达到 95% 谱能量所需的秩。
图5:各 transformer 层中,达到 95% 谱能量所需的秩。
这张图还透露了一个细节:不同层的适配需求并不均匀。VLM 最后几层会突然冒出很高的有效秩,说明高层表征在迁移到新机器人任务时需要大幅重写;动作专家的后层则呈现另一种趋势。这个现象很像“前面都还能凑合,最后一关必须认真改”。但有意思的是,虽然层间差异明显,统一分配 LoRA 依然够用,说明工程上不一定非得做复杂的层级预算,先把简单方案跑通更划算。

结果背后的原理:SVD告诉你为什么LoRA虽低秩却有效

论文没有满足于“LoRA 好像挺行”,还做了 SVD(Singular Value Decomposition,奇异值分解)分析。简单说,就是把全量微调后的权重变化拆开,看这些变化到底是少数方向在起作用,还是得靠很多方向一起发力。
结果有点反直觉:FFT 的权重更新本身并不低维。换句话说,全量微调虽然“全都能改”,但真正有效的变化未必需要那么多自由度。论文观察到,尽管 FFT 的权重差分在谱能量上很分散,任务真正需要的那部分适配,可能只占其中一个较小子空间。LoRA r=32 之所以能顶住,原因不是它把全部信息都学到了,而是它已经抓住了任务最关键的那部分。
这里还有一个值得记住的点:高谱能量不等于高任务收益。SVD 告诉的是“改动有多分散”,ATP 告诉的是“任务进展有多大”。这两个量不是一回事。很多时候,模型里一大堆权重变化只是为了适应训练过程的噪声或冗余表达,真正决定机器人能不能插进去、压进去、放对位的,只是少数有效方向。LoRA 的本质,就是用更小的参数预算去逼近这些关键方向。

实用指南:给你的工业机器人装上LoRA,省钱又高效

如果把这篇论文压缩成一句工程建议,大概可以写成:VLM 和动作专家都别冻死,SigLIP 尽量全量微调,LoRA 优先选 r=32,先求稳,再求花。这不是理论上最漂亮的方案,但很可能是工业现场最能落地的方案。
对普通从业者来说,这项工作的启发很直接。第一,不是所有大模型任务都值得全量微调,尤其在显存和数据合规压力很大的场景。第二,LoRA 也不是万能药,至少在视觉编码器这种强域偏移模块上,低秩适配可能不够。第三,做机器人论文时,别只报成功率,ATP 这种分阶段进展指标更能说明问题。
这篇工作的边界也要说清楚。它只在一个机器人平台、一个 VLA 架构、四个工业装配任务上验证;LoRA 的 rank 扫描还固定使用 α=r 的常规设定,论文自己也提醒,这种缩放在高 rank 下可能带来学习变慢的问题。也就是说,r=32 这个结论很有价值,但不能偷懒地直接抄到所有机器人、所有任务、所有模型上。工程上最怕的就是“看一篇论文,复制到全世界”,然后被现实教育。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是工业机器人微调 VLA 模型时“全量微调太贵、LoRA 到底够不够”的问题。结论很明确:在这套真机装配任务上,r=32 的 LoRA 配置已经能接近 FFT,而且显存压力小很多。

ATP、FFT、SigLIP 这些词是什么意思?ATP 是 Average Task Progress,平均任务进展,用来衡量任务完成了多少步骤;FFT 是 Full Fine-Tuning,全参数微调;SigLIP 是用于图文预训练的视觉编码器,论文里它是视觉侧是否能适配工业场景的关键模块。

为什么 LoRA 低秩还能有效?因为全量微调虽然更新很多参数,但真正对任务有用的变化未必那么高维。SVD 分析显示,任务关键适配往往集中在较小的有效子空间里;LoRA 用少量可训练参数就能抓住这部分,因此在这组实验里能接近 FFT。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 这篇工作的创新不在“发明了 LoRA”,而在于把 LoRA 放到工业机器人 VLA 微调里做了系统扫描,问题选得准,实验也够完整。

实验合理度:★★★★☆ 任务、指标、统计检验、显存估算都比较扎实,尤其是把 FFT、不同 rank、不同分配方式和冻结策略放在同一套框架下比较,可信度不错。

学术研究价值:★★★★☆ 它回答了一个很实际的研究问题:VLA 在真机工业场景里,参数高效微调是否真的够用。对后续做机器人基础模型适配的人很有参考价值。

稳定性:★★★☆☆ 在这套任务上表现稳定,但还谈不上“随便拿去就能用”,因为平台和任务范围都有限,且视觉编码器仍然需要全量适配。

适应性以及泛化能力:★★★☆☆ 结论对类似工业装配任务有启发,但跨机器人、跨任务、跨架构的泛化还没被证明。

硬件需求及成本:★★★★☆ 相比 FFT,LoRA r=32 的显存压力明显下降,已经更接近单卡可训练的工程现实,这一点很加分。

复现难度:★★★☆☆ 论文说训练代码和硬件集成已开源,但未给出明确仓库;再加上真机平台门槛不低,复现不算轻松。

产品化成熟度:★★★☆☆ 作为工业机器人微调方案有落地潜力,但还需要更多任务验证、视觉侧稳定性验证和部署级安全评估。

可能的问题:结论强依赖单一平台与 α=r 设定,SigLIP 仍需全量微调,说明“低秩万能”这张牌在工业视觉侧还打不满。


主要参考文献

1. Finn Ferchau, Daniel Pommer, Cristian Axenie. On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation. arXiv:2607.10172v1, 2026.
2. Hu, E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021.
3. Black, K. et al. π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024.
4. Beyer, L. et al. PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726, 2024.
5. 原文链接:https://arxiv.org/pdf/2607.10172v1.pdf

*工业机器人想省显存、少折腾、还不掉点?这篇LoRA论文给了很实在的答案。欢迎交流工业具身、VLA和微调实战,理性讨论更高效~       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。