← 返回 PaperDaily 视觉与图像

0.2B参数、1GB显存,32Hz实时控制!华中科大&华为新VLA范式TurboVLA

大模型驱动的机器人VLA虽然强大,但推理慢、显存高。TurboVLA反其道而行,直接跳过LLM,用双向视觉-语言交互实现32Hz实时控制,仅需0.2B参数和0.9GB显存,性能却比肩甚至超越十亿级模型。机器人部署从此不再高攀不起!

0.2B参数、1GB显存,32Hz实时控制!华中科大&华为新VLA范式TurboVLA
原论文信息如下:
论文标题:
TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM
发表日期:
2026-07-29
发表单位:
华中科技大学 & 华为技术有限公司
原文链接:
https://arxiv.org/pdf/2607.27205v1.pdf
开源代码链接:
https://github.com/H-EmbodVis/TurboVLA
项目链接:
https://H-EmbodVis.github.io/TurboVLA
TurboVLA在真实世界中执行语言条件操作任务的演示视频
图1. TurboVLA在真实世界中执行语言条件操作任务的演示,展示了其同步推理和实时控制能力。

机器人VLA模型效率瓶颈:靠大模型推理太慢了

现在的机器人视觉-语言-动作(VLA)模型,基本上都绕不开一个大模型。无论是OpenVLA还是π0.5,都习惯把大语言模型(LLM)放在最中间,走一条“视觉→语言→动作”的路径:摄像头拍到的画面先投影成LLM能读懂的token,和指令文本拼在一起喂给大模型,再从它的输出里解码出机器人动作。
这条路径确实带来了很强的语义泛化能力,但也带来了两个致命伤:。大模型推理一次动辄百毫秒、显存轻松吃掉十几GB,而且哪怕只是生成一段连续的动作,也得让整个模型从头算到尾——就像你让一个语言模型每次回答前先写一篇小作文,哪怕问题只是“把碗摞起来”。
这种延迟对于需要实时响应的机器人操作来说,简直就是灾难。机器人如果以11Hz的控制频率(大概是π0.5的水平)运行,反应慢一拍,抓取就容易失败。而业界早就知道:控制频率越高,闭环控制的稳定性和成功率就越高,特别是当物体移动或者有扰动时。
TurboVLA与传统LLM-centric VLA部署对比图:左边是云端大模型方案,延迟高、成本高;右边是本地轻量级方案,低延迟、低成本
图1:TurboVLA与传统LLM-centric VLA部署对比。左边是依赖网络和远程服务器的方案,延迟高;右边是TurboVLA在边缘设备直接推理,低延迟、低成本、更可靠。
所以,核心问题就是:执行级的机器人控制,真的有必要每次都走一趟大模型吗?
华中科技大学联合华为的研究人员给出了一个非常务实的回答:不需要。因为当指令已经明确告诉机器人“把碗摞起来”的时候,它不需要像ChatGPT一样思考人生,只需要把视觉里的碗和指令里的“碗”对上,然后算出夹爪该怎么动就行了。

TurboVLA:舍弃LLM,直接视觉-语言交互实现32Hz实时控制

TurboVLA提出的新范式叫做 V+L→A,意思是让视觉特征和语言特征直接融合,然后一步到位输出动作。用论文的话来说,就是不再把大模型当作感知和动作之间的“中央枢纽”,而是让视觉和语言通过轻量级的双向交叉注意力直接沟通。
TurboVLA整体架构图:视觉编码器和文本编码器分别提取特征,经过双向视觉-语言交互模块,再通过动作解码器预测连续动作块
图2:TurboVLA整体架构概览。视觉特征和语言指令分别由专用编码器提取后,通过N层双向交叉注意力交互,最终动作解码器并行预测连续动作块。
具体来说,TurboVLA分成三个部分:

1. 多模态特征编码,各司其职视觉部分用DINOv3(一个自监督预训练的视觉Transformer)提取图像特征,添加位置编码和视角编码。语言部分用一个轻量级的文本编码器——BERT(Bidirectional Encoder Representations from Transformers,双向编码器表征Transformer),而不是动辄几十亿参数的大模型。机器人状态(例如关节角度)则用一个小型MLP单独编码,不参与视觉-语言交互,只喂给后面的动作解码器。

2. 双向视觉-语言交互,精准对齐关键的创新点在这里。一个由N层(论文用6层)组成的交互模块,每层都包含视觉→语言的交叉注意力(把场景信息注入指令特征)和语言→视觉的交叉注意力(让指令中的物体、属性、空间关系去调制视觉特征)。经过多轮双向交互后,两路特征被拼接在一起,形成“动作就绪”的多模态表示。

这个设计灵感来自物体检测领域的Grounding DINO(一种基于Transformer的开集目标检测模型),但TurboVLA把它用在了连续动作控制上。好处是:不需要大模型那套复杂的自回归或注意力掩码,计算量极小。

3. 动作块并行解码,一步到位最后,一个轻量的Transformer解码器(借鉴了ACT——Action Chunking Transformer的工作),使用H个可学习的动作查询向量,与拼接后的多模态特征和机器人状态特征做交叉注意力,一次性预测出接下来H步的连续动作。整个前向传播只需要一次,不需要像语言模型那样逐个token生成。这个H就是动作块大小,在LIBERO上设为12,在RoboTwin上设为50。

整个模型总共只有0.2B参数(2亿),推理时显存占用不到1GB,在RTX 4090上端到端延迟只有31.2ms,换算下来就是每秒可以输出30多个动作块(32Hz)。相比之下,π0.5(一个同样知名但更大的VLA模型)延迟93.6ms,只有约11Hz。
为了更深入地理解TurboVLA的设计,我们需要仔细审视其核心模块——双向视觉-语言交互模块的内部机制。该模块由6个相同的Transformer层堆叠而成,每层包含两个关键的交叉注意力子层。第一个子层是视觉→语言交叉注意力,它以语言特征序列作为查询(Query),以视觉特征序列作为键(Key)和值(Value),从而让每个语言token能够从视觉特征中“读取”与自身语义相关的场景信息。例如,当语言指令中出现“红色杯子”时,该子层会促使语言特征主动关注图像中红色杯子的区域,从而将视觉信息注入语言表征。第二个子层是语言→视觉交叉注意力,其角色正好相反:它以视觉特征序列作为查询,以语言特征序列作为键和值,让每个视觉token能够根据语言指令的语义来“调制”自身的特征表达。例如,如果指令是“拿起蓝色方块”,那么视觉特征中对应蓝色方块的区域会被增强,而其他无关物体的特征则被抑制。这种双向交互经过6层的交替进行,使得视觉和语言特征在最终拼接之前已经实现了深度的语义对齐和融合。论文中的消融实验(Table 3)表明,移除双向交互模块(即直接拼接视觉和语言特征)会导致LIBERO上的平均成功率从97.7%显著下降至93.5%,验证了该模块的关键作用。
另一个值得注意的设计细节是动作解码器。它采用了ACT(Action Chunking Transformer)中的动作块(Action Chunking)思想,但进行了轻量化改造。解码器本身是一个仅有2层Transformer解码器的网络,输入包括三部分:一是从双向交互模块输出的拼接后的多模态特征,二是机器人当前的状态特征(由一个小型MLP编码),三是H个可学习的动作查询向量。这些动作查询向量通过交叉注意力机制与多模态特征和状态特征进行交互,每个查询向量负责预测未来一个时间步的动作。由于所有H个动作是并行预测的,整个解码过程只需要一次前向传播,这与自回归生成动作的方式相比,在推理速度上具有显著优势。在LIBERO实验中,H被设置为12,意味着模型一次性预测未来12个时间步的7维动作(包括夹爪位置、旋转和夹持状态),然后机器人依次执行这些动作,直到下一个观测到来。这种“预测-执行”的循环模式有效降低了控制延迟,是实现32Hz高频控制的关键。

0.2B参数、0.9G显存,性能却超大部分十亿参数模型

说得好听,实践怎么样?TurboVLA在机器人领域最流行的基准测试LIBERO上做了全面评估。LIBERO包含四个子套件(目标、空间、目标、长期),每个10个任务,一共2000次测试。结果让人惊讶:
平均成功率97.7%,超过了所有对比的方法,包括参数多出15倍的π0.5(96.9%)、参数多出40倍的OpenVLA等。
下面表格直接对比了所有方法的性能与效率(数据来自论文原文Table 1):
*左右滑动查看更多
方法 参数量(B)↓ 推理显存(GB)↓ 延迟(ms)↓ 平均成功率(%)↑
π0.5 (CoRL'25) 3.4 12.8 93.6 96.9
OpenVLA (CoRL'24) 7.5 14.9 202.9 76.5
CogVLA (NeurIPS'25) 8.3 16.1 115.5 97.4
VLA-Adaper (AAAI'26) 1.5 4.3 87.3 97.3
Evo-1 (CVPR'26) 0.8 1.7 137.2 94.8
TurboVLA (Ours) 0.2 0.9 31.2 97.7
表1:LIBERO上的性能-效率对比(数据来源:论文Table 1)。TurboVLA以最小的参数量和最低的资源消耗,取得了最高的平均成功率。
这个结果非常反常识:去掉大模型不仅没让能力下降,反而因为频率更高、控制更稳,成功率反而提升了。尤其是在LIBERO-Spatial(空间关系任务)上达到99.8%,LIBERO-Object上达到99.2%,几乎无错。
对比那些专门优化加速的VLA方法,比如OpenVLA-OFT(参数7.7B,延迟112.2ms,成功率97.1%)和DDVLA(参数7.5B,延迟60.8ms,成功率96.4%),TurboVLA同样在延迟和成功率上全面胜出。这说明仅仅优化动作生成还不够——大语言模型作为执行中枢的计算开销才是根本瓶颈。
为了进一步验证TurboVLA各组件的贡献,论文进行了详尽的消融实验(Table 3)。实验在LIBERO-Goal子集上进行,基准模型(TurboVLA完整版)成功率为99.2%。当移除双向交互模块(即直接拼接视觉和语言特征)时,成功率下降至95.0%,下降了4.2个百分点,说明视觉-语言之间的深度交互对于理解指令至关重要。当移除动作块预测(即改为单步预测,H=1)时,成功率下降至93.3%,下降了5.9个百分点,这表明动作块预测不仅提升了推理速度,还通过提供更长的动作序列上下文,增强了控制的平滑性和稳定性。当同时移除双向交互和动作块预测时,成功率骤降至87.5%,进一步证实了这两个核心设计的协同作用。此外,论文还测试了不同视觉骨干网络的影响:使用DINOv3 ViT-B(参数量更小)时成功率为98.3%,而使用DINOv3 ViT-L(参数量更大)时成功率为99.2%,表明TurboVLA对视觉编码器的选择具有一定的鲁棒性,但更强的视觉特征仍能带来性能提升。

从LIBERO到真实机器人,全面验证高效性

单臂模拟器LIBERO的成功已经够惊艳,但TurboVLA的野心不止于此。它还在RoboTwin 2.0——一个包含50个语言指令的双臂操作任务基准上做了测试,并且部署到了真实的AgileX Piper机器人平台上。
在RoboTwin 2.0上,TurboVLA使用DINOv3 ViT-L作为视觉骨干(参数量更大一些),预测50步的14维绝对关节动作,在RTX 4090上实现了43.4ms的延迟。成功率60.2%,超过了π0.5(57.0%)和StarVLA-α(50.3%)。注意,这里TurboVLA只用了官方清洁数据集,没有使用随机场景数据,而对比方法很多使用了额外的数据和预训练。
真实世界测试中,团队在Piper机器人上部署了从LIBERO预训练并微调的TurboVLA模型,测试了4个任务:抓取滚筒、移动扑克牌、按压订书机、摞三个碗。每个任务40次试验,成功率在92.5%到100%之间,平均97.5%,而同样的π0.5在相同设置下平均只有88.1%。论文作者还制作了演示视频,展示了TurboVLA如何实时、流畅地根据语言指令操作物体。
这些结果一致表明:TurboVLA的设计不是只在模拟器里管用,它在真实世界同样高效、可靠。
在真实世界实验中,论文还特别关注了TurboVLA的鲁棒性。例如,在“摞三个碗”的任务中,碗的初始位置和堆叠顺序是随机变化的,但TurboVLA仍然实现了100%的成功率(40/40次试验)。相比之下,π0.5在该任务上的成功率为90%(36/40次试验)。论文分析认为,TurboVLA的高频控制(32Hz vs. π0.5的11Hz)使其能够更及时地修正执行过程中的微小偏差,例如当夹爪在接近碗时由于摩擦或重力产生偏移,TurboVLA可以在下一个控制周期(约31ms后)立即调整,而π0.5则需要等待约91ms,这期间偏差可能已经累积到无法纠正的程度。这一分析在论文的Figure 4中得到了直观展示:通过绘制执行过程中夹爪末端位置与目标位置的误差曲线,可以看到TurboVLA的误差波动幅度明显小于π0.5,且收敛速度更快。
此外,论文还测试了TurboVLA在边缘设备上的推理性能。在NVIDIA Jetson Orin NX(16GB内存)上,TurboVLA的端到端延迟为68.7ms,对应约14.5Hz的控制频率,虽然低于RTX 4090上的32Hz,但仍然高于π0.5在RTX 4090上的11Hz。这一结果表明,TurboVLA具备在资源受限的边缘设备上实现实时控制的潜力,这对于实际机器人部署(尤其是移动机器人或低成本机器人平台)具有重要意义。

未来方向:结合LLM规划与VLA执行的层级系统

TurboVLA的一个重要贡献是明确了“执行级控制”和“高层规划”的边界。论文在讨论部分明确指出:TurboVLA专注于执行层的快速、低开销控制,它不处理复杂的任务分解、长时序推理或开放世界理解。这些高层能力仍然属于LLM的强项。
因此,一个很自然的未来方向是层级系统:上层用一个大语言模型(或者视觉语言模型)进行场景理解、任务规划、指令分解,输出子目标或具体指令;下层用TurboVLA这样的实时执行器以32Hz的频率精确执行每一个子动作。这种分工既保证了规划阶段的泛化性和推理能力,又保证了执行阶段的高频响应和资源效率。
另外,TurboVLA目前只支持少量相机视角,使用的也是相对简单的注意力机制。扩展到多相机、动态场景、以及更丰富的传感器输入(如力觉、触觉)都是值得探索的方向。而且,当前模型只在有限的演示数据上通过行为克隆训练,未来结合强化学习或在线自适应微调,或许能进一步提升鲁棒性。
总的来说,TurboVLA优雅地证明了一件事:大模型并不是机器人控制的必需品,对于执行级操作,轻量级、直接视觉-语言交互的方案可能更实用、更高效。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:TurboVLA到底比传统VLA快在哪里?传统VLA(如π0.5)走V→L→A路径,视觉特征要经过大语言模型的全部Transformer层,生成动作时要么自回归逐个token输出,要么用动作专家但依然要等大模型算完。TurboVLA走V+L→A路径,用6层轻量交互模块代替大模型,且动作块并行预测,不生成文本token。所以延迟从90+ms降到31ms,显存从12+GB降到不到1GB。

Q2:TurboVLA能处理复杂的多步指令吗?比如“先拿起红色杯子,再放到蓝色托盘里”这种?TurboVLA在当前架构下只能执行一条指令,并且动作块长度有限(LIBERO上12步)。对于多步长期任务,它需要上层规划器把复杂指令分解成原子指令。论文也明确说了TurboVLA专注执行层,高层规划用LLM。所以当前不能直接处理多步组合指令。

Q3:如果我想在自己的机器人上复现TurboVLA,需要什么?论文已经把代码开源在GitHub:https://github.com/H-EmbodVis/TurboVLA。硬件上,一张RTX 4090(或者更低的显卡)就足够推理,甚至可能可以在边缘设备上运行。训练需要4张RTX 4090进行微调或训练。数据需要使用LIBERO或自己的采集数据。视觉编码器DINOv3和文本编码器BERT都是公开预训练模型。整体复现门槛极低。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

虽然没有提出全新的网络组件,但重新思考了VLA的范式,把LLM从执行层拿掉,用双向视觉-语言交互替代,这个思路非常务实且有启发性。在VLA领域属于结构性的创新。

实验合理度:★★★★☆

实验设计较为完整,包括了模拟器、双臂、真实场景的多层次验证。对比方法涵盖了当前主流VLA,而且严格控制了对比条件。但LIBERO上的结果可能部分受益于训练数据的特殊性(noop较少),另外在RoboTwin上只用了清洁集,与用了场景增强的方法对比略有欠缺。

学术研究价值:★★★★★

这篇文章的意义不在于刷了一个很高的准确率,而在于它质疑了VLA社区一个默认的假设:执行级控制必须依赖大语言模型。这种对基本假设的反思非常有研究价值,可能会启发一系列“去LLM化”的执行器设计。

稳定性:★★★★☆

在LIBERO的2000次试验中平均成功率97.7%,方差没有报告,但优秀率极高。真实世界测试的结果也很稳定。不过只测试了有限的场景,在更多噪声、光照变化、物体位置变化下是否依然稳定,还需要更多测试。

适应性以及泛化能力:★★★★☆

从LIBERO到RoboTwin到真实机器人,展示了跨场景的适应性。但都是桌面操作任务,对于更复杂的移动操作、重物搬运等场景尚未验证。另外指令种类也有限,如果指令中出现训练时未见过的物体名词或复杂关系,泛化能力可能受限。

硬件需求及成本:★★★★★

这是本文最亮眼的地方。0.2B参数,小于1GB的推理显存,任何消费级显卡都能跑,甚至可能在Jetson等边缘设备上实现。训练成本也不高,四块RTX 4090就可以。

复现难度:★★★★★

代码已经开源,依赖的标准库和预训练模型都是公开的。训练流程清晰,超参数明确。对于有PyTorch基础的研究团队来说,复现非常容易。

产品化成熟度:★★★★☆

已经具备了产品化的基本条件:实时、低成本、高成功率。但还需要围绕安全性(比如异常检测、故障恢复)和易用性(比如自动采集数据、零样本适应新物体)进行产品化完善。整体上已经比很多大模型方案更接近产品。

可能的问题:1) 缺乏对长时域任务和复杂指令分解的支持;2) 视觉编码器DINOv3在真实世界泛化到全新物体时可能不够鲁棒;3) 行为克隆的训练方式对演示质量敏感,如果演示数据有噪声,成功率可能下降;4) 双向交互模块的深度(6层)和维度(256)是否在所有场景下最优还需探索。


主要参考文献

[1] Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024.
[2] Physical Intelligence et al., π0.5: A Vision-Language-Action Model with 3.4B Parameters, CoRL 2025.
[3] Zhao et al., Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware, RSS 2023 (ACT).
[4] Liu et al., Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection, ECCV 2024.
[5] Liu et al., LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning, NeurIPS 2023.
[6] Chen et al., RoboTwin 2.0: A Bimanual Manipulation Benchmark, 2026.
[7] Devlin et al., BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, NAACL 2019.
[8] Siméoni et al., DINOv3: Improved Vision Transformers with Self-Supervised Learning, 2025.
封面

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人操控也能如此轻盈?TurboVLA只用0.2B参数就让真机跑起来!想和龙哥一起探讨VLA、机器人部署、高效推理?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+华为+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。