← 返回 PaperDaily
视觉与图像
计算开销砍98.7%,成功率不降反升:VANE重新定义机器人测试时训练
机器人部署最怕什么?模型离线训得好,一到现场就“水土不服”。理想汽车联合多所高校提出VANE框架,把测试时训练做成“提案—验证—提交”的可靠流程:用未来视觉表征预测当监督信号,只在关键时刻更新,错了还能回滚。SimplerEnv上WidowX平均成功率提升3.2个百分点,反向传播计算量削减98.7%。把“边干边学”从口号变成了可信工程。
龙哥读论文
发布于 2026-08-14 21:47:33
阅读 4
查看原文
原论文信息如下:
好的,我已根据您提供的素材,生成了符合要求的公众号文章主体HTML内容(不含“引言”及“论文基本信息”部分)。
把软件工程里的“代码评审”流程搬到机器人策略更新上,会碰撞出什么火花?理想汽车联手的这项新研究给出了一个相当硬核的答案。面对视觉-语言-动作模型(VLA)部署时的“水土不服”,VANE框架不再盲目地让模型边用边学,而是像代码合入主干前必须通过CI测试一样,给每一次策略更新都加上了“提案—验证—提交”的流程枷锁。结果很直接:SimplerEnv的WidowX基准上平均成功率提升3.2个百分点,反向传播计算量削减98.7%。边干活边进化,这回终于不是一句空话了。
VANE:让机器人策略在部署中持续进化
视觉-语言-动作模型(Vision-Language-Action Model,VLA)是当前机器人操作领域最受关注的方向之一。这类模型将视觉感知、语言理解与动作输出统一在同一个大模型框架内,通过大规模数据预训练获得跨任务泛化能力。然而,VLA模型再“聪明”,部署到真实环境时依然免不了各种“意外”——光照变了、物体位置偏了、背景换了,策略可能立刻失灵。
传统的适应方案是采集新任务的演示数据,标注动作标签,然后对模型做微调。这个流程的问题很明显:每个新任务都要重复一轮数据采集和训练,成本高、周期长,而且最终往往得到一堆各自为政的专用策略,难以维护。
测试时训练(Test-Time Training,TTT) 提供了一种轻量级替代思路:在部署阶段利用无标注的观测流,通过自监督目标优化模型的一小部分参数,从而实现“边用边学”。TTT-VLA等工作已经验证了“潜提示词(latent prompt)”这种轻量适应方式在VLA模型上的可行性。但一个关键问题随之而来——这种更新可靠吗?
本论文提出的VANE 框架,核心目标就是让TTT变得“可靠”。所谓可靠,具体来说就是:候选的更新可以有选择地被引入,因为任务干扰或错误的在线优化导致的性能回退要被有效抑制。VANE把“何时更新”和“是否采纳更新”分成两个独立决策环节,配合未来视觉表征预测的代理目标,让整个测试时训练过程变得可控、可验证、可回滚。
测试时训练的三大挑战:任务干扰、代理目标与闭环耦合
要把TTT从“能用”做到“可靠”,首先得搞清楚问题出在哪。论文通过一组控制实验,识别出了三个核心挑战。
第一个挑战是任务干扰。 论文在一个固定的状态接地(state grounding)策略检查点上做了一组诊断实验:用不同的任务子集联合优化一个共享提示词,然后在四个任务上分别评估。结果很有意思:单独为每个任务各自适配一个提示词,四个任务的平均成功率从64.1%提升到66.1%;但如果把所有任务混合起来联合优化一个共享提示词,平均成功率反而降到63.3%,其中Spoon任务直接掉了5.7个百分点。
第二个挑战是代理目标的设计。 部署环境中没有动作标签、奖励信号或成功指示器,TTT必须依赖一个自监督的代理目标来驱动参数更新。论文提出了两个基本要求:第一,目标必须能从普通的机器人交互流中获取,不需要任何专家标注;第二,优化这个目标要产生与策略相关的适应信号——也就是说,目标要能捕捉交互带来的变化,而不仅仅是重建当前已经可见的内容。
状态接地(state grounding) 满足第一点——当前机器人状态可以直接观测到——但其目标只是低维的当前时刻状态,无法刻画“交互之后视觉场景如何演化”这一关键信息。它本质上是一种同期(same-time)监督,与交互结果的因果关联较弱。
第三个挑战是闭环耦合。 如果用延迟的未来观测作为预测目标,就会引入一个微妙的问题:有效的目标必须等到延迟的观测到达之后才能计算。更关键的是,如果立刻把候选更新部署到策略中,更新后的策略会产生全新的动作序列,这些动作又反过来生成用于验证该更新的未来观测——候选更新“自己给自己出题”,因果循环被污染了。因此,可靠的预测式TTT必须同时回答两个问题:什么时候更新是有信息量的?以及如何在不允许候选更新影响验证轨迹的前提下评估它?
三大创新模块:MoLP、WPI与AGV-TTT
VANE的整体流程可以概括为一条流水线:MoLP决定“改哪里”,WPI提供“改的依据”,AGV-TTT决定“什么时候改、改了要不要上线” 。三者各自解决一个挑战,又串联成一个完整的可靠TTT框架。
混合潜提示词(Mixture of Latent Prompts,MoLP) 维护一个包含8个潜提示词的共享提示词库(latent prompt bank)。对于每一个控制时刻,路由器根据视觉-语言模型(VLM)最后一层输出的上下文向量c_t,用softmax计算每个提示词的选择概率,然后取Top-2加权合成最终的有效的提示词p_t。整个计算过程如下:
世界预测接口(World-Predictive Interface,WPI) 的设计动机很直接:既然当前时刻的状态目标“策略相关性”不足,那就去预测未来。论文冻结了一个V-JEPA 2编码器作为视觉表征提取器(f_ω),从当前观测和延迟k步的观测中分别提取视觉token序列Z_t和Z_{t+k}。当前token、路由后的提示词以及带噪动作token一起构成Latent-Action DiT的查询输入:
预测的监督信号来自延迟观测的冻结表征,训练损失为均方误差(MSE):
注意力门控与验证驱动的测试时训练(Attention-Gated and Validation-Driven Test-Time Training,AGV-TTT) 是VANE中最具工程巧思的部分。它把“何时更新”和“是否采纳更新”拆成两个独立环节。
“何时提出”由策略内部的注意力事件检测决定。论文通过对真实rollout的分析发现,机器人与物体接触、夹爪闭合、抓取后提升等交互转变时,动作查询到VLM图像块(以及预测性潜表征)的跨层注意力分布会出现显著重分布。论文定义了一个注意力变化分数Δ,本质上是相邻时间步之间跨层注意力分布的L1距离:
“是否上线”则由未来验证决定。AGV-TTT在事件触发时,于提示词库的“影子副本”上执行一步优化,得到候选提示词库;但实时策略继续用旧提示词控制机器人。随后,在接下来的H_v个有效的未来预测配对(WPI pairs)上,使用相同的输入、相同的注意力权重以及相同的流匹配随机噪声,分别评估旧提示词和候选提示词的未来预测损失。只有满足三重条件时,候选才被原子性地提交:
可以这样理解:注意力事件相当于提交了一个Pull Request,未来验证相当于CI测试,只有测试全部通过,PR才被合并到主干。整个流程保证了“提案数据—验证证据—部署执行”三者之间的因果隔离。
实验结果:WidowX提升3.8%,Google Robot提升10.4%
论文的实验在SimplerEnv模拟基准上展开,涵盖WidowX和Google Robot两套机器人操作套件。先看WidowX基准上与已有策略的对比:
效率与可靠性:减少98.7%计算开销的选择性适应
测试时训练最怕的就是把在线推理速度拖垮。很多TTT方法虽然精度有提升,但每一步都要反向传播,部署时计算开销大到无法接受。VANE恰恰在设计上把这一点考虑得很周全:全模型推断只做一次前向传播来生成动作,事件检测只是顺手收集注意力统计量,不增加额外计算。只有事件触发时,才在影子副本上执行一步提示词优化。
局限与展望:任务与体现依赖性的边界
值得肯定的是,论文没有回避局限性。Google Robot上的结果并非全面碾压,部署时的收益仍然是任务和形态依赖的。为了理解这一点,论文做了一个非常细致的分布偏移分析,对比WidowX和Google Robot两个套件相对于RT-1和Bridge训练数据混合参考集的视觉表征分布距离:
未来工作的方向也颇为清晰:将VANE扩展到更多样的机器人形态和任务类型,验证其在真实物理机器人上的表现;设计更精细的任务共享与特化均衡机制;以及探索在更长部署时域内保持验证协议可靠性的方法。VANE提供的不是一个“万能钥匙”,而是一套“如何可靠地使用测试时训练”的方法论。
龙迷三问
这篇论文到底在解决什么问题? VANE提出面向视觉-语言-动作模型的可靠测试时训练框架。通过上下文路由的混合潜在提示消除任务干扰,以未来视觉表征预测作为无标签自监督信号,再由注意力门控与未来验证选择性提交更新。
这篇工作最值得看的点是什么? 在WidowX上,VANE(QwenWPI+MoLP+AGV-TTT)达到71.2%的平均成功率,超过TTT-VLA的67.4%达3.8个百分点;在Google Robot上,QwenPi+MoLP+AGV-TTT达到76.7%,超过TTT-VLA的66.3%达10.4个百分点
这篇工作的边界或风险在哪里? 优点:1) 提出上下文路由的MoLP解决任务间干扰问题;2) WPI提供无需标签的未来预测代理目标;3) AGV-TTT通过影子更新和未来验证实现选择性、可逆的适应;4) 大幅降低计算开销。缺点:1) 在Google Robot上WPI并不总是优于状态接地;2) 方法复杂度较高,涉及多个组件;3) 跨任务和跨体现的泛化性有限
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出VANE框架,通过上下文路由的混合潜在提示(MoLP)、未来视觉表示预测接口(WPI)和注意力门控与验证驱动的测试时训练(AGV-TTT)实现可靠的VLA策略测试时适应。
实验合理度: ★★★★☆
任务成功率(%),WidowX四个任务的平均成功率,Google Robot的VM/VA设置下的成功率
学术研究价值: ★★★★☆
提出VANE框架,通过上下文路由的混合潜在提示(MoLP)、未来视觉表示预测接口(WPI)和注意力门控与验证驱动的测试时训练(AGV-TTT)实现可靠的VLA策略测试时适应;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
AGV-TTT相比Online TTT减少98.7%的反向传播调用(约75倍),平均每检查点612次候选反向传播vs 45,824次
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ;2) WPI提供无需标签的未来预测代理目标;3) AGV-TTT通过影子更新和未来验证实现选择性、可逆的适应;4) 大幅降低计算开销。缺点:1) 在Google Robot上WPI并不总是优于状态接地;2) 方法复杂度较高,涉及多个组件;3) 跨任务和跨体现的泛化性有限
主要参考文献
[1] Ji H, Xia G, Sun L, et al. VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction[J]. arXiv preprint arXiv:2608.09448, 2026.
[2] Brohan A, Brown N, Carbajal J, et al. RT-1: Robotics Transformer for Real-World Control at Scale[C]//Proceedings of Robotics: Science and Systems (RSS), 2023.
[3] Ebert F, Yang Y, Schmeckpeper K, et al. Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets[C]//Proceedings of Robotics: Science and Systems (RSS), 2022.
[4] Kim M J, Pertsch K, Karamcheti S, et al. OpenVLA: An Open-Source Vision-Language-Action Model[C]//Conference on Robot Learning (CoRL), 2024.
[5] Wei A, Chen K, et al. π0: A Vision-Language-Action Flow Model for General Robot Control[J]. arXiv preprint arXiv:2410.24164, 2024.
[6] He K, et al. V-JEPA 2: Robust Video Prediction and Understanding via Self-Supervision at Scale[J]. arXiv preprint arXiv:2506.09985, 2025.
[7] Li T, et al. TTT-VLA: Test-Time Training for Vision-Language-Action Models[J]. arXiv preprint arXiv:2509.06587, 2025.
[8] Li X, et al. SimplerEnv: Simulated Manipulation Policy Evaluation for Real-World Transfer[J]. arXiv preprint arXiv:2405.05943, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
机器人部署不用愁,VANE一出解烦忧。边干活边学习,选错还能自己“回滚”。想和龙哥一起追踪机器人学习前沿?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+理想汽车+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群