← 返回 PaperDaily 视觉与图像

机器人视觉新范式:不再看图识字,而是看“手”学动作

传统视觉编码器(如CLIP、DINOv2)再强大,也是用猫狗图片、风景照训练的,它根本不知道“抓杯子”需要看哪儿。这篇UC Berkeley和NVIDIA的CAIP,用地表最强的“人类第一人称操作视频”(Ego4D等)作为训练数据,让视觉编码器学会了看“手”和“物体接触点”。这招“用人类手部姿态代理机器人动作”,直接让灵巧操作任务成功率飙升30%,而且抗干扰

机器人视觉新范式:不再看图识字,而是看“手”学动作
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
xingqiu_header

龙哥推荐理由:
传统视觉编码器(如CLIP、DINOv2)再强大,也是用猫狗图片、风景照训练的,它根本不知道“抓杯子”需要看哪儿。这篇UC Berkeley和NVIDIA的CAIP,用地表最强的“人类第一人称操作视频”(Ego4D等)作为训练数据,让视觉编码器学会了看“手”和“物体接触点”。这招“用人类手部姿态代理机器人动作”,直接让灵巧操作任务成功率飙升30%,而且抗干扰能力极强。


原论文信息如下:
论文标题:
Contrastive Action-Image Pre-training for Visuomotor Control
发表日期:
2026年06月
发表单位:
UC Berkeley, NVIDIA, Sapienza University of Rome, Panasonic, ItalAI
...

动作在哪里?现有视觉编码器缺少什么

你让一个机器人去“拿杯子”,给它装上CLIP、DINOv2这些大名鼎鼎的视觉编码器——它们能认出杯子是“陶瓷的”“白色的”,甚至能理解“把手在哪里”。但对不起,它们完全不知道:手应该怎么伸过去、手指应该捏在哪里。原因很简单:这些编码器都是在互联网图片或图文对上训练的,从来没看过真实世界里“一只人手在操作”的画面。
UC Berkeley和NVIDIA的团队做了一个非常直观的视觉实验:他们把图像输入给不同的编码器,然后用编码器内部的注意力机制画出它们“最关心”的区域。下图左半部分可以看到,SigLIP(图像-文本对比学习)关注的是场景中的语义物体,比如桌上的瓶子、遥控器;DINOv2(自监督学习)关注的是几何结构,比如边缘和深度。但两者都完全不关注“手”和“手正在碰触的物体”——而这些恰恰是机器人执行操作任务时最需要的信息。
Figure 1
图1:(左)不同编码器关注的图像区域热力图。SigLIP关注高层语义,DINOv2关注视觉结构,但两者都忽略了与动作相关的区域;本文提出的CAIP编码器则产生以操作为中心的特征,聚焦于手和物体。(中)CAIP使用手部姿态与图像-文本进行对比学习对齐。(右)CAIP在多任务上表现显著优于SigLIP 2、DINOv2、MVP等。
插图
这就是当前机器人视觉的根本瓶颈:互联网数据规模巨大,但缺少“动作信号”;机器人数据带有精准的动作标签,但采集成本高昂,规模太小。有没有一种办法,能利用海量的人类操作视频,提取出“动作”信号来训练视觉编码器,让它变得“更懂操作”?CAIP(Contrastive Action-Image Pre-training)给出的答案非常巧妙——用人类手部姿态作为动作的代理。

CAIP:人类手部姿态成为动作代理

CAIP的核心洞察非常直接:人类在操作东西时,手的姿态和运动轨迹,天然就是机器人末端执行器动作的最佳替代品。如果能把“人手握杯子”的视频帧,和对应的“手部关键点位置”配对,然后用对比学习让视觉编码器学会:看到握杯子的画面,就能联想到对应的手部动作序列。这样得到的视觉特征,自然就包含了“动作信息”。
Figure 2
图2:CAIP的整体架构。使用一个ViT图像编码器、一个文本Transformer和一个动作Transformer。图像和文本经过注意力池化得到文本条件化的图像嵌入,与动作嵌入通过SigLIP对比损失进行对齐。
具体结构上(图2),CAIP包含三个编码器:
图像编码器:使用ViT-L/16(从SigLIP 2初始化),将输入图像分割成N个图块,保留所有图块特征,不进行全局池化,以便后续文本令牌能关注到空间局部细节。
文本编码器:一个24层Transformer,同样从SigLIP 2初始化,将自然语言指令转换为L个令牌特征。
动作编码器:一个轻量级4层Transformer,从头训练。输入是一段未来动作序列(T=64步,约2秒),每步包含42个关键点的9D姿态(共378维)。通过[CLS]令牌提取一个单一的动作嵌入。
关键的一步是文本条件化的图像注意力池化:先用文本令牌作为查询,对图像图块特征进行交叉注意力,得到文本引导的视觉特征;然后再用一个可学习查询令牌对这些特征进行注意力池化,最终得到一个“文本条件化的图像嵌入”。这个嵌入与动作嵌入通过一个SigLIP风格的sigmoid对比损失进行对齐。SigLIP(由Zhai等人于2023年提出)相比CLIP的softmax形式,对每个图像-动作对独立做二分类,不依赖全局归一化,在大批量训练时更稳定。
预训练完成后,图像编码器和文本编码器(可独立使用)可以冻结并迁移到下游策略中。下游策略使用一个小的Qwen3.5-0.8B Transformer作为序列模型,输入来自多个摄像头的视觉令牌和文本令牌,输出动作块。通过流匹配(flow-matching)目标来预测动作。

“AI模仿”如何利用32000小时视频“学会”操作

那么,CAIP到底用了多少数据?答案是:32,041小时的人类第一人称视频,外加88小时的桌面人形操作数据。这个体量对机器人领域来说堪称巨大——相比之下,大型协作机器人数据集DROID总量也仅有几百小时。这些视频来自Ego4D、Epic-Kitchens、EgoDex等公开数据集,覆盖了实验室和野外各种场景。
动作表示方面,CAIP使用MANO手部模型(由Romero等人提出)定义的42个关键点(每只手21个,包括手腕),每个关键点表示为SE(3)变换(位置+姿态)。然后构造64步的“动作块”:从当前帧到未来约2秒内,每隔1/30秒的手部相对姿态变化。这个形式与下游机器人策略需要的末端执行器增量控制完全一致——真是珠联璧合。
为了获得手部关键点,大部分野外视频通过姿态估计算法自动标注;实验室内的数据则使用Manus Metagloves Pro手套和Vive追踪器,得到毫米级精度的真实手部姿态。这部分高质量数据对于模型学到细粒度操作细节至关重要。
值得注意的是,预训练时不依赖任何机器人数据,下游微调时也仅使用每个任务200条机器人演示(倒水任务只用了150条)。这充分体现了CAIP利用人类视频进行动作中心预训练的范式优势。

真实世界成绩单:六大任务全优,全面超越现有模型

试验场选得非常有挑战性:一台Dexmate Vega双臂机器人,配备两只22自由度的Sharpa Wave灵巧手,共有44个自由度需要同时控制。三种摄像头输入(头部立体相机+两个手腕单目相机)。评估了六个精细操作任务:叠短裤、倒水、捡水果、挤肥皂、开灯、抽纸巾。每个任务只用了极少的演示数据(200或150条),每个任务测试12轮,取成功率。
Table 1
表1:六项真实世界操作任务的成功率对比。每个任务12次测试。CAIP在所有方法中平均成功率最高,达到76.04%。
结果令人振奋!CAIP的平均成功率达到76.04%,而最好的基线SigLIP 2只有43.4%,一下子提升了超过30个百分点。在六个任务中,CAIP在五个任务上取得最高成功率,包括叠短裤(68.75% vs. 第二名MVP 54.17%)、倒水(83.33% vs. 第二名DINOv2 81.25%、挤肥皂(100%)、开灯(75%)、抽纸巾(72.92%)。特别是挤肥皂和抽纸巾这些需要精确力控的任务,CAIP的绝对优势意味着其学到的视觉表示真正理解了“需要施力”的部位。
特别值得强调的是,CAIP使用的是较小的ViT-L骨干网络,却超过了使用更大ViT-SO400M的SigLIP 2——这说明性能提升主要来自以动作为中心的对比预训练,而非模型容量。
插图
更厉害的是,CAIP在零样本动作分类任务上也展现出强大的泛化能力。作者在一个完全未见过的hold-out数据集中,对动作片段进行K-means聚类(K=50),然后使用CAIP的图像特征进行线性探针和零样本检索。结果如图3所示,CAIP在所有样本数量下的线性探针准确率都远超其他编码器,而且零样本检索(无需任何监督数据)的准确率甚至超过了其他方法在使用16个样本时的线性探针结果。
Figure 3
图3:在保留数据集上的线性探针和零样本动作分类结果。CAIP在所有训练样本数量下均显著优于基线,且零样本检索性能甚至超过部分基线的线性探针。

不只是“抄作业”:面对干扰和黑暗环境同样表现稳健

一个优秀的视觉编码器不能只在标准条件下work——真实世界中光照会变、场景里会多出乱七八糟的物体。CAIP团队专门设计了鲁棒性测试,在两个典型场景下考验所有编码器。
光照变化:分为“增强光照”(额外加一盏灯)和“暗光”(降低标准照明)。结果如表2所示,CAIP在所有光照条件下的平均成功率都最高。尽管所有编码器在光照变化下性能都下降,但CAIP的绝对成功率仍然是最高的——例如在暗光下平均43.06%,而MVP只有17.36%。
Table 2
表2:不同光照条件下的策略成功率。CAIP在所有条件下保持领先,特别是在暗光下绝对优势明显。
干扰物:在操作区域放置两件与任务无关的物体(红色书本和彩色汉诺塔),且位置随机变化。结果如表3所示,CAIP平均成功率52.78%,远高于Qwen3.5 ViT的28.47%和MVP的9.72%。MVP在这个测试中几乎崩溃(从52.08%掉到9.72%),而CAIP只从81.25%降到52.78%,降幅远小于MVP。
Table 3
表3:添加干扰物时的策略成功率。CAIP在两种条件下均大幅领先。
插图
这些结果强有力地说明:CAIP学到的不是“背演示样本”的表面特征,而是真正理解了“操作意图”——即使场景变化,它仍然能识别出哪里是需要交互的关键区域。

局限与未来:更泛化的动作理解和迁移

虽然CAIP效果惊艳,但作者也坦诚指出了两点核心局限:
负采样问题:当前对比损失将批次内所有非对角线上的图像-动作对都视为负样本。但在连续动作空间中,两个不同时间点或不同场景下的动作可能非常相似(比如两个不同的倒水动作),将它们强行推开反而会混淆表示。未来可以探索“软对比学习”,根据动作空间距离赋予负样本不同的权重。
拟人化偏差:CAIP的动作表示基于人类手部42个关键点(MANO骨架),天然偏向五根手指的灵巧手。虽然这与实验中使用的Sharpa Wave灵巧手高度匹配,但对于平行爪夹、三指爪等非拟人化机械手,是否能有效迁移还是开放问题。未来需要在更多机械手形态上评测。
此外,笔者认为当前架构在动作编码器上还有提升空间——只用4层轻量Transformer处理64步×378维的动作序列,或许可以引入时序卷积或扩散模型来捕获更复杂的动作模式。但无论如何,CAIP用32000小时人类视频+对比学习证明了“人类手部姿态作为机器人动作代理”这个范式的巨大潜力,相信很快会有更多团队跟进。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

CAIP与R3M、MVP等“动作相关”预训练方法到底有什么区别?R3M使用时间对比损失(让邻近帧特征相似,远距离帧特征不同),MVP使用掩码自编码器(预测被遮挡的像素),两者都没有明确使用“动作标签”。CAIP的核心创新是在预训练阶段直接使用了手工标注或估计的人类手部姿态作为显式的动作信号,并通过对比学习让视觉表示与这个动作信号对齐。这是本质区别——CAIP学到的表示天然具有“动作意识”。

实验中提到的“SigLIP”和“SigLIP 2”是什么?SigLIP(Sigmoid Loss for Language Image Pre-training)是Google在2023年提出的一种改进的对比学习损失,用sigmoid二分类替代CLIP的softmax分类,训练更稳定。SigLIP 2是2025年的升级版,使用更大的模型和数据。CAIP本身就是从SigLIP 2的ViT和文本编码器初始化的,说明起点的图像-文本对齐能力已经不错,但加上动作对比预训练后又能大幅提升。

CAIP的下游策略训练需要多少机器人数据?训练时长如何?每个任务只用了200条演示(倒水150条),训练是从头开始(策略的Qwen Transformer随机初始化)并冻结CAIP视觉编码器。实验中使用4090 GPU,每个任务训练约2-3天。相比之下,如果使用端到端视觉语言动作模型(如RT-2),动辄需要数万条演示。CAIP的数据效率非常亮眼。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

在机器人视觉预训练中首次提出使用显式人类手部姿态作为动作代理,并通过对比学习对齐,思路新颖巧妙,与现有方法形成了本质差异。

实验合理度:★★★★★

对比了8种主流基线(包括图像、视频、机器人预训练等方法),在6个真实任务、3个光照条件、2个干扰物条件下进行充分验证,实验设计严谨,结果令人信服。

学术研究价值:★★★★★

开创了“人类手部姿态作为动作代理进行视觉预训练”的新方向,为利用海量人类视频改善机器人感知提供了清晰的思路,对后续研究有很强的启发性。

稳定性:★★★★☆

在光照变化和干扰物测试中表现出较强的稳定性,但降幅仍不可忽略(约20-30%绝对成功率损失),且实验仅在一种机器人上完成,普适性有待验证。

适应性以及泛化能力:★★★★☆

零样本动作分类实验证明了很好的泛化能力,但下游任务仅限于灵巧手操作,未验证到其他形态(如平行爪夹、轮式移动操作),当前得分合理。

硬件需求及成本:★★★★☆

预训练阶段需要32000小时视频和昂贵的手部标注,算力需求大;但下游微调成本低,且编码器可冻结使用,推理时与常规ViT速度相当,总体可接受。

复现难度:★★★☆☆

代码和数据均未开源,预训练需要整理和标注大批量视频数据,复现门槛较高;不过架构设计清晰,如果开源核心权重则难度可大幅降低。

产品化成熟度:★★★☆☆

目前仅在特定灵巧手上验证,离通用产品化还有距离。但概念验证非常成功,特别适合仿人机器人公司(如Figure AI、特斯拉Optimus)作为视觉预处理模块。

可能的问题:论文的消融研究较薄弱(仅做了骨干网络规模消融),没有系统分析不同数据来源、损失函数、动作表示维度的影响。此外,对负采样和拟人化偏差的讨论过于简短,未能提供缓解方案。总体瑕不掩瑜。


主要参考文献

[1] Radford, A. et al. Learning transferable visual models from natural language supervision. ICML 2021. (CLIP)
[2] Zhai, X. et al. Sigmoid loss for language image pre-training. ICCV 2023. (SigLIP)
[3] Oquab, M. et al. DINOv2: Learning robust visual features without supervision. 2024.
[4] Radosavovic, I. et al. Real-world robot learning with masked visual pre-training. CoRL 2022. (MVP)
[5] Nair, S. et al. R3M: A universal visual representation for robot manipulation. CoRL 2022.
[6] Zhang, Q. et al. Qwen3.5: A family of large language and vision models. 2025.
[7] Romero, J. et al. Embodied hands: Modeling and capturing hands and bodies together. ACM TOG 2017. (MANO)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。