← 返回 PaperDaily
视觉与图像
CVPR 2026中山大学新作:人形机器人告别模仿秀,学会真交互,成功率75.4%
这篇CVPR 2026论文把“人形机器人与人握手拥抱”这个老大难问题拆成了数据与策略两半:先用PAIR把海量人人交互视频变成物理一致的人机交互数据,再用D-STAR把“何时动”和“往哪动”解耦开,仿真平均成功率75.4%,还真正跑上了宇树G1真机。做机器人交互落地的人,值得细读。
龙哥读论文
阅读 1
查看原文

原论文信息如下:
人形机器人要真正进入人类的日常生活,光会走路、抓取可不够。“能否像人一样,和我们握手、拥抱、击掌”,才是从“机器”走向“伙伴”的关键一步。然而这一步并不好走,两个硬骨头卡在路中间:一是高质量的人-人形机器人交互数据极度稀缺,二是现有策略学到的基本是“动作模仿秀”,而不是真正的交互理解。
为什么数据难得?因为靠遥操作采集人与机器人全身交互数据,又慢又贵还有安全风险;换一条路,把网上海量的人与人交互视频“翻译”成人机交互数据,听起来很美,但传统重定向方法一碰到形体差异就翻车——最典型的画面就是:两个真人握手握得好好的,重定向到机器人身上,因为身高臂展对不上,直接握了个寂寞。为什么策略难学?因为人机交互是双向动态过程,机器人要理解对方动作的阶段与意图,并且实时调整自己的接触位置和发力时机。传统模仿学习只会把轨迹“平均化”,机械地复读动作,一旦对方身形、速度变了就彻底抓瞎。
引言
这篇论文就是冲着这两个硬骨头去的,名字很直白:Beyond Mimicry,超越模仿。中山大学团队提出了两套配合紧密的组件,把“人人交互”(Human-Human Interaction,HHI)的数据和知识,迁移到“人形机器人与人交互”(Human-Humanoid Interaction,HHoI)的任务上。
第一件武器叫PAIR(Physics-Aware Interaction Retargeting,物理感知交互重定向)。它的任务是:把人与人交互的数据,转换成物理一致、接触语义不丢的人机交互数据。第二件武器叫D-STAR(Decoupled Spatio-Temporal Action Reasoner,解耦时空动作推理器)。它的任务是:让机器人真正理解“什么时候该动”和“往哪里动”,而不是简单复现轨迹。
整体思路用一句话概括:数据层面靠PAIR把“人人交互”翻译成“人机交互”,策略层面靠D-STAR把“时序意图”与“空间目标”解耦,再交给扩散模型去生成全身动作。这个设计不但在Isaac Gym仿真里拿到了75.4%的平均成功率,还把模型真正部署到了宇树G1机器人上,靠文本指令就能完成拥抱、握手和击掌。
聊到人形机器人,大家最爱看的永远是“它能跟人互动成什么样”。但真正做研究的人知道,每一次看似流畅的握手背后,都藏着两个让人头秃的问题:数据从哪来?策略怎么学?这两个问题不解决,机器人就只能停留在“自己跳支舞”的阶段,永远进不了“跟你搭把手”的日常。中山大学这篇CVPR 2026论文,给出的答案值得细品。
从人人交互到人机交互:数据瓶颈如何破局?
先把两个缩写理清楚。论文里反复提到的HHI,全称是Human-Human Interaction,也就是人人交互——两个真人之间的互动,这类数据网上到处都是,视频网站随便一搜就是海量素材。HHoI则是Human-Humanoid Interaction,人形机器人与人交互,这才是机器人真正走进日常生活需要掌握的核心技能。
问题来了:HHoI数据从哪来?一条路是遥操作采集,让操作员远程操控机器人跟真人互动,一条条录。这种方法数据保真度确实高,但成本高、速度慢,还有安全风险,想靠它攒出一份大规模多场景的交互数据集,既烧钱又烧时间。另一条路更聪明:把现成的HHI数据“翻译”成HHoI数据。这个翻译过程在学术圈有个专门的名字,叫运动重定向(Motion Retargeting)。可翻译这个活儿,远比听起来麻烦。
传统重定向方法普遍只有一个目标:让机器人的关节运动轨迹尽量贴近源真人的关节运动轨迹。在单人动作上,这个逻辑没问题;可一旦碰上双人交互,它就当场翻车。看下图:两个真人面对面握手,源数据里两只手严丝合缝地扣在一起。可套上机器人模型后,因为骨骼比例、关节限位都不一样,机器人伸出去的手和对方的手之间生生隔出一段距离,握了个寂寞。人类之间这种“亲密接触”,在重定向这一步被硬生生拆散了。
这种“形似而神不似”的结果,根源在于传统方法把“像不像”放在了“接触对不对”前面。可接触恰恰是交互的灵魂——手没握上,动作再标准也白搭。既然如此,能不能专门设计一个以“接触语义”为核心的重定向方法?这便是论文第一个核心组件PAIR登场的理由。
PAIR重定向:如何保住交互中的“接触”本质?
PAIR全称Physics-Aware Interaction Retargeting,物理感知交互重定向。它的设计思路很清晰:把“运动学相似”和“物理接触保持”分开对待,再用一个统一的优化目标拧在一起。整体损失函数长这样:
Lretarget = wcon·Lcon + wkin·Lkin + whum·Lhum + wreg·Lreg
第一项 Lkin,运动学相似损失。它度量机器人全局关节位置与“重塑后的源人体骨架”之间的差异,目的是让机器人的动作风格看起来还是原汁原味的人类动作。这里有个关键操作叫骨架重塑(Reshaped):先骨盆对齐,再按比例缩放骨骼长度,最后固定关节对应关系。为什么要重塑?因为人跟机器的骨骼比例差太多,直接硬套,即使动作幅度一模一样,关节位置也对不上。
第二项 Lcon,交互接触保持损失。这是PAIR的灵魂。它没有用“点到点”的脆弱约束,而是构造了一个N×N的全对成对距离矩阵——把头部、双肩、双肘、双腕这些关键点的两两距离全部算出来,然后要求重定向前后的距离矩阵保持一致。这个设计的妙处在于:它同时保住了“该接触的地方有接触”和“不该贴脸的地方保持社交距离”,从整体上锁住交互的物理语义。公式里的Dopt和Dorig分别是优化后和原始的距离矩阵,用Frobenius范数度量差异。
Lcon的公式写法是:Lcon = (1/T) · Σt=1..T ‖Dtopt - Dtorig‖F2,其中T是总帧数,Dt是第t帧的距离矩阵。
第三项 Lhum,人体动作保真损失。严格保接触,可能导致机器人对面那位真人被“拽”进不自然的姿势。Lhum约束的是人类伙伴的动作漂移程度:允许对方为了配合机器人做微小调整,比如手臂抬高一点,但不能整个人都被带出原本的行为轨道。论文里只对上肢的肩、肘、腕做选择性适应,避免整体姿势失控。
第四项 Lreg,物理合理性正则。包含时间连贯损失和姿势正则损失,用来惩罚高频抖动和越界的关节角度,保证优化出来的动作平滑自然,不会出现机械舞式的抽搐。
目标函数立起来了,但优化它本身就是个新难题。四个损失项叠成高维非凸的优化地形,直接一把梭很容易掉进“差几厘米握不上”的局部最优。论文给出的解法非常有工程感:两阶段优化策略(Two-Stage Optimization)。第一阶段,全局运动学初始化,用适中的接触损失权重对整个序列做一次全局搜索,先把机器人摆到运动学合理、整体结构正确的“盆地”里;第二阶段,接触与稳定性精炼,以上一阶段结果作为暖启动,把接触损失权重显著拉高,集中火力修正细小的接触错位,把“差之毫厘”变成“严丝合缝”。
效果如何?论文里跟Simple MSE(直接关节位置均方误差)、IK Baseline(逆运动学追踪)、Orient Base(基于朝向的方法)以及ImitationNet(当前无监督重定向的代表方法)做了对比。在接触保持上,PAIR在0.35米阈值下的F1分数达到0.841,比ImitationNet的0.502高出67.5%,比最强的非交互基线Simple MSE也提升了22.2%。同时,PAIR的运动学相似性是最好的(JPE降到0.174米),动作也明显更平滑,Jerk均值比Simple MSE低了69%。
消融实验也很有意思。去掉人体动作适应(w/o Human Adaptation)或去掉接触损失(w/o Contact Loss),F1分别掉到0.823和0.821;最要命的是把两阶段优化合并成一步,F1直接掉到0.788。这说明三个设计环环相扣:接触损失提供方向,人体动作适应留出调整空间,两阶段优化负责把解从局部泥潭里拽出来。
D-STAR策略:解耦“何时行动”与“何处行动”的智慧
数据这道坎跨过去之后,另一个问题浮出水面:拿高质量数据去训练策略,传统的模仿学习够用吗?论文的答案很干脆:不够。
传统行为克隆(Behavior Cloning,BC)的本质,是让预测动作与示范动作的均方误差最小化。这在单人任务上还行,可一到交互场景就露馅了:它学到的是所有示范的“平均轨迹”,一旦人类伙伴的动作速度、身体尺寸、出手角度稍有变化,机器人就不知所措。它只会“照着重放”,不会“看着回应”。
这就是D-STAR(Decoupled Spatio-Temporal Action Reasoner,解耦时空动作推理器)登场的逻辑。D-STAR的核心思想一句话就能概括:把“什么时候动”和“往哪里动”两个问题拆开思考,再融合决策。
D-STAR是一个分层策略,输入过去12帧的观测历史(当前帧加11帧历史),每一帧包含机器人自身状态(关节角度、角速度等)和人类的SMPL关节点位置。SMPL全称Skinned Multi-Person Linear Model,是一种参数化的人体网格模型,可以理解为把人体骨架和表面网格用一个紧凑的向量表示出来,方便机器人“看懂”对方。
第一层是长短期时间编码器(Long-Short Temporal Encoder,LSTE)。它用两个并行的Transformer编码器:长期编码器看完整的12帧历史,负责理解整个交互的阶段走向;短期编码器只看最近的几帧,负责捕捉当下瞬间的精细协调。两个编码器的输出拼接成时间特征ftemp,公式为:
ftemp = Concat(Elong(Ot-h+1:t), Eshort(Ot-h′+1:t))
Phase Attention(PA)——“何时行动”分支。交互天然有节奏:一次握手,先有接近举手的“准备”阶段,然后是手掌接触的“行动”阶段,最后是松开回位的“跟随”阶段。PA把交互划分成这三个阶段(Preparation、Act、Follow-up),根据当前观测预测所处阶段,再用阶段信号去调制自注意力权重。握手刚一开始,机器人盯的是对方伸过来的手和躯干;接触那一瞬,注意力集中到手掌对齐上。这种阶段感知设计,让时序推理不会被空间上的杂音干扰。
Multi-Scale Spatial模块(MSS)——“何处行动”分支。MSS从三个尺度编码人机几何关系:绝对位置、成对距离、相对朝向,分别用专用编码器映射到空间特征。远近中三层线索全收进来,告诉扩散规划头“该往哪儿够”。一个负责节奏,一个负责位置,两者各管一摊,谁也不干扰谁。
两个分支的特征最后汇入一个基于扩散模型的规划头。扩散头生成高层参考动作,这个目标再交给全身控制器(Whole-Body Controller,WBC)转成实际关节指令。整套系统的高层策略以5Hz更新,底层控制器跑在50Hz,中间靠轨迹点混合和调度来衔接,保证机器人既跟得上交互节奏,又站得稳。
还有个细节值得注意:策略输入里拼了一段文本指令token,用来指定交互类型,比如“握手”“拥抱”“击掌”。部署时不需要针对每个任务换权重,同一个模型参数靠文本切换交互方式,泛化能力的气象一下就出来了。
仿真与真实机器人上的全面验证
仿真评测在Isaac Gym物理引擎里进行,机器人用的是宇树G1人形机器人,控制频率50Hz。评测任务一共六个:拥抱(Hug)、击掌(High-Five)、握手(Handshake)、挥手(Wave)、弯腰(Bend)、飞吻(Fly-Kiss)。基线阵营拉得很齐,有最朴素的Naive Mimicry(纯行为克隆),还有Pure RL(按任务单独训练的PPO策略,用无阈值的成形奖励)、TCN Policy(时间卷积网络策略)、Transformer Policy,以及Diffusion Policy(扩散策略)这几个有代表性的架构。所有方法都用同一份PAIR生成的数据、同一个底层控制器,保证对比公平。
结果相当有戏剧性。Naive Mimicry六个任务全军覆没,成功率全为0。这个结果虽然惨烈,但深刻反映了纯行为克隆在交互任务里的无力:它只会复现平均轨迹,完全不理解对方在干嘛。Pure RL靠精心设计的奖励函数拿到51.6%的平均分,但击掌只有7.4%,说明纯试错式强化学习在需要精确接触的任务上还是力不从心。特别有意思的是Diffusion Policy,同样是扩散模型架构,同样是模仿学习,换成单层条件扩散后平均只到58.7%,击掌直接掉到3.7%——同一个坑里摔两次。
D-STAR的表现就突出一个稳:平均75.4%,比最强基线Transformer Policy高出11.1个百分点。分任务看,拥抱做到100%,握手61.3%,击掌40.7%。接触越复杂、时序要求越高的任务,D-STAR的优势越明显,解耦设计在“精准发力”上的价值得到了验证。消融实验也印证了这一点:去掉PA,平均掉到65.9%,握手从61.3%跌到45.2%;去掉MSS,平均64.3%,握手直接掉到32.3%。两个分支谁也替代不了谁。
再看鲁棒性。表4把人类伙伴的体型缩放(0.8x到1.2x)和运动速度(0.8x到1.2x)联合起来做了25种组合测试。中心位置是标准情况,成功率75.4%;往四周走,成功率从70附近逐渐滑落到62-68,始终没有出现崩塌式下降。这种“平稳缓坡”式的退化曲线,说明D-STAR学到的不只是死板的轨迹,而是真正理解了交互的意图与空间几何的关系。
仿真表现是一方面,真机才是检验工程成色的试金石。论文把D-STAR部署到一台宇树G1上,采用标准全身控制器,唯一的外部感知设备是一台Logitech C1000e RGB摄像头(1280×720@30fps)。人类伙伴的运动状态通过4D-Humans方法做单目SMPL重建,再经过外参标定映射到机器人基座坐标系。
真机系统有个不小的难点:机器人端感知是异步的,视觉帧率30fps,而策略控制需要50Hz,中间全靠状态估计和时间对齐来弥合。即便如此,D-STAR在真机上还是通过文本指令完成了拥抱、握手、击掌三个任务的执行验证。论文明确指出,定量对比保留在仿真里以保证不同控制器之间的公平性,真机试验主要用来验证实际可行性。这种“仿真打榜、真机闭环”的做法,已经比大多数只给仿真demo的工作实诚得多。
超越模仿:迈向真正的人机协作
从数据重定向到策略学习,这篇论文打通了一条完整的链路:HHI数据 → PAIR重定向 → HHoI数据集 → D-STAR策略训练 → 仿真验证 → 真机部署。每一个环节容易丢失的物理语义和交互信息,都被上游的结构性设计尽量保住。
往深了看,PAIR的价值不止于这一篇论文。它验证了一个重要思路:当机器人和人的形态差异无法被简单抹平时,与其硬抠关节角,不如保住“交互关系矩阵”这种更高层的语义。这个思路放到任何涉及人机接触的任务里都成立,比如护理辅助、协作装配、康复训练。而D-STAR的解耦设计也点醒了一件事:交互控制不该把时序和空间一锅炖,分开推理再融合,才是符合直觉的做法。
当然,眼前的局限也肉眼可见:真机任务只有三个,仿真里的动作库也不算大;真机没有做定量成功率评测,稳定性评估主要靠仿真;单目SMPL重建在高动态交互中的误差还没有被充分讨论。这些都是后话,但方向上,这篇论文已经把人形机器人交互从“模仿秀”拉到了“真参与”的赛道上。
交互,终究不只是一套动作,而是对一个活生生个体的回应。这大概就是“超越模仿”四个字的分量所在。
龙迷三问
这篇论文到底在解决什么问题?本文提出PAIR物理感知交互重定向与D-STAR解耦时空动作推理器,从海量人人交互数据中生成物理一致的人机交互数据并学习具身交互策略。仿真六类交互任务平均成功率75.4%,并在宇树G1真机上完成部署验证,超越简单轨迹模仿。
这篇工作最值得看的点是什么?PAIR在接触保持F1@0.35m达到0.841,相比ImitationNet提升67.5%;D-STAR平均成功率75.4%,显著超越Transformer(64.3%)和Diffusion Policy(58.7%);在Hug任务达到100%成功率,Handshake达到61.3%。
这篇工作的边界或风险在哪里?优点:(1)提出PAIR解决数据稀缺问题,通过接触感知重定向生成物理一致的HHoI数据;(2)D-STAR解耦时空推理,分别处理"何时行动"和"何处行动";(3)在仿真和真实机器人上均验证有效性。缺点:(1)真实机器人实验仅验证3种交互类型,未覆盖全部6种;(2)策略对较大体型合作伙伴的鲁棒性下降;(3)依赖单目RGB的SMPL感知,在复杂环境下可能受限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
提出PAIR物理感知交互重定向管线将人人交互数据转化为物理一致的人-人形机器人交互数据,并设计D-STAR解耦时空推理分层策略实现超越简单模仿的全身交互控制。
实验合理度:★★★★☆
重定向评估:JPE、AWD、多阈值接触Precision/Recall/F1/Accuracy、LargeAngle、AngleStd、Jerk Mean/Std;
学术研究价值:★★★★☆
提出PAIR物理感知交互重定向管线将人人交互数据转化为物理一致的人-人形机器人交互数据,并设计D-STAR解耦时空推理分层策略实现超越简单模仿的全身交互控制;更关键的是问题定义是否可复用到同类任务。
稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本:★★★☆☆
策略以5Hz频率运行,预测5个锚点覆盖2秒时域;未报告具体FLOPs。
复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题:,通过接触感知重定向生成物理一致的HHoI数据;(2)D-STAR解耦时空推理,分别处理"何时行动"和"何处行动";(3)在仿真和真实机器人上均验证有效性。缺点:(1)真实机器人实验仅验证3种交互类型,未覆盖全部6种;(2)策略对较大体型合作伙伴的鲁棒性下降;(3)依赖单目RGB的SMPL感知,在复杂环境下可能受限。
主要参考文献
[1] Huang, Wei-Jin, et al. "Beyond Mimicry: Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations." CVPR 2026. https://openaccess.thecvf.com/content/CVPR2026/papers/Huang_Beyond_Mimicry_Learning_Whole-Body_Human-Humanoid_Interaction_from_Human-Human_Demonstrations_CVPR_2026_paper.pdf
[2] Chi, Cheng, et al. "Diffusion Policy: Visuomotor Policy Learning via Action Diffusion." RSS 2023.
[3] Goel, Shubham, et al. "4D-Humans: Reconstructing and Tracking Humans in 4D." CVPR 2023.
[4] Rudin, Nikita, et al. "Isaac Gym: High Performance GPU-Based Physics Simulation for Robot Learning." NeurIPS 2021 Datasets and Benchmarks.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!