← 返回 PaperDaily 前沿研究

北京大学×北京人形机器人创新中心:人形机器人全身移动操作,七项真机任务平均70.5%

论文基本信息据官方论文与项目页整理;正文不展示普通作者姓名。

论文基本信息据官方论文与项目页整理;正文不展示普通作者姓名。

龙哥导读

人形机器人最难的,往往不是“手能不能抓”,而是走过去、弯下腰、稳住身体、双手接力之后,动作还能不能连成一件完整的事。人形适配框架(HAF)没有重新训练一套专用人形基础模型,而是给通用视觉—语言—动作模型加上“先站稳、再伸手”的生成顺序,再把部署期纠偏压进低频噪声空间。七项真机任务的平均归一化进度分由最强基线的53.3%提高到70.5%,但代价、指标口径和极端场景边界同样值得细看。

一个机器人从床上拿起衣服,转身走向洗衣机,再把衣服塞进去。这里面到底有几个动作?对人来说是一口气,对机器人来说却是底盘速度、头部视线、腰部姿态、双臂关节和手部控制共同参与的长链条。任何一环先抖一下,后面的手就要拼命补偿。

所以这篇论文真正追问的不是“再造一个更大的机器人模型”,而是:能否把已有的通用视觉—语言—动作模型,改造成更懂人形身体结构、又能在真机上继续学习的控制器?

官方真机演示节选:机器人完成衣物拿取、移动与双臂放置。它展示的是连续执行过程,不等同于统计意义上的任务成功率。

官方真机演示节选:机器人下蹲抓取篮筐并进行全身搬运,能直观看到腿、腰与双臂需要同步配合。

01 这不是机械臂任务,而是一条会互相“传染错误”的身体链

桌面机械臂通常有稳定底座。相机看到杯子,手臂规划轨迹,底座不会突然向前挪半步。人形机器人则不同:它一边走一边看,一边调腰一边伸手;脚下速度稍有误差,躯干会补偿,躯干一补偿,末端执行器的位置又变了。论文把这种问题概括为移动、躯干姿态与双臂操作之间的高维耦合。

常见通用模型习惯一次性生成整个动作块。数学上很干脆,身体上却未必合理。它可能同时决定“往哪走”“腰怎么转”“手怎么抓”,但没有显式强调这些决定的先后依赖。于是,一个错误的移动命令可以诱发上半身不稳定补偿,最终让抓取精度下降。

层级动作流视觉—语言—动作模型(HAF-VLA)的思路很朴素:先确定移动和视线,再加入腰部,最后展开双臂精细操作。这不是把身体彻底拆成互不相干的三个控制器,而是在同一个共享动作专家里,逐级扩大允许生成的动作维度。

第二个问题发生在部署之后。离线模仿学习只见过示范分布,一旦桌子挪了、起点偏了、路径多了一把椅子,策略就可能掉分。直接在线微调整个大模型既贵又危险:真机探索不是游戏里重开一局,猛烈抖动可能伤设备,也可能破坏原本学到的动作先验。

于是论文又加入频谱潜空间强化学习(HAF-Steer):不改大模型参数,只调整动作生成最初的噪声,而且不是在全部时间步上胡乱搜索,而是只学习少量平滑的低频变化。可以把它理解成:主体舞步不推倒重练,只在节奏和重心上做有限纠偏。

根据论文方法整理:上层改变动作生成顺序,下层在冻结模型的低频噪声空间进行部署期适配。

02 第一段方法:把“先站稳再干活”写进动作生成顺序

设机器人当前观察为 ot=(It,qt):其中 It 是头部相机图像,qt 是本体状态;语言指令记为 。模型要预测未来长度为 H 的动作块 At,每一步有 D 个控制维度。论文实现中 H=100,但机器人每轮只执行前40步,然后重新观察、重新规划。

单步动作被拆成四组:移动与技能模式 amove、头部朝向 ahead、腰部姿态 awaist、双臂操作 amanip。作者再构造三个逐级扩大的动作集合:

A¹ = 移动 ∪ 头部;A² = A¹ ∪ 腰部;A³ = A² ∪ 双臂操作

第一阶段先给出移动、技能模式与视线;第二阶段扩大到腰部,让躯干姿态适配操作空间;第三阶段才激活完整身体,输出最终可执行动作。关键细节是集合“累积”而非“锁死”:后阶段仍可修正前阶段已经生成的维度。比如加入腰部后发现原移动速度不利于下蹲,第二阶段仍有机会一起调整。

官方HAF-VLA结构图。左侧视觉、语言和机器人状态先形成共享前缀;中间三阶段逐级扩大动作空间;右侧仅部署第三阶段完整动作块。

三阶段并不是三套独立大模型。它们共享同一个动作流专家参数,用阶段嵌入告诉模型“现在做到哪一步”。视觉和语言前缀缓存只计算一次,减少重复开销。每个阶段从独立高斯噪声开始做10步流去噪,总共30步。

真正把阶段串起来的是跨阶段键值缓存。第一阶段的干净动作会被重新编码成缓存 ,送给第二阶段;第二阶段结果再形成 ,与 一起送给第三阶段。于是后面的手臂生成不是只看图像和文字,还能“读到”前面预计怎样移动、怎样调整腰部。

论文的式(2)可以用白话重写成三句:先由噪声、视觉语言前缀和阶段标记生成第一阶段动作;把它编码成缓存;随后每一阶段都在原有条件上增加前序动作缓存。缓存传递的不是一句抽象提示,而是已经去噪的动作上下文。

训练时,作者没有直接拿模型前一阶段的预测去喂后一阶段,而是采用教师强制:用真实动作的对应部分构造缓存。好处是避免训练早期错误层层放大;代价是训练和推理之间仍有差距,因为部署时缓存最终来自模型自己的预测。

流匹配目标也按阶段掩码计算。噪声动作 Xsτ 由真实动作与高斯噪声按时间 τ 插值得到,再乘以该阶段的二进制动作掩码 ms;目标速度是“真实动作减噪声”,同样只在当前激活维度上学习。三个阶段损失等权相加,共享参数一起更新。

这套设计的工程判断很明确:人形机器人的动作维度虽然可以放进一个向量,但身体结构不是一袋互不相关的数字。把运动学依赖显式写进生成流程,可能比单纯增加去噪次数更有效。

03 第二段方法:把在线强化学习压缩到8个低频系数

如果第一段是在改“动作怎么出生”,第二段就是改“动作到现场后怎么纠偏”。流匹配模型从初始噪声 εt 出发,在视觉、语言和机器人状态条件 ζt 下生成动作块:

At = Fθ(εt | ζt),强化学习期间 θ 完全冻结

直接学习完整噪声意味着要搜索 H×D 个变量。动作跨度越长、关节越多,空间越大。另一种极端做法是只学一个 D 维噪声向量,再把它重复到整个时间轴,维度是小了,却丢掉了动作随时间变化的能力。论文报告,这类重复噪声在全身真机训练中会造成剧烈身体抖动和不安全瞬态。

HAF-Steer选择中间路线:对时间轴采用离散余弦变换技术(DCT),只保留前 K=8 个低频系数。低频可以表达缓慢抬手、重心迁移、速度增减等平滑变化,同时过滤许多高频抖动。搜索空间由 H×D 变成 K×D,在本文中就是从100个时间位置压到8个频率位置。

官方HAF-Steer结构图。上方把专家动作逆推为噪声并压缩成频谱监督目标;下方策略输出频谱动作,经逆变换还原噪声,再由冻结模型生成真机动作。

问题来了:专家示范只有动作,没有对应的初始噪声,监督信号从哪来?作者利用流映射可数值反演的性质,把专家动作 A*i 沿固定流场反向积分,恢复出噪声 ε*i。这里的 F-1 不是另训一个逆模型,而是对原流场做数值反向积分。

随后计算前8个离散余弦系数 c*i,再用全示范集统计量 μcσc 标准化,得到专家频谱动作 z*i

ε* = F-1θ(A* | ζ*);c* = DCTK(ε*);z* = (c*−μc)/(σc+δ)

δ 是防止数值除零的小常数。离线回放里保存当前状态、专家频谱目标、奖励、下一状态和终止标记。奖励非常稀疏:成功轨迹的终止转移记1,其余过程记0。

训练分两步。第一步是行为克隆,让策略均值 μψ(x) 靠近专家频谱动作 z*。第二步才进入离线与在线混合的软演员—评论家强化学习。每个批次同时采样离线示范和在线真机经验;所有样本参与价值学习,行为克隆正则只约束离线专家样本,防止在线探索把策略迅速带离可靠示范。

策略损失里有三股力量:熵项鼓励探索;双评论家取较小值,降低价值高估;行为克隆项把策略拽回专家附近。随着训练推进,离线样本比例逐步下降,让系统从“先像专家”过渡到“再适应现场”。

推理时,策略先采样标准化频谱动作 zt,恢复系数 ct,用逆离散余弦变换补零重建完整时间噪声 εt,最后交给冻结的动作流生成动作。强化学习改变的是“从哪里开始去噪”,不是把整个视觉—语言—动作骨干重新训练一遍。

HAF-Steer也能接在普通π0.5上;接在HAF-VLA上时,只替换第三阶段的初始噪声,前两阶段照常产生动作缓存。这说明作者试图把“身体结构生成”和“部署分布适配”做成两个可组合层,而不是绑死成一个不可拆模块。

04 实验到底验证了什么:两款机器人、七项家庭任务、每项120条示范

实验使用天工2.0和天工3.0两款人形机器人。头部自带第一视角彩色相机;数据通过同构遥操作采集:惯性测量单元控制头部,运动学匹配主手控制双臂和手,手持摇杆控制腿部移动与腰部。每个家庭任务采集120条遥操作轨迹。

七项任务分别是衣物装载、衣物取回、桌面整理、篮筐搬运、玩具收纳、投球和箱体搬运。它们不是单次抓取,而是包含跨区域移动、转身、弯腰、下蹲、双手搬运或投掷的长序列。

主指标需要特别说明。作者没有只报“整条任务成功或失败”,而是先把每个任务拆成若干里程碑,再按完成子目标所得分数除以满分,得到归一化任务进度。每种方法在每项任务上测试10次,表格报告平均分。因此70.5%代表平均完成进度,不等于“70.5%的任务完整成功”。

主结果按论文表1整理。平均归一化进度分越高越好,每种方法在每项任务测试10次。

HAF-VLA平均70.5%,π0.5为53.3%,英伟达人形基础模型N1.7为38.1%,Cosmos Policy为27.6%,动作分块变换器(ACT)为25.2%。七项任务中HAF-VLA均取得最好或并列最好平均分。

增幅较大的任务很能说明问题。箱体搬运需要拿起箱子、行走、再放到另一张桌子,HAF-VLA得93.3%,π0.5为60.0%;投球从33.3%提高到56.7%;衣物装载从53.3%提高到66.7%。这些任务都不是手臂局部变好就够了,而要让移动和后续精细操作接得上。

但衣物取回上两者都是53.3%,说明分层结构并非每项任务都带来明显优势。桌面整理中,π0.5也达到70.0%,距离HAF-VLA的80.0%不算悬殊。读表时应该看到“整体持续领先”,而不是把每个任务都讲成碾压。

06 消融最关键的一刀:不是多算20步,而是顺序对了

论文在衣物装载上做了针对性消融。完整HAF-VLA采用“移动与头部→加入腰部→加入双臂”,总共30次去噪,得66.7分。若仍做三阶段、但每阶段同时去噪所有关节,得53.3;若反过来先生成手臂,再加腰和移动,得50.0。

更有意思的是,普通π0.5把去噪步数从10增加到30后只得20.0。论文解释,推理延迟从0.075秒增加到0.115秒;而π0.5本来就存在人形移动预测误差,额外延迟进一步放大了预测速度与机器人实际执行之间的时间错位。

完整HAF三阶段推理约0.12秒,同样不算免费,却仍保持66.7。这组结果支持的结论是:收益主要来自符合身体运动链的生成结构,而不是简单堆更多计算。当然,这只是单个代表任务上的消融,不能自动证明所有任务都遵循相同比例。

07 两类分布外测试:多一把椅子、起点后移20厘米

作者设计了两个受控扰动。衣物装载路径旁放入示范中没见过的黑色办公椅,测试视觉干扰;衣物取回则把机器人初始位置向后移动20厘米,测试位置偏移。每个条件仍测试10次。

在陌生椅子条件下,HAF-VLA为40.0,π0.5为26.7;起点后移条件下,前者43.3,后者36.7。两组都领先,但绝对分数明显低于常规环境。换句话说,结构化生成增强了韧性,却没有消除分布变化。

官方受控扰动设置:左侧加入无关椅子,右侧把起始位置从示范位置向后移动20厘米。

这也提醒我们不要把“分布外”三个字读得过宽。这里验证的是两种明确、有限的空间扰动,不是任意房间、任意物体、任意语言命令下的开放世界泛化。论文证明了局部受控变化下更稳,距离家庭通用机器人仍有很长的系统链。

08 在线纠偏结果:频谱行为克隆先打底,真机交互再补最后一段

HAF-Steer选取玩具收纳和篮筐搬运,在天工3.0上评估。每项又分为分布内和分布外:分布外条件把目标桌移到示范覆盖范围之外30厘米。作者分别以π0.5和HAF-VLA为冻结骨干,比较原模型、重复噪声潜空间强化学习、只有频谱行为克隆,以及完整HAF-Steer。

玩具收纳的分布内测试里,π0.5原模型4/10,频谱行为克隆已到10/10,完整HAF-Steer保持10/10;HAF-VLA原模型8/10,后两者同为10/10。分布外测试中,π0.5从2/10经频谱行为克隆到7/10,再经在线强化学习到8/10;HAF-VLA从8/10提高到10/10。

篮筐搬运的提升更渐进。分布内,π0.5由4/10升至6/10,HAF-VLA由4/10经8/10升至9/10;分布外,π0.5从4/10到6/10,HAF-VLA从4/10经7/10到8/10。

这组图里,频谱行为克隆本身贡献很大,在线强化学习通常再增加1次左右成功,有些格子则不再提升。因此准确表述应该是:频谱监督提供强初始化,混合离线—在线训练在若干设置中继续提高,而不是把全部收益都归给在线强化学习。

官方HAF-Steer结果。每个柱子的数字是10次试验中的成功次数;带符号位置表示重复噪声方法因不安全探索提前终止。

重复单一噪声向量的方法在多组真机训练中没能完成,原因是探索动作不安全。这个负结果很重要:降低维度并不自动等于更安全;如果压缩方式抹掉时间变化,整个动作块会被同一种偏移支配,反而可能引发身体猛抖。

HAF用多个低频模式保留平滑时间变化,确实更符合连续身体运动。但“更安全”仍是相对于本实验对照,而不是通过形式化安全约束、碰撞证明或大规模风险统计得到的保证。

09 放回相似论文坐标:HAF补的是哪一环

第一条坐标是π0.5。它把视觉、语言与连续动作生成结合起来,强调开放世界泛化,是HAF采用的通用流匹配骨干之一。HAF并没有否定这条路线,而是指出:通用机器人模型直接迁移到高维人形全身动作时,缺少身体部件之间的显式生成顺序。

因此两者关系更像“基础能力与身体适配层”:π0.5提供通用观察、语言与动作先验,HAF-VLA加入人形运动链结构,HAF-Steer再处理部署期偏移。它追求的是复用已有骨干,而非从头训练专用人形基础模型。

第二条坐标是全身视觉—语言—动作模型(WholeBodyVLA)。该工作同样面向大空间全身移动操作,探索统一潜空间中的视觉—语言—动作学习。它代表的是直接构建更适合全身控制的模型路线;HAF则更强调对现成通用模型做结构化改造。一个更像“打造原生全身模型”,一个更像“给通用模型装人形适配器”。

第三条坐标是潜空间强化学习。Steering Your Diffusion Policy with Latent Space Reinforcement Learning把强化学习放进扩散策略潜空间,避免直接改原始动作;Flow Reversal Steering进一步利用流反演,从通用策略中构造可调噪声。HAF-Steer沿着这条线往前走,但把长时间噪声压到前8个余弦低频系数,专门针对人形全身动作的高维、平滑和安全压力。

从技术演进看,HAF的新增价值不在某个孤立模块,而在组合:通用模型复用、运动学顺序、跨阶段动作记忆、流反演、低频潜空间与离线到在线学习被接成了一条真机闭环。

10 龙哥点评:漂亮的不是70.5,而是它把“身体”和“学习”分开改

我认为这篇最值得看的,不只是平均分提高17.2个百分点。更重要的是,它没有把所有问题都归结为“模型还不够大”。面对人形机器人,作者先承认身体结构有因果顺序,再承认部署偏移需要现场反馈,然后给两类问题安排不同的改造位置。

第一,生成结构比盲目加算力更值钱。消融里普通π0.5多做去噪反而掉分,说明实时机器人不是静态图像生成。计算越久,世界和机器人状态越可能离开预测时刻。结构正确、延迟可控,往往比单纯多迭代更关键。

第二,在线学习的产品价值在于“少改、可控地改”。冻结大骨干,只优化低频噪声策略,降低了训练参数和探索空间。对真实团队而言,这意味着不必每换一个房间、桌位或任务细节就重新训练整个模型。但真机数据、人工看护、安全停机和设备损耗仍是成本,论文没有把它们变成零。

第三,结果离家庭通用仍有明显距离。七项任务很丰富,却都来自受控实验设置;每任务120条示范,泛化扰动也是椅子、20厘米起点和30厘米目标位移。它证明了一条适配路线有效,不等于机器人已经能在陌生家庭自主应对任意物体和突发人类行为。

对研究者,这篇值得复现的顺序是:先验证分层动作集合与缓存是否在自己的机器人上带来稳定收益,再尝试频谱潜空间;不要一上来就做昂贵真机强化学习。对工程团队,最应该量的是端到端周期:感知、推理0.12秒、控制执行、重规划和安全监控合起来是否满足任务节奏。

对学生,论文给了一个很好的系统研究范例:不是把名词堆在一起,而是从错误传播链出发决定模块边界。移动误差如何传到腰和手?全维噪声为何太大?单噪声为何抹掉时间变化?每个设计都对应一个可观察的问题和消融。

11 失败边界与仍待回答的问题

其一,三阶段会增加去噪计算和部署延迟。论文给出的约0.12秒来自单张英伟达5090显卡,换成边缘计算平台、加入完整感知与安全模块后,速度还需重新测量。

其二,潜空间纠偏受基础模型先验限制。如果骨干模型在极端陌生场景里生成方向就错了,低频噪声策略未必能把错误动作扳回来。作者也把“极端未见场景可能无法纠正错误运动”列为局限。

其三,阶段顺序带有人为运动学假设。“移动与头部→腰部→手臂”符合本文任务,但某些需要手先扶墙、再移动身体,或手臂接触反过来决定脚步的任务,固定顺序是否仍最佳,需要新实验。

其四,安全证据仍偏局部。对照方法因危险动作停止训练,是有价值的失败记录;但HAF自身的碰撞率、跌倒率、紧急停机次数、在线交互总量和人类监督成本没有形成完整安全账本。

其五,公开资源目前以论文、项目页和演示为主。官方项目仓库公开了页面和媒体,但没有提供可验证的训练代码与模型权重。因此读者可以核对图表、视频路径和网页实现,尚不能据此完成端到端复现。

12 如果要继续研究,我会追这四个问题

第一个问题:阶段顺序能否由任务动态决定?本文固定先移动和头部、再腰部、最后双臂。未来可以让模型根据接触状态选择顺序:搬箱子时先稳定腿腰,扶墙通过狭窄区域时也许要先建立手部支撑。真正通用的身体策略,可能需要“可学习的动作依赖图”,而不只是固定三级流水线。

第二个问题:缓存里到底记住了什么?跨阶段缓存带来收益,但论文主要通过最终任务分数证明。后续可以分析缓存注意力,观察第二阶段究竟读取了第一阶段的速度、方向、未来足步,还是只把它当作额外动作提示。若能定位关键表示,还可能进一步压缩推理成本。

第三个问题:八个低频系数是否适合所有动作?搬运需要平滑,投球却包含快速释放。固定保留前八个频率,可能对慢动作友好、对爆发动作保守。更合理的方案也许是按任务、身体部位或运动阶段动态选择频带,同时增加对高频动作的安全约束。

第四个问题:在线学习能否先在数字环境里筛掉危险探索?论文已经展示不恰当潜空间会导致危险真机动作。未来若把世界模型、动力学安全过滤器或可恢复控制器放在在线交互前,先拒绝明显会跌倒、撞击或关节超限的频谱动作,才更接近可持续部署。

这些追问并不削弱HAF,反而说明它提供了一套清晰接口:动作阶段可以改,缓存可以分析,频谱维度可以调,强化学习前后可以接安全模块。一个好框架的价值,往往就是让下一批问题有地方落脚。

如果把视角再放大一点,HAF还提示了具身智能里一个常被忽略的事实:所谓端到端,并不意味着系统内部不能拥有结构。视觉、语言和动作可以统一训练,但人体式机器的关节依赖、接触先后和控制周期依然是真实物理约束。把这些约束用可学习方式写进网络,往往比假装所有维度完全对称更务实。

同样,在线学习也不等于让机器人在现实世界里随意试错。更成熟的路线应当把离线示范、保守初始化、低维探索、安全过滤、故障恢复和人工监督组合起来。HAF完成了其中“专家频谱初始化加低频探索”的一段,后面仍需要把安全与成本做成可度量、可比较的系统指标。

真正决定它能否走进工厂、仓库和家庭的,也不会只是论文表格里的最高分,而是连续运行数小时后是否仍稳定、失败后能否恢复、换一个操作者采集数据是否还能学习、维护人员能否理解异常来源。本文给出了有说服力的起点,下一步要把一次次漂亮演示变成可追踪、可回滚、可维护的长期能力。

13 最后总结

HAF给通用视觉—语言—动作模型补了两样东西:一套符合人形身体依赖的动作生成秩序,以及一条不改大骨干的低频在线纠偏通道。前者先处理“身体怎么协同”,后者再处理“到了现场怎么适应”。

七项真实任务平均归一化进度分从53.3%升到70.5%,分层顺序消融、受控分布变化和频谱强化学习实验都提供了相互支撑的证据。它还没有解决开放家庭里的全部泛化与安全问题,但清楚展示了一个方向:人形机器人的通用性,不只来自更大的大脑,也来自对身体链条与部署反馈的正确建模。

龙哥的结论是:这是一篇值得机器人控制、具身模型和真机强化学习团队细读的方法论文。看完别只记住70.5%,更要记住那条工程原则——先把错误会怎样沿身体传播想清楚,再决定模型在哪里分层、记忆和纠偏。

如果你只准备读一遍,建议重点看方法图、分层顺序消融和真机适配结果,它们共同决定这篇工作的可信度。

原文与官方资源

原论文
https://arxiv.org/abs/2608.16837

官方项目页
https://grange007.github.io/HAF/

官方项目页面仓库
https://github.com/Grange007/HAF

衣物装载官方演示
https://grange007.github.io/HAF/static/videos/web/laundry_loading.mp4

篮筐搬运官方演示
https://grange007.github.io/HAF/static/videos/web/basket_transfer.mp4

相似论文:π0.5
https://arxiv.org/abs/2504.16054

相似论文:全身视觉—语言—动作模型
https://arxiv.org/abs/2512.11047

相似论文:潜空间强化学习引导扩散策略
https://arxiv.org/abs/2506.15799

本文基于龙哥读论文数据库(PaperDaily)及论文工具(PaperMiner)的模型上下文协议(MCP)进行汇总整理。技术事实、数字、单位和媒体路径以官方论文、项目页与官方页面仓库为准。

本文仅代表对论文的个人理解,不能替代原论文。实验结果受机器人平台、任务设置、示范数据、指标口径与真机安全条件限制,请阅读原文核对细节。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球