← 返回 PaperDaily
视觉与图像
轨迹优化+TVAE+RL:四足机器人野外越障新范式
四足机器人最难的不是“跑起来”,而是“跑着跑着还知道该怎么换姿势”。这篇工作把轨迹优化、动作预训练、强化学习和感知蒸馏串成一条链,真机直接冲到6米/秒,属于能看懂、也能落地的那类机器人论文。
龙哥读论文
发布于 2026-09-05 00:31:13
阅读 4
查看原文
原论文信息如下:
四足机器人也能“飞檐走壁”?
四足机器人真正难的,不是“能不能跑”,而是“跑到一半,看到前面是台阶、木桩、碎石、落枝,还能不能立刻换招”。很多系统看起来很猛,一上野外就露馅:平地上像猎豹,障碍前像刚学走路。
这篇论文要解决的,就是这个现实得不能再现实的问题:让四足机器人只靠车载传感器,在复杂地形里自动选步态、自动换动作、还要跑得快。论文给出的结果也很直接——真机在高台阶和下楼场景里能冲到瞬时 6 米/秒 ,这不是“慢慢挪过去”,而是带着一点野性在冲刺了。
这类工作之所以值得看,不只是因为“快”,而是因为它把四足机器人最难的三件事串起来了:多技能 、平滑切换 、仅靠机载感知部署 。这三件事单拎出来都不算新鲜,难的是放到同一个系统里还不能互相拖后腿。论文的思路很像先把“动作库”练扎实,再让策略学会挑动作,最后再把视觉和激光雷达压缩成能上车的感知输入,层层递进,没靠玄学。
APT-RL:用“动作预训练”打通四足机器人的“任督二脉”
APT-RL 是 Action Pretrained Transformer-based Reinforcement Learning 的缩写,中文可以理解为“动作预训练的 Transformer 强化学习框架”。名字很长,但核心意思很朴素:先把机器人会做的基础动作练成一套可复用的“肌肉记忆”,再让强化学习在这个基础上学会看地形、选动作、换动作。
这套方法的关键不是“端到端一把梭”。论文反而故意拆成三段:先用轨迹优化生成高质量动作数据,再用 TVAE 学一个统一的潜空间和动作解码器,最后再用强化学习把这个解码器变成能适应复杂环境的策略。TVAE 是 Transformer-based Variational Autoencoder ,中文就是“基于 Transformer 的变分自编码器”。它在这里不是为了炫技,而是为了把不同步态、不同速度、不同动作形态压进同一个可操作的空间里。
最有意思的地方在于,论文没有把“动作先验”当成一个装饰品,而是把它变成后续学习的地基。很多机器人方法喜欢把先验说得很玄,最后却只是训练时加一点辅助损失。这里不一样:先验直接来自轨迹优化生成的动作和力矩,后续策略不是从零学,而是在一个已经长出骨架的动作空间里继续长肌肉。说白了,这不是“空手练武”,而是“先把招式谱写好,再让机器人学会临场发挥”。
数据先行:2D轨迹优化如何“以小博大”?
论文的数据源头不是昂贵的真实采集,而是 trajectory optimization ,中文叫“轨迹优化”。这里的思路挺聪明:先在简化动力学下生成大量物理可行的运动轨迹,再把这些轨迹当成训练素材。这样做的好处很直接——数据量大、生成快、动作质量还不差。
这里用到的简化模型是 SRBD ,即 Single Rigid Body Dynamics ,中文是“单刚体动力学模型”。它把复杂的四足机器人简化成一个整体刚体来抓主要动力学特征,牺牲了一部分细节,但换来的是可计算、可批量生成、可快速迭代。对机器人学习来说,这种取舍非常现实:不是每个问题都值得把仿真精度堆到天上,能不能先把“动作先验”做出来,往往更重要。
论文还专门做了一个很务实的验证:不是拍脑袋选 trot 和 bound,而是把五种步态都拉出来比了一圈。评估指标包括成功率、速度跟踪奖励和 1/COT 。COT 是 Cost of Transport ,中文“单位运输成本”,可以粗略理解为“走一段路要花多少能量”;1/COT 越高,说明效率越好 。最后的结论也不意外:trot 偏稳,bound 偏猛,两者组合起来,才更像真正在野外跑的四足动物。
这一步的本质,是用低成本的 2D 轨迹优化换来高质量的动作分布。论文甚至给出了很夸张但真实的效率:180,000 条轨迹、总时长 15.5 小时的数据,只用 8 分钟就生成出来 。这类数字很说明问题——真正贵的往往不是“算一条轨迹”,而是“把足够多的轨迹一次性做出来”。
训练三阶段:从模仿到超越,再到“眼观六路”
整套 APT-RL 不是一个单一模型,而是三段式训练管线。第一段学表示,第二段学策略,第三段把“看见的世界”压缩成能上车的感知输入。这个设计的妙处在于:每一步都在做自己最擅长的事情,避免让一个策略同时背“动作生成、技能选择、视觉理解、落地控制”四口大锅。
图:潜空间表示与动作解码的核心关系。论文通过 TVAE 学到一个共享潜空间,编码器把轨迹压成潜变量,解码器再把潜变量还原成力矩命令。这里的关键不是“压缩”,而是让潜空间里保留步态、速度和动作切换的结构。
第一阶段是表示学习。TVAE 先在轨迹优化数据上学习一个共享潜空间,再学习一个从潜变量到关节力矩的解码器。这样做的好处是,后续策略不需要从零学“怎么打力矩”,而是可以直接复用一个已经学会动作规律的解码器。换句话说,策略学的是“什么时候用哪种动作”,而不是“每个关节此刻该出多大力”。
第二阶段是强化学习。这里比较巧的设计是引入了 latent action 和 auxiliary action ,也就是“潜动作”和“辅助动作”。潜动作走的是预训练解码器那条路,负责提供结构化的动作先验;辅助动作则通过低层控制器补足偏差,处理 2D 数据没覆盖到的 3D 复杂情况。这个结构比传统残差策略更进一步,因为它不是先有一个固定主干、再往上打补丁,而是让两条动作来源一起训练、一起协作。
第三阶段是感知蒸馏。训练时,教师网络可以吃到更“干净”的 privileged height map;部署时,学生网络只看深度相机和二维激光雷达。为了让学生尽量学到教师的判断方式,论文用 CNN-GRU 编码器做蒸馏,把高维感知压成适合机载部署的表示。这里的 GRU 是 Gated Recurrent Unit ,中文“门控循环单元”,适合处理时序感知信号。说白了,机器人不是只看一帧图就能决定要不要跳,它还得记住前几帧发生了什么。
这部分实验很能说明问题。论文把潜动作做了 PCA 和 t-SNE 可视化,能看到策略在训练早期主要待在预训练分布附近,后来逐渐扩展到更广的区域;到了真机部署时,熟悉动作仍然落在原有簇附近,而新地形会把潜动作推向更远的位置。这个现象说明,预训练动作不是死板模板,而是给策略提供了一个“可扩展的动作坐标系”。
更有说服力的是辅助动作的作用。论文在日志跳跃、腿部异常、原地转向等场景里拆解了力矩来源:当场景超出预训练覆盖范围时,辅助力矩会明显抬头,补上解码器没法单独完成的动作。这个结果很重要,因为它证明系统不是“只会复读预训练动作”,而是真的学会了在先验基础上做修正。🙂
实战演练:六米每秒的狂野飞跃与灵活步态
如果前面讲的是“会学”,那这一部分就是“会跑”。论文把系统放到城市校园、野外森林和室内障碍场景里实测,验证的不是单次花活,而是长距离、连续、真实地形下的稳态表现。这个标准很残酷,但也最接近产品化。
在城市场景里,机器人跑了 1.1 公里 ,要面对楼梯、草地、坡道等结构化地形;在野外场景里,又跑了 0.34 公里 ,面对树根、倒木、碎石、落叶和湿滑地面。机器人不是一路一种步态硬扛,而是会在 trot 和 bound 之间切换:低速下更偏 trot,速度拉高或台阶更高时,bound 更容易上场。
论文最“炸”的演示,是高台阶和下楼场景。机器人在 60 厘米高台阶上完成跳跃并越障,瞬时峰值速度达到 4.25 米/秒 ;在三层台阶下落时,落地前瞬时峰值速度甚至达到 6 米/秒 。论文还给出了对应的 Froude 数,分别是 3.85 和 7.69,说明这已经不是“机器人慢慢挪”,而是相当激进的动态运动了。
论文还做了一个很实在的对照:自动选步态的策略,与只会 trot 或只会 bound 的固定步态策略相比,哪个更好?结果很清楚,自动策略在多地形、多速度组合下更稳,也更少“顾此失彼”。这说明问题不只是“某个步态强”,而是“什么时候用哪个步态”同样决定成败。机器人在复杂地形里最怕的,不是不会跑,而是只会一种跑法然后硬刚所有场景,最后只能被地形教育。
从训练效率看,这套方法也不是只会“卷结果”,还讲究“少走弯路”。论文和 AMP、Vanilla RL、残差 HRL 做了对比,APT-RL 的训练曲线更稳、样本消耗更低,动态步态切换实验里也更容易成功。说得直白一点:它不是靠把训练时间拉到天荒地老来换结果,而是靠先验把无效探索砍掉了。
感知消融也很关键。论文证明,深度相机和二维激光雷达是互补的:只用一个传感器,成功率会掉;两者结合,机器人在不同地形上的稳定性更好。这个结果不花哨,但很重要,因为它提醒了一个现实:高速四足不是“看得见就行”,而是“看得准、看得稳、看得快”才行。
总结与展望:从“跑酷高手”迈向“全能战士”
这篇论文最值得肯定的地方,不是单点性能,而是系统思路:用轨迹优化造动作先验,用 TVAE 把动作组织成可复用空间,用强化学习做场景适配,再用感知蒸馏把整套东西压到真机上。它没有把“高速度”和“高鲁棒”硬掰成二选一,而是尽量让两者同时成立。
当然,边界也很清楚。首先,这套方法依赖高质量的轨迹优化数据和比较完整的仿真到现实链路;其次,当前主要围绕 trot 和 bound 两类基础步态展开,虽然已经足够实用,但离“任意动作都能即插即用”还有距离;最后,高速动态越障对传感器稳定性、控制频率和机械结构要求都很高,换平台时未必能原样照搬。
不过,这类工作对行业的意义很明确:四足机器人如果想真正走进搜救、巡检、野外勘探等场景,就不能只会“稳”,还得会“快”,而且要会“换招”。APT-RL 证明了一件事——动作先验不是老派思路,反而可能是高速复杂地形里最务实的解法之一。真正难的不是把机器人训练得像个体操运动员,而是让它在不熟悉的地形上还能保持脑子清醒、脚下不乱。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是四足机器人在复杂野外和城市地形中,如何在只用机载传感器的情况下,自动选择步态、平滑切换技能并保持高速通过的问题。核心不是“跑得快”本身,而是“跑得快还不乱”。
APT-RL、TVAE、SRBD 分别是什么意思? APT-RL 是动作预训练的强化学习框架;TVAE 是基于 Transformer 的变分自编码器,用来学共享潜空间和动作解码器;SRBD 是单刚体动力学模型,用简化动力学生成大量可行轨迹,换取更低的数据生成成本。
为什么要先做 2D 轨迹优化,再去学 3D 真机控制? 因为 2D 轨迹优化更便宜、更快,能批量产出带力矩标签的高质量动作数据;这些数据先把“动作骨架”搭起来,再让策略在 3D 环境里通过辅助动作和感知输入做修正,会比从零开始学更省样本,也更容易学出能落地的行为。
龙哥点评
论文创新性分数: ★★★★☆
把轨迹优化、动作预训练、辅助动作和感知蒸馏串成一套闭环,思路不算“凭空发明”,但组合得很顺,且真机验证非常硬。
实验合理度: ★★★★☆
对比了多步态、多基线、多场景,还做了感知和结构消融,实验链条比较完整;少数指标细节仍依赖仿真设定,但整体足够可信。
学术研究价值: ★★★★☆
对多技能腿式运动、动作先验复用和感知驱动控制都有启发,尤其适合继续往复杂地形和多动作组合方向扩展。
稳定性: ★★★☆☆
真机效果很强,但对传感器、平台动态特性和训练管线依赖较高,离“随便换台机器人就能跑”还有距离。
适应性以及泛化能力: ★★★★☆
在城市、野外、室内都能工作,说明泛化不错;但当前主要围绕特定步态和平台展开,跨平台泛化还得继续看。
硬件需求及成本: ★★★☆☆
部署依赖深度相机、二维激光雷达和较强的机载计算,成本不算低,但比起依赖外部动捕系统已经实用很多。
复现难度: ★★★☆☆
论文给了项目链接和较完整的实验描述,但轨迹优化、控制、感知和真机调参链路都不算轻松,复现门槛仍然偏高。
产品化成熟度: ★★★☆☆
已经具备野外实验级别的成熟度,但要进产品,还需要进一步验证长期稳定性、不同平台迁移性和传感器抗扰能力。
可能的问题: 先验依赖较强,动作库和平台耦合度不低;复杂环境下的长期稳定性还需要更多连续测试,离通用四足还差最后一段硬骨头。
主要参考文献
[1] Kang J-G, Park J, Song T-G, Kim J-H, Hong S, Park H-W. Agile perceptive multi-skill locomotion for quadrupedal robots in the wild. Science Robotics, 2026.
[2] 论文原文:https://arxiv.org/pdf/2607.13579v1.pdf
[3] 项目页面:https://zenodo.org/records/20645964
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
四足机器人、自动驾驶、具身智能、图像与大模型 都能聊,别只围观,来一起拆方法。