← 返回 PaperDaily
视觉与图像
四足机器人跑酷破纪录!SWAP用对称性原理,一跃2.13米,登顶1.63米
机器人的左右腿,是不是总被当成两套独立的程序在学?这篇论文的作者们也这么想,于是他们干脆把“对称性”这个物理常识硬塞进了神经网络。结果咋样?一台重达72公斤的机器人,在美国国家航空航天局(NASA)的JPL实验室里也跑不出这么猛的数据——1.63米高台一跃而上,2.13米宽的鸿沟轻松跨过,这波操作,真把四足跑酷玩成了物理定律的炫技。
龙哥读论文
发布于 2026-08-21 00:20:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 想深入了解SWAP的等变网络细节?星球 无上限更机器人、强化学习、世界模型等前沿领域论文, 每日2分钟刷完即赚,带你直击技术核心!
👇扫码加入「龙哥读论文」知识星球,和龙哥一起探索机器人的极限世界~
龙哥推荐理由: 机器人的左右腿,是不是总被当成两套独立的程序在学?这篇论文的作者们也这么想,于是他们干脆把“对称性”这个物理常识硬塞进了神经网络。结果咋样?一台重达72公斤的机器人,在美国国家航空航天局(NASA)的JPL实验室里也跑不出这么猛的数据——1.63米高台一跃而上,2.13米宽的鸿沟轻松跨过,这波操作,真把四足跑酷玩成了物理定律的炫技。
原论文信息如下:
想要让机器人像猎豹一样飞跃两米宽的深谷,或者像登山者一样攀上一米六的高台,这几乎是所有机器人学家的梦想。但一直以来,这些酷炫的动作都卡在了一个简单又尴尬的问题上:机器人分不清自己的左右腿。
别笑,这可是真的。目前的先进方法,比如基于世界模型的强化学习,它们处理左右对称的物理交互时,是当做两件完全无关的事来学的。机器人的左前腿蹬地发力,和右前腿蹬地发力,在模型看来是两个独立的“模式”。这不仅浪费了大量计算资源,更重要的是,它让模型很难从有限的数据中,真正理解物理世界里的那个基本事实:左右本来就是一样的。
来自某大学团队的研究者们,决定不再忍受这种“冗余编码”。他们提出的框架叫做SWAP ,直接把“对称性”这个物理规律,作为硬性约束,塞进了神经网络的结构里。他们的想法很简单:既然物理定律在镜像变换下是不变的,那机器人的网络结构为什么要自己骗自己,把左右当两回事?
方法概述
SWAP的核心思想非常清晰,它构建了一个端到端的等变对称世界模型 。这个框架包含两大块:一个低频率更新的对称等变世界模型(负责感知和预测),和一个高频率更新的对称等变策略网络(Actor-Critic,负责决策)。
简单来说,就是让机器人的“大脑”(世界模型)和“手脚”(策略网络)都知道一个规矩:你所看到的左边,和右边,在物理上是互相对应的。你看到的镜像世界,和你做出的动作,也应该是互相对应的。
怎么做到的呢?研究者们用了一种叫“对称等变” 的网络模块。比如,在世界模型中,他们使用了对称等变卷积神经网络(SE-CNN)来处理深度图像,以及对称等变多层感知机(SE-MLP)来处理本体感觉。这些网络内部,特征通道被成对地组织起来,当输入发生镜像翻转时,这些网络内部的表示也会随之发生对应的翻转。
同理,在策略网络中,Actor被设计成等变的——当它看到镜像状态时,它生成的动作也是镜像的。而Critic则被设计成不变的——无论是左边还是右边,只要物理状态对称,它给的价值评估应该是一样的。
核心原理推导
为了将对称性这个先验知识融入网络,论文用了一种非常“硬核”的方式——架构约束。这区别于传统的“软约束”,比如数据增强或者损失函数惩罚。
核心在于定义了一个对称马尔可夫决策过程(SMDP) 。在这个框架下,状态、动作、奖励和状态转移都遵循一个简单的规则:镜像世界中的最佳动作,就是原始世界最佳动作的镜像。
这个推导告诉我们,最优策略天然就应该满足对称性。SWAP所做的,就是通过设计对称等变的网络层(SE-GRU, SE-MLP, SE-CNN),从网络拓扑结构上强制满足这个等式。
具体的对称变换规则非常细致,甚至连关节速度、接触力、地形高度等每一个观测分量,都定义了明确的变换表。比如,基线x向速度保持不变,而y向速度取反;关节位置中,左前腿的髋关节角会与右前腿的髋关节角互换。
对称性,机器人学习的隐藏天赋
当人类运动员做后空翻时,左腿和右腿的动作几乎是完美的镜像。但在目前的机器人强化学习框架里,这个常识居然没有被利用——左腿蹬地和右腿蹬地被当作两个完全独立的“技能”来学习。
为了实现这一点,论文首先将机器人决策问题形式化为一个对称马尔可夫决策过程(Symmetric Markov Decision Process, SMDP) 。在这个框架下,定义一个群变换操作(比如左右镜像翻转),作用于状态、动作空间,并要求奖励函数和状态转移概率在这个变换下保持不变。
那么,具体的对称关系有多细?论文给出了一个漂亮的表格,定义了每一个物理量的变换规则。比如,身体x方向线速度保持不变,但y方向线速度取反;关节位置中,左前腿的髋关节角要和右前腿的髋关节角互换。
SWAP如何将对称性嵌入世界模型
有了对称性这个“天赋”,SWAP要做的就是把它变成“肌肉记忆”。论文构建了一个端到端的等变对称世界模型 ,包含两大部分:一个低频率更新的对称等变世界模型(负责感知和预测),和一个高频率更新的对称等变策略网络(Actor-Critic,负责决策)。两者在同一训练阶段联合优化。
世界模型基于经典的循环状态空间模型(Recurrent State-Space Model, RSSM) 。为了在机载硬件上满足实时性,采用了低频更新策略,每k个时间步更新一次潜状态。
关键创新在于:所有的网络模块——编码器、循环模型、解码器——都被设计成对称等变 的。具体来说:
编码器方面:深度图像经过对称等变卷积神经网络(SE-CNN) 处理,它将原始深度图提升为通道配对的特征图——左和右对应的特征通道被组织成镜像对,当输入图像翻转时,特征图也会随之对应地翻转。本体感觉(imu、关节角度等)则通过对称等变多层感知机(SE-MLP) 映射。
循环模型方面:采用对称等变门控循环单元(SE-GRU) 来更新确定性隐状态。解码器(SE-CNN和SE-MLP)则确保从镜像潜状态得到的重建观测也是镜像的。此外,还额外重建机器人身体和足部的局部高度图,帮助潜空间压缩地形几何信息,加速收敛。
训练损失函数包含重建误差和KL散度。由于所有组件都是等变的,损失函数本身在群变换下是不变的——这意味着梯度信号在单向轨迹上计算,可以自然地泛化到对称子空间,大幅提升样本效率。
策略网络部分,Actor被设计成等变 的:当它看到镜像状态时,生成的动作也是镜像的。Critic被设计成不变 的:无论状态是左还是右,只要物理对称,价值评估相同。
下表总结了每个模块的输入输出变量空间,直观展示了哪些变量参与了等变约束。
创纪录的跑酷表演:2.13米跨越与1.63米攀爬
理论再漂亮,最终还得看实战。SWAP在Apollo四足机器人上进行了仿真和真实世界的极限跑酷测试。结果相当炸裂:2.13米 的跨越距离和1.63米 的攀爬高度——都是目前四足机器人跑酷的世界记录。
从图4可以看出,在跨越任务中,SWAP和仅移除策略等变的版本(SWAP (w/o Eq-Policy))都能保持高成功率,说明世界模型的等变约束已经贡献了大部分收益。而在攀爬任务中,SWAP的优势更加明显,因为攀爬需要更严格的对称接触力控制,完全未约束的基线很容易陷入不对称的局部最优。
下面这张表汇总了SWAP与当前最先进四足机器人跑酷系统的绝对性能对比。注意,SWAP的机器人尺寸为70×55 cm,自重72 kg,属于大型机器人。即便如此,它仍跨越了前髋距3倍的距离,攀爬了站立髋高3倍的高度,与小型机器人的最好归一化性能持平,而在绝对尺寸上创造了新纪录。
一键部署:仿真到真实世界的零样本迁移
在仿真中训练的SWAP策略,不需要任何微调,直接部署到真实的Apollo机器人上,在多种野外环境中表现出惊人的鲁棒性。论文系统地测试了四类真实世界挑战:
高动态操作: 在湿滑的花岗岩平台上攀爬,即使前腿打滑,机器人仍能通过调整姿态完成动作。跨越野外的沟壑时,着陆点是不平的土坡,且行进路线中有灌木干扰,机器人仍然稳定着陆。
感知退化: 在浅水中行走,水面产生不可预测的镜面反射,深度相机可能失效;在黑暗的楼梯上,深度图几乎全是噪声。但机器人依靠策略的鲁棒性,依然保持稳定运动。
视觉-本体感觉错位: 当遇到非刚性障碍物(如散落的纸板、高草丛)时,视觉外观与实际物理支撑完全不符。策略却能够适应地形变化,维持动态平衡。
不可预测接触动力学: 在碎石堆和可移动的地毯上行走,脚下材料受力后会移动,导致接触不稳定。SWAP策略有效地抑制了这种扰动,确保了持续前行。
结构化的几何先验:为什么对称性如此有效
看完实验结果,我们不禁要问:对称性这个先验到底带来了什么,使得性能提升如此显著?论文通过消融实验和可视化分析给出了答案。
首先,减少了编码冗余。 传统的世界模型需要用两组独立的参数来学习左右对称的物理交互,而等变模型天然共享这些模式。在镜像地形迁移实验中(图3),训练时只接触左高右低的倾斜地形,测试时直接面对右高左低的镜像地形。SWAP的重建误差几乎不变,而普通模型的误差急剧上升。这说明等变潜空间真正学到了对称的几何结构。
其次,防止策略陷入不对称的次优陷阱。 在极限跑酷中,机器人接近物理极限时,只有少数轨迹可行。无约束策略很容易学会“偏科”动作——比如只用一条腿发力。SWAP通过强制Actor输出对称动作,Critic给出对称价值评估,从优化层面杜绝了这种不对称次优解。
最后,提升了长时域预测的可靠性。 在接近极限时,机器人需要提前好几步规划动作,世界模型的长程预测质量至关重要。对称结构约束使得潜空间更规整,减少了预测误差积累。
简单来说,对称性先验让机器人的“感知-预测-决策”链条变得结构化、高效、且可推广。它不是让机器人学得更慢,而是让它学得更聪明。
龙迷三问
这篇论文解决什么问题? 它解决了现有潜世界模型在强化学习控制四足机器人时,对称性编码冗余、样本效率低、容易陷入不对称次优策略的问题。通过将等变对称性硬编码进网络结构,实现了更高效的学习和更强的泛化能力,最终让机器人创下跑酷纪录。
什么是等变(equivariant)和不变(invariant)?有什么区别? 等变是指当输入发生某种变换(比如镜像翻转)时,网络的输出也按照相同的规则发生变换。例如,SWAP中的Actor:当输入的观测镜像了,输出的动作也应该镜像。不变是指无论输入如何变换,输出都保持不变。例如,SWAP中的Critic:左侧状态和右侧状态的价值评估应该一样。
SWAP与之前的对称性方法(如数据增强、损失函数惩罚)有什么本质区别? 之前的方法是“软约束”,通过在损失函数中添加对称性惩罚项,或通过数据增强让网络隐式学到对称性。SWAP采用的是“硬约束”,从网络拓扑结构上直接设计等变层,使得对称性成为网络内在性质,无需学习就能保证。实验表明,硬约束在极限任务上比软约束(SymLoss)有显著提升。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
在机器人学领域将等变硬约束从感知模型延伸到世界模型和策略网络,端到端对称框架属于原创性贡献。
实验合理度: ★★★★★
在仿真和真实世界进行了充分的消融实验和泛化测试,对比基线设置合理,可视化分析有说服力。
学术研究价值: ★★★★☆
证明了几何结构先验(对称性)在极限运动控制中的有效性,为将更多物理先验引入强化学习提供了范例。减一星因为领域相对小众。
稳定性: ★★★★☆
在真实世界多种极端场景下展示了良好鲁棒性,但只在一款机器人(Apollo)上验证,对其他尺寸机器人的迁移效果未知。
适应性以及泛化能力: ★★★★☆
对镜像地形、感知退化、非刚性障碍等表现出很强泛化性,但当前仅针对结构化地形,在离散落脚点等更复杂场景尚未验证。
硬件需求及成本: ★★★☆☆
训练需要1块RTX 4090训练约10小时,成本可以接受。但部署需要高性能机载计算设备(Apollo机器人本身价格昂贵,重72kg),一般实验室难以复制。
复现难度: ★★★☆☆
论文未明确开源代码,且自定义的等变网络层实现需要一定工程能力,复现有门槛。
产品化成熟度: ★★☆☆☆
虽然零样本迁移效果惊艳,但机器人本体和计算平台成本高昂,且只在特定场地演示了极限动作,离消费级产品还有距离。
可能的问题:
1. 训练环境中包含了0.23m台阶、60度斜坡等障碍,但真实世界测试中缺少对极高难度地形的重复验证。2. 论文没有与其他基于等变策略的方法进行充分对比。3. 机器人72kg的自重意味着落地冲击巨大,长期部署的机械磨损和故障率未讨论。整体而言,这是一篇漂亮且诚实的论文,但距离通用产品级机器人还有很长的路。
主要参考文献
[3] D. Hafner, et al. "Learning latent dynamics for planning from pixels." ICML, 2019.
[4] D. Hafner, et al. "Dream to control: Learning behaviors by latent imagination." ICLR, 2020.
[6] H. Lai, et al. "WMP: World Model Pre-training for Agile Quadrupedal Locomotion."
[12] Y. Luo, et al. "PIE: Parkour with Implicit-Explicit Learning."
[20] R. Walters, et al. "Equivariant neural networks and applications."
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!