← 返回 PaperDaily 视觉与图像

MuJoCo三族机器人参数全变,看清华如何让世界模型不发懵

换根连杆、改个质量,世界模型就“失忆”?清华这项研究把机器人形态参数和可复用动力学分开建模,让世界模型在没见过的新参数下也能零样本预测和规划。想搞机器人泛化的,这篇值得一读。

MuJoCo三族机器人参数全变,看清华如何让世界模型不发懵
原论文信息如下:
论文标题:
Graph-Operator World Models for Morphology-Parameter Generalization in Continuous Control
发表日期:
2026年08月
发表单位:
清华大学,中国科学院自动化研究所
原文链接:
https://arxiv.org/pdf/2608.20936v1.pdf
如果一只四足机器人换了两根更长的腿,它还能像之前一样稳稳走路吗?如果量产时某个关节阻尼调大了一圈,控制系统需要重新训练吗?这是机器人和强化学习领域一个非常现实又棘手的问题:物理形态变了,动力学就变了,而绝大多数世界模型(World Model)在训练时只见过自己那一亩三分地,一旦遇到没见过的杆长、质量、阻尼,马上“失忆”。
清华大学和中国科学院自动化研究所合作提出的GraphOp-WM(Graph-Operator World Models,图算子世界模型),瞄准的正是这个问题。核心思想很直接:把机器人画成一张图,身体是节点,关节是边,然后把“每个身体局部的动力响应”和“形态参数如何改变这些响应之间的耦合方式”分开建模。这样一来,换参数就不再需要重头学,模型能直接在没见过的新形态参数下做零样本(zero-shot)预测和规划。
这个思路到底妙在哪里?又是怎么落地的?龙哥带你一步步拆开看。

形态参数一变,世界模型就失灵?

在正式开始之前,先聊聊世界模型到底是什么。所谓世界模型,简单说就是让智能体在“脑子里”模拟环境动力学的一类模型。智能体看到当前状态、做出一个动作,世界模型预测下一步状态会变成什么样,还能预测能得到多少奖励。有了这个“脑内模拟器”,智能体就可以做规划(像下棋一样向前想几步)或者做想象训练,不需要在真实环境里大量试错。
DreamerV3、TD-MPC2等知名世界模型已经能在大量连续控制任务上取得惊人成绩,但它们有一个共同的前设:训练和测试时面对的是同一套物理系统。可现实世界不是这样。机器人从实验室走向工厂、家庭、野外,换了负载、改了机械结构、调整了关节阻尼,都是家常便饭。物理参数一旦改变,原来的世界模型预测就不准了——因为物体的接地点变了,力的传导路径变了,惯性响应也变了。
有些研究尝试把形态参数作为一个条件向量输入给模型,告诉它“现在的杆长是1.2倍、质量是0.9倍”,让模型在给定条件下做预测。但问题来了:条件向量只是告诉模型“形态变了”,并没有告诉模型“参数变了之后,不同身体部件之间的动力学耦合应该怎么变”。模型依然不知道哪些动力学部分是跨形态通用的、哪些部分是被形态参数影响的,全凭网络自己摸索,泛化效率自然不高。
马尔可夫决策过程的形式化定义
带形态参数m的马尔可夫决策过程形式化定义,其中状态空间和动作空间的维度可以随机器人形态变化。
GraphOp-WM要回答的问题恰好就是:能不能用一个紧凑的世界模型,显式地分离“可复用的局部动力学”和“形态参数诱导的耦合”,从而在没见过的物理参数上也能泛化?

把机器人画成图:GraphOp-WM的核心思路

GraphOp-WM的思路可以用一句话概括:让机器人动力学模型的“不变部分”和“可变部分”各司其职。要理解这个设计,先看它是怎么表示一个机器人的。
GraphOp-WM把机器人表示成一张属性图(attributed graph),把MuJoCo的MJCF或DeepMind Control的规格说明解析成“身体-关节”图结构。每个身体部件(如躯干、大腿、小腿)是图里的一个节点,关节是连接节点的边,执行器(actuator)则被挂在对应的关节边上。这样一来,机器人的拓扑结构、几何信息、惯性参数、关节类型、驱动方式,全部被编码成节点的静态属性(比如质量、惯量、几何体类型、接触信息)和边的静态属性(关节类型、旋转轴、原点、关节范围、阻尼、传动比等)。
节点静态属性定义
图2:身体节点i的静态属性,包括质量、惯量、几何、类型、接触和坐标系信息。
边静态属性定义
图3:关节边(i,j)的静态属性,包括关节类型、转轴、原点、范围、阻尼和传动比。
同时,每个节点上还会有动态特征,比如局部位置、朝向、线速度、角速度和接触信号;关节的位置、速度和执行器命令则挂在对应的边上。图中的身体节点、关节边、执行器边都会被编码成固定维度的向量token,再打包成标准的图批次用于训练。注意一个关键点:在一个机器人家族内部,图的拓扑结构和节点对应关系是固定的,形态差异由节点和边的属性不同来体现,而不改变图的形状。这样模型就不需要处理“节点数量随时变”的问题。
有了图表示,GraphOp-WM再将每一步的状态转移拆成两部分。用公式表示就是:
状态转移公式
图4:GraphOp-WM的核心转移公式。Zt是当前时刻所有身体节点的token矩阵,A_m,t是根据形态参数m生成的转移算子,B̄t是归一化后的共享局部动力学基。
这里的局部动力学基B̄t描述的是“每个身体部件在自己局部环境下大致会怎么动”,它只依赖局部状态和局部动作,看不到任何形态参数;而算子A_m,t则完全由静态形态参数生成,负责把局部的基本响应“组合”成整体动力学。
为什么要拆成这两个部分?因为机器人动力学本身就有这种结构。以人形机器人为例:单看一条小腿,它的局部摆动规律在不同身高、体重的机器人之间其实差别不大;但把小腿接到大腿上、再把整个腿接到躯干上,质量和长度分布的变化就会显著改变关节间的耦合关系。前者是“局部基”,后者是“算子”该管的活。这样的先验结构让模型不再需要从零学习“形态变了动力学怎么变”,而是把变化集中在算子上。
有了这个总览,下面进入最核心的机制拆解。

局部基与结构化算子:信息分离的巧妙设计

GraphOp-WM的成功关键在于两件事:一是局部基怎么定义,二是算子怎么结构化。
先看局部基。每个身体节点i会通过一个共享的局部核b_θ,根据自身的历史状态token、相邻关节的动态特征以及局部动作,预测一个“候选增量”B_t,i。这里的“候选增量”可以理解为每个身体部件在不受全局耦合影响时、凭自己局部状态和受力应该产生的状态变化。
局部基预测公式
图5:共享局部核预测每个身体节点的候选增量。聚合函数收集相邻关节的位置、速度和动作信息。
这里有一个非常关键的设计:这个局部核完全没有接触质量、长度、惯量、形态ID等任何静态形态信息。它只能看到动态的状态和动作,以及一个离散的身体类型标签(比如“左大腿”还是“躯干”)。这种“信息隔离”是刻意为之的:如果局部核拿到了质量信息,它很可能会偷懒,把形态相关的动力学差异直接“记”在局部基里,破坏可复用性。为了让这个隔离切实有效,GraphOp-WM还引入了一个小技巧——基归一化:每个图的局部基都会除以自己的均方根大小,消除基和算子之间任意缩放的模糊性,迫使算子去承担真正的形态差异。
基归一化公式
图6:局部动力学基的均方根归一化,确保基的尺度不影响预测。
再看结构化算子。形态编码器G_ψ只读取静态图属性(质量、长度、惯量、关节阻尼等)作为输入,输出三类系数:每个节点的对角系数d_m、每条关节边的边系数w_m、以及r个全局低秩模式的系数s_m和对应的模式向量U_m。这些静态系数会再被一组“状态门控”根据当前机器人的姿态、速度、接触状态进行调制,让静态结构在合适的时机被激活。
结构化算子公式
图7:结构化转移算子A_m,t的完整定义,包含四项:单位矩阵、对角项、运动树耦合项和低秩全局修正项。
算子A_m,t一共包含四项,每项对应一种动力学耦合的归纳偏置:
第一项是单位矩阵I,表示局部基的相对独立响应;第二项是对角矩阵Diag(d_m,t),刻画每个身体节点自身的局部修正——比如躯干质量变大时,躯干部位的响应需要被抑制;第三项是用关联矩阵E_m构造的Diag(w_m,t)E_m^T,把沿着运动树(kinematic tree)传播的耦合关系建模出来——比如大腿摆动会带动小腿,这个带动关系通过关节边的权重来体现;第四项是低秩项U_m Diag(s_m,t)U_m^T,捕获那些难以被局部和树状结构表达的剩余全局模式,比如躯干和四肢之间的整体协调、接触引起的非局部耦合。
作者很诚实地说,这个算子并不是对逆质量矩阵的精确近似,而是一种受刚体动力学局部性和重复性结构启发的约束化转移参数化。但正是这种有条理的约束,让模型在新形态参数下不至于“乱猜”。
除了结构上的信息分离,GraphOp-WM还设计了一个巧妙的训练技巧:成对形态监督(paired-morphology supervision)。训练时,取两个形态变体m1和m2,让它们从对齐的相同初始状态出发、执行完全相同的动作序列,然后让它们共享同一个局部基B̄t,但分别使用各自的算子A_m1,t和A_m2,t去预测增量,再分别和真实的增量做回归。
成对形态监督损失
图8:成对形态监督损失。两个形态变体共享同一个局部基,但使用各自的结构化算子,迫使形态差异被算子吸收。
这个训练方式等于直白地告诉模型:同一个局部基要能同时适配多个形态,差异你给我放进算子去。这种“不换基、换算子”的强制分配,让形态相关的转移变化被系统性地归入算子通路,而不是被共享基偷偷吸收,从而真正实现动力学“不变部分”和“可变部分”的分离。
整个训练流程可以概括为:采样一批形态变体和轨迹段,打包成图;用共享编码器生成不含形态信息的动态token;预测并归一化局部基;用形态编码器生成算子系数并加状态门控;构造算子、预测下一步状态并多步展开;最后计算动力学损失、奖励损失、TD损失和成对形态损失并回传。整个过程是把图神经网络、算子学习和模型预测控制整合在一个端到端框架里。
对角系数状态门控
图9:节点对角系数的状态依赖调制。静态系数和动态门控的乘积决定算子的实际作用。

从预测到规划:变图MPC如何工作

Predicting(预测)只是世界模型的一半,另一半是Planning(规划)。GraphOp-WM在训练好之后,可以采用TD-MPC风格的模型预测控制(MPC,Model Predictive Control)来做行动决策。
MPC的工作方式很像下棋时的“往前多想几步”:在决策时刻,基于当前状态生成一批候选动作序列,用世界模型把每条候选序列从头到尾模拟一遍,计算每个序列的累积奖励和最终价值,选最好的那个动作执行。TD-MPC则是在这个框架上加了一个学习得到的价值函数,这样只需要向前规划比较短的步数,用终端价值函数补齐剩余收益。
GraphOp-WM的MPC和多形态控制之所以能配合,靠的是三套接口设计。
先看图形级读取(graph-level readout)。奖励和价值的预测需要一个固定维度的输入,但机器人身体数量N_m在不同形态下可能不同。GraphOp-WM用一个学习的全局查询向量,对所有身体token做软注意力(softmax attention),加权求和得到全局特征h_t^g,再把它和根节点(躯干)的token拼起来,得到一个2d维的固定长度表示g_t。这个表示同时包含了全局信息和根节点局部信息,喂给奖励头和价值头。
图级读取公式
图10:全局读取表示,由根节点token和所有身体token的注意力加权和拼接而成。
再看动作表示。行动的数量取决于当前形态有多少个执行器。GraphOp-WM把动作挂在执行器边上,每条执行器边独立地根据其两端身体token和全局读取结果,输出一个高斯分布的均值和方差。规划时,候选动作张量的形状由当前形态的执行器数量决定,不同形态在不同时刻调用规划器时各自实例化不同形状的张量,不需要一个全局统一的动作维度上限。
最后看价值函数和奖励函数。奖励被拆成全局项加局部项:全局项根据g_t和任务embedding e_k预测,捕获前进、高度、直立程度等整体目标;局部项分别根据身体节点和动作边的表示预测,捕获接触和驱动代价。这样的分解能让奖励预测在不同形态之间共享大部分结构,只在局部项上体现形态差异。
奖励分解公式
图11:奖励分解为全局项、身体节点局部项和动作边局部项。
在具体实现上,GraphOp-WM通过替换TD-MPC2的向量编码器和MLP转移模块为打包图模块、替换奖励和价值输入为图形级读取、替换固定策略输出为边上的行动预测,从而保留了原有的MPPI/CEM优化逻辑和时序差分(TD)目标不变。换句话说,TD-MPC2的“骨架”还在,但“血肉”变成了一个真正理解机器人结构的图模型。

一套系统的MuJoCo泛化基准

要评估“形态参数泛化”,光有模型还不够,还得有一个能严格拆解的评测基准。GraphOp-WM在这方面也下了功夫,基于MuJoCo物理引擎定义了一套系统的形态参数划分。
MuJoCo形态参数化表
表格1:MuJoCo形态参数化设置。所有数值都是相对于标准Hopper、Walker2d或HalfCheetah模型的乘法因子。惯性参数在几何和质量变化后确定性重算。
基准覆盖三个经典的足式运动家族:Hopper(单腿跳跃机器人)、Walker2d(双足行走机器人)和HalfCheetah(两足跑动机器人)。每个家族的可变参数包括:连杆长度、连杆质量、躯干质量、关节阻尼和执行器传动比,惯性张量会根据几何和质量变化自动重算。训练时,参数在给定区间内用最大化拉丁超立方采样生成;测试时则划分为三个维度:插值(训练区间内未出现过的参数值)、外推(超出训练区间的参数值)和留出组合(单维度参数分别都见过、但组合方式没见过)。
这套基准的价值在于把“泛化”这个模糊的词拆成了可量化的子问题。插值考验的是“熟悉区间内的精细区分能力”,外推考验的是“超出经验范围的迁移能力”,留出组合考验的是“多因子交互的推理能力”。三个维度层层递进,比单一测试集更能反映模型的真实泛化水平。

总结与展望

GraphOp-WM的贡献可以概括为四个方面:一是提出了形态参数泛化这一世界模型研究中的明确问题;二是设计了一套“局部动力学基+结构化算子”的转移分解框架,将可复用结构和形态诱导耦合显式区分;三是通过架构信息分离、基归一化和成对形态监督,确保形态差异被算子吸收而不是被共享基偷走;四是定义了一套覆盖插值、外推和留出组合的MuJoCo基准,为后续研究提供了标准化的评估工具。
当然,GraphOp-WM的边界也很清晰。它面向的是“同一机器人家族内、拓扑不变”的形态参数泛化,而不是跨任意拓扑的通用控制器。它假设形态参数在部署前已知(从MJCF/URDF等文件中获得),不能处理在线形态识别。它也不打算取代通用世界模型,而是作为一种紧凑的结构化先验,补充到现有框架中。
未来的扩展方向很自然:把算子设计推广到拓扑变化场景,让模型不仅能适应参数改变,还能适应结构部件增减;结合在线参数估计,在观测中先识别形态再无缝切换算子;以及把这套图算子思路移植到更复杂的灵巧操作、人形机器人等高维系统上。
用一句话总结龙哥的感受:GraphOp-WM不搞花活,每一步设计都指向“泛化为什么难”这个真问题。这种把结构先验用对地方的研究,才是机器人学习该有的样子。
v2-74ba8bc1c6c52a48ea1c3c5c67685ca3_hd.jpg

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出GraphOp-WM,一种图结构世界模型,将机器人形态参数变化与局部动力学分离建模,通过结构化算子表达形态参数对动态耦合的影响,实现连续控制中未见形态参数的零样本预测与规划。
这篇工作最值得看的点是什么?论文未提供实验效果数据,仅提出方法框架与基准定义,未给出与基线方法的定量对比结果。
这篇工作的边界或风险在哪里?优点:提出明确的问题定义(形态参数泛化),设计了信息分离的因子化转移结构,具有清晰的归纳偏置,并定义了系统的基准测试协议。缺点:论文仅有方法描述与基准定义,缺乏任何实验验证、消融研究或与基线方法的对比,无法验证方法有效性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出GraphOp-WM,将机器人形态表示为属性图,将动力学转移分解为形态无关的局部动力学基与形态条件化的结构化图算子,实现跨未见形态参数的零样本泛化。

实验合理度:★★★★☆

零样本动力学预测误差、规划回报(MPC累积奖励)。

学术研究价值:★★★★☆

提出GraphOp-WM,将机器人形态表示为属性图,将动力学转移分解为形态无关的局部动力学基与形态条件化的结构化图算子,实现跨未见形态参数的零样本泛化;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

论文未明确报告计算量。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:定义(形态参数泛化),设计了信息分离的因子化转移结构,具有清晰的归纳偏置,并定义了系统的基准测试协议。缺点:论文仅有方法描述与基准定义,缺乏任何实验验证、消融研究或与基线方法的对比,无法验证方法有效性。

主要参考文献

[1] Yang X, Yang Y, Zhao Q. Graph-Operator World Models for Morphology-Parameter Generalization in Continuous Control[J]. arXiv preprint arXiv:2608.20936, 2026.
[2] Hafner D, Pasukonis J, Ba J, et al. Mastering diverse control tasks through world models[J]. Nature, 2025, 640: 647-653.
[3] Hansen N, Su H, Wang X. TD-MPC2: Scalable, robust world models for continuous control[C]. ICLR, 2024.
[4] Battaglia P W, Pascanu R, Lai M, et al. Interaction networks for learning about objects, relations and physics[C]. NeurIPS, 2016.
[5] Georgiev I, Giridhar V, Hansen N, et al. PWM: Policy learning with multi-task world models[C]. ICLR, 2025.
[6] Gupta A, Fan L, Ganguli S, et al. MetaMorph: Learning universal controllers with transformers[C]. ICLR, 2022.
[7] Todorov E, Erez T, Tassa Y. MuJoCo: A physics engine for model-based control[C]. IEEE/RSJ IROS, 2012: 5026-5033.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🤖 机器人换了零件还能不能稳稳走路?世界模型怎么泛化到新形态?进群和龙哥一起拆解GraphOp-WM的图算子玄机!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球