← 返回 PaperDaily
视觉与图像
机器人规划新范式:自动学习有向时间成本,14点提升不是梦
还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 4
查看原文
原论文信息如下:
1. JEPA规划器的“训练-规划”鸿沟:几何距离为何不靠谱?
想象一下:你让一个机器人从A点走到B点,它脑子里有一幅世界模型,可以想象未来各种行动序列的结果。这个模型是在大量无奖励的演示视频里训练出来的——它看过无数条轨迹,知道“按下这个按钮会弹出杯子”,但它不知道哪个动作更接近目标。传统做法是:用联合嵌入预测架构(JEPA, Joint-Embedding Predictive Architecture)来学习潜在空间中的预测,然后规划时用潜在空间中的欧几里得距离来打分:当前想象出来的最后状态与目标状态的嵌入越近,就认为这个动作序列越好。
这套思路的代表作是LeWM(Latent World Model,潜在世界模型),它把一个动作条件编码器-预测器和一个正则化项(SIGReg)组合在一起,在无奖励的演示日志上训练,然后在测试时用交叉熵方法(CEM, Cross-Entropy Method)搜索动作,并用终端潜在编码到目标嵌入的欧氏距离作为成本函数。听起来很完美,对吧?
但问题来了:JEPA训练优化的是短时程的潜在预测——让模型学会“下一帧的嵌入应该接近什么”,而规划需要的是多步排序——哪个动作序列能最快让我达成目标。这两件事根本不在一个频道上。
LeWM的规划成本直接用潜在空间里的欧几里得距离,这个距离完全是表示学习的副产品,从来没有被训练过来反映“到达目标还需要多少步”。在空间上看起来很近的两个点,可能实际动力学上隔了十万八千里;看起来远的,可能一步就到。这就造成了一个巨大的“训练-规划鸿沟”(train–plan gap)。
本文的作者们做了一个漂亮的实验来量化这个鸿沟。在Push-T任务上,他们抽取了大量演示轨迹上的状态对,计算LeWM的潜在欧氏距离与真实时间步间隔(time steps)之间的斯皮尔曼相关系数,只有0.65——说明几何距离只能勉强反映时间进度。而本文提出的方法,把同一个任务上的相关系数提升到了0.95,基本做到了完美对齐。下面这张图就是最直观的证据:
几何距离的不靠谱,根源在于它既没有方向性(对称的),也不是被训练来预测“到目标还有几步”的。在接触密集的操纵任务中,一个小的几何位移可能对应着巨大的控制难度变化;而在拓扑导航任务中,几何上靠近未必意味着可达。所以,必须有一种方法,从无奖励的演示日志中主动挖掘出“时间距离”信号,让规划成本真正反映时序进度。
顺便提一句,之前也有一些工作试图修补这个鸿沟,比如用离线强化学习(如IQL)学习一个价值函数来作为成本(Value-Guided JEPA),或者加入可到达性辅助损失(RC-aux),或者将潜在空间分解为进度子空间(SD-JEPA)。但这些方法要么引入了额外的价值估计模块,需要训练奖励模型,要么只是把时间结构当作辅助而不改变规划成本本身。本文走的是一条更直接的路:从演示日志中挖出一个有向的时间距离,并让它成为规划器直接使用的成本。
2. Temporal-Distance-JEPA:从无奖励轨迹中挖掘有向时间距离
Temporal-Distance-JEPA的核心思路非常直观:保留LeWM原来的编码器-预测器骨架和SIGReg正则化,然后额外训练一个“有向时间距离头”(directed cost head),让它可以给任意两个潜在状态对输出一个非负的数字,这个数字大致等于从第一个状态到第二个状态在演示轨迹上的时间步数差。
但这里有一个很关键的设计:到达目标的过程通常是不可逆的,或者说有方向性的。比如从厨房走到卧室可能需要10步,但从卧室走回厨房可能只需要8步(因为路径不同)。所以这个距离函数必须是非对称的——从A到B的成本不一定等于从B到A的成本。LeWM的欧氏距离是对称的,天生就不适合表达这种有向可达性。
本文采用度量残差网络(MRN, Metric-Residual Network)来参数化这个有向成本函数。具体来说,每个潜在编码z被映射到两个特征空间:对称特征φ_sym(z)和不对称特征φ_asym(z),然后成本定义为:
有了这个函数形式之后,就需要用演示数据来训练它。训练信号完全来自轨迹本身,不需要任何人工奖励。具体做法是:对于同一条演示轨迹上的任意两个时间步i和j(i
然而,仅仅训练dψ本身还不够,因为规划器在使用这个成本时,需要对一个H步开环展开(open-loop rollout)后的终端状态打分。如果训练时只用单步预测损失,展开误差会积累导致终端状态的质量下降。因此,本文增加了一个滚动一致性损失(rollout consistency loss):在训练时也用H步开环展开,让预测的潜在序列与真实的潜在序列之间的均方误差最小化。这个H与规划器使用的规划视界相同(本文设为5)。这样一来,训练目标和部署目标就对齐了。
整个Temporal-Distance-JEPA的训练管线如下图所示:
图2:Temporal-Distance-JEPA的训练与规划流程图。注意训练时新增了时间距离监督和滚动一致性损失。
总体的损失函数是四部分的加权和:单步预测损失L_pred(LeWM原有的)、滚动一致性损失L_roll(权重0.5)、时间距离损失L_td(权重1.0)、以及SIGReg正则化(权重0.09)。标准的预测窗口和规划视界都设为5。
到这里,方法的核心已经讲清楚了。接下来的问题就是:这个挖掘出来的有向时间距离,在实际规划中是否比原始的欧氏距离更好?答案远非一刀切——它完美依赖于任务的性质。
3. 实验验证:成本形式与任务结构协同设计的重要性
论文在LeWM的四个标准环境上进行了严格的对比实验:Two-Room(双房间导航)、Reacher(机械臂到达)、Push-T(推T形物体)和OGB-Cube(立方体操作)。这些环境覆盖了拓扑导航、灵活到达、以及接触密集的操纵任务,非常全面地检验了方法。
关键的实验设计是:在相同的评估预算(locked evaluation)下,对于拓扑主导的任务(Two-Room、Reacher),Temporal-Distance-JEPA直接部署学习到的有向成本dψ作为规划成本;对于接触密集的任务(Push-T、OGB-Cube),则使用同一个经过时间距离训练过的检查点,但规划成本仍然用潜在欧氏距离ℓ2。之所以这样设计,是因为作者们通过初步实验发现:在接触密集的任务中,dψ虽然能准确反映时间进度,但规划时直接用它却不如用ℓ2好——因为接触行为中几何精细度比时间进度更重要。
表2:锁定评估下的规划成功率(均值±标准差,10个种子)。Temporal-Distance-JEPA在每一个环境上都匹配或超越LeWM和RC-aux。注意在OGB-Cube上比LeWM提高了14.2个百分点,这是一个非常显著的提升。
仔细看结果:Two-Room上达到100%,Reacher上97.0%,说明直接在拓扑任务中使用dψ作为成本非常有效。OGB-Cube上82.2%,虽然仍不算特别高,但已经显著超越了LeWM的68.0%和RC-aux的81.6%。在Push-T上,86.0%也小幅领先于LeWM的83.6%。
值得注意的是,在接触密集的任务上,所有方法都使用ℓ2成本,但Temporal-Distance-JEPA仍然表现更好——这说明时间距离训练不仅产生了有向成本,还改善了潜在表示本身的质量,使得ℓ2距离在训练后的表示空间中也更能反映任务进度。换句话说,时间距离监督起到了表示学习信号的作用,同时校准了用于几何规划的欧氏空间。
对于PaperDaily MCP同基准实验的对比,我们需要注意的是:这里的LeWM和RC-aux基线都是本文作者复现的,使用相同的评估种子和评估协议,因此表2的结果是可信的公平比较。不过,后续如果其他实验室用不同的种子或超参数复现,结果可能会有小幅度波动。
4. 消融分析:有向头、跨轨迹负例与rollout一致性缺一不可
论文对Temporal-Distance-JEPA的三个关键组件进行了消融实验:有向成本头(directed head)、跨轨迹负例铰链项(cross-trajectory hinge)、以及滚动一致性损失(rollout consistency)。消融实验在Push-T环境下进行,使用3个独立种子,10个epoch训练。结果如下表:
表4:Push-T上的组件消融。全模型在ℓ2规划下达到85.3%;去掉有向头(替换为对称的欧氏投影距离)后掉到57.3%;去掉跨轨迹铰链后掉到77.3%;去掉滚动一致性后掉到60.0%。每个组件都不可或缺。
最致命的打击来自去掉有向头。当用对称的欧氏距离替换MRN结构后,尽管仍然使用时间标签进行回归,但模型的规划性能暴跌——在ℓ2规划设置下从85.3%降到57.3%,在有向成本dψ规划下更是只有55.3%。这说明:仅仅有数值上的时间标签远远不够,函数形式必须是有向的,才能让成本在规划中真正反映进度方向。
跨轨迹负例的去除也造成了明显下降:ℓ2规划从85.3%降到77.3%。没有负例,dψ可能会对完全不可达的状态对也输出小成本,从而让规划器产生虚假的乐观路径。铰链项保证了成本只对同轨迹上的正向对有意义,对其他对则维持较高值。
滚动一致性的去除同样危害巨大:ℓ2规划降到60.0%。这是因为基本的单步预测损失L_pred无法保证H步开环展开后的潜在状态质量,而规划器正好使用H步展开后的状态来计算成本。训练和部署之间的不一致导致规划器面对的是更高误差的终端状态,因此性能大打折扣。
这三个消融结果清晰地表明:成本形式、负样本挖掘、以及训练-部署对齐,三者必须协同设计,缺一不可——成本形式决定方向性,负样本防止假阳性,滚动一致性确保发布终端状态可靠。
5. 何时该用时间距离,何时该回归几何?— 接触相位的诊断与启示
前文我们提到本文提出了“双角色”设计:在拓扑任务中直接部署dψ,在接触密集任务中使用ℓ2。但这个分界线是如何确定的?论文作者做了一组很有洞察力的实验:固定同一检查点和所有其他条件,只改变规划成本类型——dψ、ℓ2、以及两者的混合(比例α=0.10)。结果如图3所示:
图3:规划成本类型对成功率的影响。dψ在拓扑任务中占优,ℓ2在接触密集任务中占优,混合成本介于两者之间。
在Two-Room和Reacher上,dψ明显优于ℓ2,说明拓扑进度主要由步骤数决定,有向时间距离是更好的排序信号。但在Push-T和OGB-Cube上,ℓ2反而大幅领先dψ,说明在接触密集的操纵中,空间几何精度(终端位置与目标位置的视觉接近度)比时间步骤距离更重要——一个在时间上靠近但空间上偏离一点的路径可能完全失败,而几何上接近的路径即使时间稍长也更容易成功。
这给我们的重要启示是:规划成本不应该被僵化地选择,而应该根据任务结构自适应决定。未来的工作可以探索自动检测任务应该使用哪种成本,或者学习一个混合机制。
此外,在Two-Room上,作者还展示了训练过程中dψ规划成功率的演化曲线(图4):早期epoch(1-4)不稳定,从第5个epoch开始逐步攀升,到第9个epoch达到100%并超过LeWM的永久ℓ2基线(97.4%)。这说明时间距离训练需要足够的epoch才能收敛到好的规划表现,但一旦收敛,就会超越几何方法。
图4:Two-Room上训练epoch与成功率的关系。dψ成本在训练后期展现出优势。
龙迷三问
Q1: 这篇论文解决的核心问题是什么? 本文解决的是JEPA世界模型规划器中的“训练-规划鸿沟”:模型训练时只优化短时程潜在预测,而规划需要多步排序的进度成本。作者从无奖励的演示日志中挖掘出有向时间距离dψ,并通过双角色设计(拓扑任务直接用dψ,接触任务用ℓ2)来提升规划性能。
Q2: 有向时间距离dψ和欧氏距离ℓ2有什么区别? 欧氏距离是对称的:‖z1-z2‖ = ‖z2-z1‖;而dψ通过MRN网络实现了非对称性,可以反映从A到B与从B到A的不同可达性。另外,dψ被训练为近似时间步数差,而ℓ2只是嵌入空间的副产品。
Q3: 这个方法有没有局限性?如果我想在真实机器人上部署,需要注意什么? 主要局限性在于:需要一定数量的演示轨迹来挖掘时间标签,并且跨轨迹负例的边际m需要手动调节。另外,在接触密集任务中dψ不能直接作为规划成本,需要切换到ℓ2。真实部署时还需要考虑因果推断、部分可观测性等问题,本文在完全可观测的模拟环境中进行,未涉及这些挑战。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
从诊断训练-规划鸿沟到提出双角色成本设计,都是原创性很强的思路。特别是“成本形式与部署方式应协同设计”的见解,对领域有启发。
实验合理度: ★★★★★
在4个标准环境上进行,使用10个种子的锁定评估,消融实验完整,成本类型比较控制得很好。与LeWM和RC-aux的对比公平且有意义。
学术研究价值: ★★★★★
指出了JEPA规划器的一个根本性缺陷,并给出了一个简洁有效的解决方案。对后续世界模型规划、表示学习、以及任务感知成本设计都有重要参考价值。
稳定性: ★★★★☆
在多个环境上表现一致,且通过epoch曲线展示了收敛行为。但训练过程前期可能不稳定(图4所示),需要达到一定epoch才稳定。总体良好。
适应性以及泛化能力: ★★★★☆
在四种不同性质的任务上都有效,但接触密集任务中dψ不能直接替代ℓ2,说明泛化需要任务感知。跨轨迹负例的边际m等超参数可能需要针对新任务调整。
硬件需求及成本: ★★★★☆
训练时增加了时间距离损失和滚动一致性损失,计算量略大于LeWM但可以接受;推理时与LeWM一样使用CEM/iCEM,无额外推理开销。规划和训练均可在一块GPU上完成。
复现难度: ★★★★☆
代码已经开源,基于stable-worldmodel框架,并提供了完整的环境设置和训练脚本。不过需要下载离线演示数据集,配置可能稍麻烦。总体复现难度中等。
产品化成熟度: ★★★☆☆
本方法在模拟器环境中验证,尚未在真实机器人上进行测试。但核心组件(MRN、对比负例、滚动一致性)都是可工程化的。对于需要从离线日志中学习的机器人MPC系统,有直接落地的潜力,前提是任务结构清晰且成本类型可确定。
可能的问题: 对于接触密集任务,为什么dψ在规划时不如ℓ2,作者提供的分析略显不充分(只归因于接触相位);两个角色之间的切换点需要人工选择,缺少自适应机制;跨轨迹负例的边际m对不同数据集敏感性未深入探讨。
[1] J. Bai and J. Xiong. Temporal-Distance-JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control. arXiv:2607.25337v2, 2026.
[2] B. Mazoure et al. LeWM: Latent World Model for Model Predictive Control. NeurIPS 2024.
[3] R. Rubinstein and D. Kroese. The Cross-Entropy Method. Springer, 2004.
[4] A. Destrade et al. Value-Guided JEPA: Goal-Conditioned Planning via Quasimetric Representations. CoRL 2025.
[5] P. Sermanet et al. VIP: Learning Vision-based Intrinsic Reward. ICRA 2018.
[6] M. Watter et al. PlaNet: Learning Latent Dynamics for Planning. ICML 2015.
[7] N. Hansen et al. TD-MPC: Temporal Difference Model Predictive Control. NeurIPS 2022.
[8] S. Wang et al. Temporal Straightening for Latent Planning. ICLR 2025.
[9] D. Hafner et al. Dreamer: A World Model from Pixels. NeurIPS 2019.
[10] Y. Wang et al. RC-aux: Horizon-conditioned Reachability Auxiliary for Latent World Models. arXiv:2505.12345, 2025.
[11] Y. LeCun et al. A Tutorial on Energy-Based Learning. Predicting Structured Data, 2006.
[12] D. Hafner. World Model as a Whole. arXiv:2501.00001, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
还在为机器人规划中的奖励函数设计头疼?Temporal-Distance-JEPA告诉你,从无奖励演示里“挖掘”时间距离就够了!导航用有向时间成本,操作靠几何距离,一招解决“训练-规划”鸿沟。想和龙哥一起探讨更多世界模型和机器人规划的前沿技术?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 世界模型+上海+HKBU+龙粉) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群