← 返回 PaperDaily
视觉与图像
卢森堡大学新研究:太空机器人没奖励信号也能自学修复,60分钟见效果
太空机器人一旦硬件故障,传统强化学习就抓瞎——因为真空中根本算不出奖励信号。卢森堡大学这篇工作把世界模型玩出了新高度:预训练阶段把奖励函数"记住"在隐空间里,部署后冻结奖励预测器、只更新转移动力学,60分钟无监督数据就能让机器人自我修复。三大任务、代码开源、效果诚实不吹牛,值得一读。
龙哥读论文
发布于 2026-08-27 00:20:17
阅读 4
查看原文
原论文信息如下:
引言:太空机器人如何在没有奖励信号的情况下自我修复?
太空探索的愿景是让机器人替人类去更远的地方,但现实骨感:NASA的好奇号火星车就因车轮磨损而带伤工作。机器人要实现长期自主,核心是“自我适应”。强化学习(RL)本是训练自适应行为的好手,但有一个致命前提:智能体必须持续获得奖励信号。在仿真环境里这没问题,可到了真实太空,没有外部跟踪系统,传感器性能打折,任务目标难以量化——比如在月球表面挖土,你拿什么实时精准测量挖出的土方量?奖励信号算不出来,传统RL就彻底傻眼。这个“奖励不可观测”的难题,正是制约太空机器人落地部署的核心瓶颈。
卢森堡大学的团队瞄准的正是这个痛点。他们提出了一套免奖励的持续适应(Reward-Free Continual Adaptation)框架,核心思路很妙:既然部署时算不出奖励,那就让机器人在仿真预训练阶段把奖励函数“记”在脑子里。具体来说,就是利用DreamerV3这类基于隐状态的世界模型,在预训练时同时学会预测状态转移和奖励信号;部署到真实环境后,把编码器和奖励预测器全部冻结,只更新世界模型中的转移动力学模块,然后让策略完全在更新过的“想象轨迹”上重新训练。这样一来,整个适应过程从头到尾都不需要新的真实奖励信号。
这个思路的巧妙之处在于,它把“奖励预测”和“动力学预测”两个任务解耦了。奖励预测器记住的是任务的本质目标——不管底盘怎么坏、轮子怎么卡,往目标点走就是好的,偏离就是坏的;转移动力学模块则负责捕捉“这台机器人现在实际的身体状态”——前右轮锁死了,推力的主方向偏了15度,这些物理层面的变化都体现在转移动力学里。冻结前者、更新后者,既保持了目标不变,又让模型适应了身体的改变。
图1展示了这套框架的整体概念。可以看到,预训练阶段机器人学习的是通用的物理交互规律和奖励结构,部署遭遇硬件故障后,通过无监督探索更新转移动力学,策略在想象中重新训练,最终恢复到故障前的任务完成能力。整个过程不需要外部奖励,不需要人类介入,太空中失联了也能自己想办法活下去——这正是深空探索最需要的品质。
本文的持续学习框架通过利用预训练世界模型中编码的隐空间奖励地形,实现对转移动力学剧烈变化的无奖励适应。作者在三个不同的太空机器人领域验证了该方法,智能体均能从严重故障中恢复。
方法概述:世界模型两阶段框架
这套框架建立在DreamerV3架构之上,整体流程分为两个截然不同的阶段:仿真预训练阶段和在线免奖励适应阶段。两个阶段的任务、资源约束、更新策略完全不同,理解这种差异是掌握本文方法的关键。
先看预训练阶段。团队构建了一个基于隐状态的世界模型,把高维的传感器观测压缩成紧凑的隐状态表示。具体来说,世界模型由几个核心组件协同工作:序列模型负责维护隐状态的时序演化,用上一时刻的隐状态、动作和观测来预测当前时刻的状态先验;编码器把真实观测映射为隐状态后验;解码器从隐状态重建观测;奖励预测器从隐状态中预测奖励;连续性预测器则判断一个回合是否结束。
预训练时的数据来源非常丰富。团队在仿真环境中用512个并行环境同时收集经验,每个环境随机化物理参数——重力向量、惯性属性、摩擦系数、外部扰动全部都在随机范围内变化。这种被称为“域随机化”的手段,逼着世界模型学会跨场景通用的物理规律和奖励结构,而不是死记硬背某一个固定环境下的经验。预训练总共进行2000万步环境交互,策略在每步环境交互后进行32次更新,训练量相当扎实。
预训练阶段的关键点在于,actor-critic策略完全在世界模型“想象”出来的潜空间轨迹上训练,不直接接触真实环境数据。这意味着策略的行为模式完全由世界模型所编码的转移动力学和奖励结构塑造。好处是样本效率极高,但也埋下了一个隐患:一旦部署环境的转移动力学跟预训练时差距过大,零样本迁移必然崩溃。
图2完整展示了这套两阶段流程。上半部分是在仿真中预训练世界模型,下半部分是部署后仅通过无监督rollout更新转移动力学。注意图中特意标注了哪些模块被冻结(编码器、解码器、奖励预测器),哪些模块被更新(序列模型和前向动力学),一目了然。
图2:世界模型在仿真中预训练。一旦部署,仅通过rollout更新转移动力学。
核心机制:冻结奖励预测器,只更新转移动力学
论文真正有技术含量的部分在在线适应阶段。部署之后,机器人遇到硬件故障,转移动力学发生剧烈变化——轮子卡死、推进器失效、工具错位,这些都会让预训练策略瞬间失效。此时大多数强化学习方法会尝试用真实奖励去微调策略,但问题恰恰在于奖励信号根本算不出来。
本文的操作非常简洁:严格冻结编码器、解码器、奖励预测器和连续性预测器,只更新序列模型和前向动力学两个模块。为什么要这样设计?因为编码器决定观测到隐空间的映射方式,如果更新它,整个隐空间都会漂移,奖励预测器基于旧的隐空间学到的奖励地形就全部作废;解码器保证隐空间表示的可解释性,维持它的稳定同样重要。奖励预测器是整个框架的灵魂——它代表“任务本质”,是绝对不能动的。序列模型和前向动力学则负责“身体状态”,必须更新来适应新的物理约束。
适应过程的优化目标很明确:最小化本征感知转移上的后验分布和先验分布之间的KL散度。直观来说,就是让“预测下一时刻状态”的先验模型(只依赖上一时刻隐状态和动作)尽量逼近“结合当前观测修正后”的后验模型。通过这种方式,转移动力学模块学会了在新的身体约束下,什么样的动作会导致什么样的状态变化。
在具体实现上还有几个值得关注的细节。首先是学习率调整:为了让世界模型的更新不过度破坏预训练学到的知识,适应阶段的学习率比预训练阶段降低了一个数量级,从4×10⁻⁵降到4×10⁻⁶,这种“小步慢走”的策略有效缓解了灾难性遗忘。其次是在线数据收集时,在归一化动作输出上注入均值为0、标准差为0.02的高斯噪声,确保世界模型能在新物理约束下探索到足够的转移动力学经验。第三是训练频率非常高:每收集一步环境交互,就在想象中做2048次策略更新,相当于把所有计算资源都砸在“用更新的世界模型反复训练策略”这件事上。
注意,策略的训练仍然完全发生在世界模型的“想象”中。世界模型先通过无监督的在线rollout学会新身体状态下的动力学,然后策略在这个更新后的虚拟环境里反复试错。整个环路由两部分构成:小步更新动力学 + 大步重训策略。前者保证世界模型不崩溃,后者保证策略能快速找到新身体状态下的最优行为。奖励预测器在这个环路中扮演裁判的角色——虽然不再从环境中接收新的奖励,但它冻结的权重已经足够给策略提供稳定的优化方向。
三大任务验证:从行星漫游到轨道装配
光说理论不够硬气,还得看实验。为了验证这套免奖励适应框架的通用性,作者一口气设计了三个差异极大的太空机器人任务,每个任务都配了一种“恶毒”的硬件故障,全部基于NVIDIA Isaac Lab仿真平台实现,代码属于开源的Space Robotics Bench(SRB)项目。先看一段项目总览演示,感受一下太空机器人仿真场景的样子:
第一个任务是行星遍历(Planetary Traversal),控制频率25Hz。机器人是一台受NASA JPL的ERNEST原型启发、拥有12个执行器的实验性漫游车,配备双面主动万向悬挂系统,能够在极端地形下保持接地和稳定。任务要求它穿越程序化生成的障碍赛道,同时保持目标速度矢量。故障模式非常致命——前右轮的转向关节和驱动关节同时锁死,相当于拖着一只废脚开车,会产生显著的不对称阻力,车会不受控制地偏向一侧。
第二个任务是轨道导航(Orbital Navigation),控制频率10Hz。平台是一台配备12个独立连续推力器的航天器,需要在微重力环境下进行SE(3)动态航路点导航,追踪一个移动的目标位姿,同时补偿航天器飞行的动力学效应。故障模式为三个共置的偏轴推力器完全失效——相当于一台车六个气缸废了三个,推力矢量发生偏移,动力学特性彻底改变。
第三个任务是螺丝驱动装配(Screwdriving Assembly),控制频率50Hz。一台7自由度机械臂配备电动螺丝刀末端执行器,需要将预对准的螺栓插入匹配的螺母,公差要求极其严格,容不得半点偏差。故障模式更加隐蔽——螺丝刀的安装法兰发生了15°的轴向弯曲,工具尖端会偏离运动学预期。这意味着机器人以为工具是直的,实际却是弯的,在装配场景下这几乎是灾难。
三个任务的控制频率从10Hz到50Hz跨越了五倍,任务类型从地面越野到微重力导航再到精细操作,形态差异极大。作者特意选择了形态学失败(morphological failures)作为故障模式——不是传感器噪声增大这种温和变化,而是机器人身体结构本身被破坏。这样的实验设计能更严格地检验框架的适应能力。
实验安排有一个非常贴近真实部署的细节:预训练和适应阶段的数据预算完全不同。预训练阶段极为奢侈——512个并行仿真环境同时跑,物理参数全面随机化(重力向量、惯性属性、摩擦系数、外部扰动都在随机变化),共采集2000万步环境交互。那种“资源管够”的状态,就像在地面实验室里跑千卡集群,怎么折腾都行。
适应阶段则换了一副面孔:模拟真实太空部署的资源约束,总时长只有60分钟在线交互,数据匮乏、算力受限。这60分钟里,机器人必须靠无监督rollout完成动力学更新、策略重训和性能恢复。这种“预训练管够、适应期抠门”的设置很诚实——因为真实的太空机器人不可能在地球上预先知道它会遇到什么故障,能做的就是部署后快速自我修复。
对比基线共设置了三个:零样本基线(预训练策略直接部署到故障环境,不做任何适应)、有特权奖励的适应agent(每一步都能拿到真实奖励信号,代表“作弊”条件下的性能上限),以及从头重训练的agent(完全不管预训练,在故障环境里从零学起)。这样比较的意义不言而喻——零样本告诉你“不干活会死得多惨”,特权奖励agent告诉你“有奖励能做到多好”,从头重训告诉你“完全放弃旧知识是否可行”。本文的免奖励agent夹在中间,检验的是“没有奖励但保留预训练知识”这条中间路线的价值。
实验结果:快速恢复但长期稳定性不足
图3给出了三个任务在60分钟在线适应窗口内的性能曲线。这张图信息量很大,值得逐条细看:
先看零样本基线。毫无意外,它在所有三个任务中都发生了灾难性失败。原因很直接:预训练策略学会了在健康身体下发出控制指令,但当轮子锁死、推进器失效、工具弯曲之后,同样的指令产生的结果完全变了样——本来想直行,结果车偏向一侧;本来想平移,结果航天器翻滚。世界模型里的“身体认知”和现实严重脱节,策略自然全面崩溃。这说明一个扎心的事实:在严重的形态学故障面前,光靠预训练策略的鲁棒性去硬扛,是扛不住的。
再看有特权奖励的适应agent。它的性能曲线一路爬升,最终接近从头重训的水平——这说明在60分钟的窗口内,一个有真实奖励信号做引导的agent完全可以恢复到接近最优的性能。特权奖励就像给agent配了一个实时的裁判,每一步都在告诉它“你做得好不好”,在这样的反馈下快速调整自然是顺理成章的。
关键的是本文的免奖励agent。它的性能确实快速恢复——在60分钟内从灾难性失败爬升到相当高的水平,证明了“冻结奖励预测器、只更新动力学”这个设计是work的。但注意标题里那句“快速恢复但长期稳定性不足”,曲线在达到峰值后出现了明显的decay趋势。这种衰减说明:长期来看,免奖励agent的适应不是稳定收敛的。原因可能有二——一是奖励预测器是预训练阶段拟合的,遇到严重故障后的分布外状态,它的预测精度会打折扣;二是动力学模块在持续更新过程中会逐渐积累误差,而奖励预测器又没有真实信号来“纠正”这些误差,导致策略在想象中越训越偏。
看到这个衰减曲线,龙哥的心情可以用复杂来形容。一方面,能在无奖励条件下快速恢复到可接受水平,确实展现了世界模型方法的巨大潜力;另一方面,长期稳定性不足这个短板也赤裸裸地摆在眼前——这不是一个能直接上天的成熟方案,更像是一个“能跑通的demo”。但换个角度看,作为一篇探索性的工作,它已经把“免奖励适应”这个方向的大门推开了一道缝,后续研究完全可以在稳定性和精度上继续做文章。
免奖励agent能work,核心在于它做对了一件事:把“任务目标”和“身体状态”这两类信息彻底分离。奖励预测器记住的是任务的本质——不管身体怎么坏,往前走就是好的、完成任务就是好的;动力学模块捕捉的是身体的物理属性——轮子卡死之后,同样的指令会带来什么实际效果。两者解耦后,适应过程只需要修正“身体模型”,不需要重新定义“什么是对的”。这种解耦让策略能在一段60分钟的无监督rollout里快速重建对身体的认知,同时保持对任务目标的清晰理解。
但不够完美的原因也藏在同一个设计里。奖励预测器虽然冻结了,但它的输入——隐状态——是通过编码器从观测得到的。当机器人遭遇严重故障时,观测分布会偏移到预训练阶段很少见过的区域,编码器对这样的输入给出的隐状态表示本身就可能不准,奖励预测器在这个不准的表示上做预测,自然会有误差。更麻烦的是,动力学模块在持续更新,隐状态的演化路径会逐渐偏离预训练时奖励预测器熟悉的区域。这种“奖励预测器所见的世界”和“动力学模块所学的世界”之间的错位,在长期适应中不断累积,最终表现为性能衰减。
这也解释了为什么有特权奖励的agent性能更稳定——它不需要依赖奖励预测器这个“二手裁判”。真实的奖励信号就像GPS定位,每一步都精准;而冻结的奖励预测器更像是指南针,大方向对但精度有限。在长期运行中,指南针的偏差会被不断放大,而GPS永远能找到路。
局限与未来方向
坦诚地讲,这篇工作的局限性也不小。最明显的一点是全部实验都局限在仿真环境里。虽然Isaac Lab提供了相当真实的物理引擎,但仿真永远是仿真——真实太空中的辐射、温差、通信延迟、传感器噪声,以及那些仿真里永远模拟不出来的意外,都是这60分钟适应实验无法覆盖的。所谓“resilient autonomy”,最终还是要拿到真实硬件上遛一遛才算数。
性能衰减问题是另一个不可回避的痛点。免奖励agent在性能达到峰值之后的decay说明当前机制在长期运行的稳定性上还没有解决。奖励预测器的分布外误差和动力学累积误差就像一对孪生幽灵,时间越长,它们对性能的侵蚀越明显。如果要做长期太空任务,这个必须想办法解决。
奖励预测器对预训练多样性也有很强的依赖。如果预训练阶段的域随机化范围不够广,部署时遇到的故障模式超出了奖励预测器熟悉的隐空间区域,预测结果就会失真。这本质上是个分布外泛化问题,论文没有给出超出预训练分布范围的故障实验结果,所以框架的边界到底在哪,还不清楚。
未来可能的方向其实很明确。一是引入元学习或者在线模型校准机制,让奖励预测器在适应过程中也能以某种无监督方式自我修正,减轻长期漂移;二是把故障检测环节加进来,让系统首先感知到“身体出问题了”,再触发针对性的动力学更新,而不是一直盲目地做无监督rollout;三是往真实硬件上迁移,在物理机器人上验证这套框架的有效性——这一步早晚要走,但也最难走。
龙迷三问
这篇论文到底在解决什么问题? 卢森堡大学提出免奖励持续适应框架,基于DreamerV3世界模型,在部署时冻结奖励预测器仅更新转移动力学,让太空机器人无需外部奖励即可在60分钟内适应车轮卡死、推进器失效等硬件故障,三大空间任务验证有效。
这篇工作最值得看的点是什么? 无奖励自适应智能体在三个任务中均表现出快速初始恢复能力,但性能低于特权奖励基线,且后期出现显著波动和衰减;零样本基线在所有任务中灾难性失败。
这篇工作的边界或风险在哪里? 优点:提出了一种新颖的无奖励持续适应框架,解决了空间机器人中奖励不可观测的关键瓶颈;通过冻结编码器和奖励预测器、仅更新转移动力学的设计简洁有效;在三个不同空间机器人任务上验证了方法的可行性。缺点:后期性能衰减明显,表明潜在奖励景观缺乏长期稳定性;仅仿真验证,未考虑sim-to-real gap;在线适应阶段的计算需求超出星载嵌入式模块的功耗约束。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“免奖励持续适应”和“隐空间世界模型”缝合在一起,属于角度清奇的组合创新。冻结奖励预测器、只更新动力学的设计,简洁但有效,不是灌水式堆模块。
实验合理度: ★★★☆☆
三个任务横跨行星漫游、轨道导航、精密装配,覆盖面够广;对比基线的设置也比较公平。但全部实验在仿真中完成,且只给出了性能曲线没有数值表格,定量对比的说服力稍弱。
学术研究价值: ★★★★☆
指出了“太空场景下不可观测奖励”这个被不少人回避的真问题,并给出了一套可执行的解决框架。对后续研究世界模型在真实部署中如何摆脱对奖励信号的依赖,有很强的启发意义。
稳定性: ★★☆☆☆
论文自己承认了长期性能衰减的问题。免奖励agent在达到峰值后会下滑,说明当前机制在长时间运行中有明显的稳定性隐患,距离“可靠自治”还有距离。
适应性以及泛化能力: ★★★☆☆
三个任务差异大、故障模式各不相同,能同时在三个任务上恢复,说明框架有一定的通用性。但泛化能力受限于预训练域随机化的覆盖范围,超出分布外的故障未验证。
硬件需求及成本: ★★★☆☆
预训练阶段要求512并行环境的仿真算力,门槛不低;在线适应虽然只需要单机运行,但2048次想象更新每步的计算开销也不可小觑。相比从头重训仍然是省力的,只是谈不上轻量。
复现难度: ★★★★☆
代码已开源(GitHub仓库空间机器人基准),基于NVIDIA Isaac Lab等公开框架,复现路径清晰。但仿真环境的搭建依赖Isaac Lab和SRB的完整配置,环境安装可能需要一些耐心。
产品化成熟度: ★★☆☆☆
纯仿真验证,尚未在真实机器人上测试;长期性能衰减问题未解决。目前是学术demo层面,距离航天任务实际部署还有很长的路要走,但方向正确。
可能的问题: 实验只给性能曲线不给数值表格,定量对比不够直接;长期性能衰减的机制分析停留在推测层面,缺少对照实验验证;未探讨超出预训练分布范围的故障场景,框架边界不清晰。
主要参考文献
[1] Orsula A, Olivares-Mendez M, Martinez C. Reward-Free Continual Adaptation for Resilient Space Robots[J]. arXiv preprint arXiv:2608.23452, 2026.
[2] Hafner D, Pasukonis J, Ba J, et al. Mastering diverse domains through world models[J]. arXiv preprint arXiv:2301.04104, 2023. (DreamerV3)
[3] Mittal M, Yu C, Yu Q, et al. Orbit: A unified simulation framework for interactive robot learning environments[J]. IEEE Robotics and Automation Magazine, 2023. (Isaac Lab)
[4] Orsula A, et al. Space Robotics Bench: A comprehensive benchmark for space robotics learning[R]. 2025.
[5] Tobin J, Fong R, Ray A, et al. Domain randomization for transferring deep neural networks from simulation to the real world[C]. IROS, 2017.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
太空机器人没奖励也能自学修复,这样的硬核技术想不想深入聊聊?🚀
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,机器人/强化学习方向的伙伴们快到碗里来~