← 返回 PaperDaily 视觉与图像

UNC+CMU新作DenseReward:逐帧奖励学会看翻车

机器人强化学习最怕的不是“学不会”,而是“根本不知道哪里错了”。DenseReward偏偏把失败这件事做成了数据,顺手把奖励从“看终局”升级成“看过程”,这就很对路。 项目视频:https://dense-reward.github.io/assets/videos/DenseReward.mp4

UNC+CMU新作DenseReward:逐帧奖励学会看翻车
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
机器人强化学习最怕的不是“学不会”,而是“根本不知道哪里错了”。DenseReward偏偏把失败这件事做成了数据,顺手把奖励从“看终局”升级成“看过程”,这就很对路。
项目视频:https://dense-reward.github.io/assets/videos/DenseReward.mp4


原论文信息如下:
论文标题:
DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
发表日期:
2026年07月
发表单位:
University of North Carolina at Chapel Hill, Carnegie Mellon University, Shanghai Jiao Tong University, Amazon AWS AI
原文链接:
https://arxiv.org/pdf/2607.13033v1.pdf
项目链接:
https://dense-reward.github.io/

引言

机器人强化学习最难的地方,往往不是“有没有模型”,而是“奖励到底怎么给”。只给终局成败,策略学得像看结果猜过程;而 DenseReward 走的是另一条路:先把失败场景系统性做出来,再把奖励细化到每一帧,让机器人知道自己是在接近成功,还是正在一步步把事情做歪。
这篇工作最有意思的点,不是单纯把奖励变“密”,而是把失败数据也规模化了:碰撞、抓取失败、掉落、恢复动作,全都被系统纳入训练。这样一来,奖励模型终于不再只会夸成功案例,开始学会识别“哪里不对劲”。

方法概述

图1:密集机器人奖励模型总览。DenseReward通过自动生成多样失败轨迹构建27k条数据,输入任务指令与当前帧、历史帧后,输出逐帧密集奖励,并可用于后续强化学习优化策略。
DenseReward 的主线很清楚:先造数据,再学奖励,最后把奖励喂回控制和强化学习里。输入不是单帧图像,而是任务指令加上当前帧与历史帧,模型输出的是当前时刻的密集奖励分数,分数越高,说明任务进度越接近成功。
图2:自动数据生成与失败合成总览。五阶段操作流程结合目标扰动,合成多种真实物理失败模式。
方法的关键不在“奖励模型”四个字,而在前面的数据管线。论文把操作任务拆成 Reach、Grasp、Lift、Move、Place 五个阶段,再通过针对性的扰动去制造不同失败:碰撞、抓空、掉落、抖动路径、恢复执行。说白了,就是不让模型只看“成功毕业照”,还得见识“翻车现场”。
项目整体效果视频演示
项目演示视频展示了 DenseReward 在多种操作任务中的逐帧奖励预测和策略优化过程,直观说明这个模型不是只会“判死刑”,而是能给机器人提供连续的过程反馈。

实验结果

图3:密集奖励预测定性对比。DenseReward在成功和失败轨迹上都比强基线更贴合任务进度曲线。
在密集奖励预测上,DenseReward 的曲线更像“懂行的人在看过程”,而不是“只看最后交卷的人”。它在成功轨迹上能稳步上升,在失败轨迹上也能及时回落,说明它确实学到了任务进度,而不是只学会了给结局打分。
图4:基于密集奖励的模型预测控制。
把奖励模型接到模型预测控制里后,DenseReward 也能直接帮控制器挑动作。论文在 can、cup、lemon 三个任务上测试,DenseReward 的平均距离更低,说明它给出的奖励更适合指导机器人往目标靠近,而不是在桌面上“瞎忙活”。
图5:在 LIBERO 上进行 PPO 微调。
在 LIBERO 上做在线强化学习时,DenseReward 作为中间奖励补上了稀疏终局信号的空白,PPO 的训练曲线因此更稳,部分任务的最终成功率也明显提高。这个结果很重要,因为它说明密集奖励不是只会“离线打分”,还能真给策略优化帮上忙。
图6:真实世界中的 DSRL 实验。
真实世界实验更有说服力。叠杯子任务成功率从 40% 提升到 80%,放球入篮从 30% 提升到 70%。这类提升不算“纸面爽文”,因为真实机器人每一步都要付出代价,能涨这么多,说明 DenseReward 的反馈确实有用。

龙哥点评

论文创新性分数:★★★★☆ 把失败合成和密集奖励绑在一起,形成了闭环。

实验合理度:★★★★☆ 仿真、MPC、PPO、真实机器人四层验证,链条完整。

学术研究价值:★★★★☆ 抓住了稀疏奖励和失败数据不足的真正痛点。

稳定性:★★★☆☆ 结果不错,但复杂长任务还需更多验证。

适应性以及泛化能力:★★★☆☆ 多数据源和多任务有迁移性,但距离“通吃”还早。

硬件需求及成本:★★★☆☆ 在线 RL 成本比纯离线方法高。

复现难度:★★★★☆ 数据管线、仿真、控制器和真实平台需搭齐,工程门槛不低。

产品化成熟度:★★★☆☆ 更像可落地的研究方案,离大规模部署还差工程打磨。

可能的问题:失败合成依赖仿真可控性;场景更复杂时,合成失败是否足够贴近现实,决定其上限。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

失败数据一定比成功数据更重要吗?不一定,但在奖励学习里,失败数据往往更值钱,因为它告诉模型“什么地方开始出问题”。只有成功样本时,模型很容易把边界学糊。

密集奖励和稀疏奖励差别到底在哪?稀疏奖励像期末只看分数,密集奖励像每一步都给反馈。对长时序机器人操作来说,后者更容易解决信用分配问题。

这类方法最难落地的地方是什么?不是模型本身,而是数据生成、物理仿真、真实控制和在线训练的整套工程链路。链路一长,成本和稳定性就开始考验团队耐心。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

主要参考文献

A. Khazatsky, K. Pertsch, S. Nair, A. Balakrishna, S. Dasari, S. Karamcheti, S. Nasiriany, M. K. Srirama, L. Y. Chen, K. Ellis, et al. Droid: A large-scale in-the-wild robot manipulation dataset. arXiv preprint arXiv:2403.12945, 2024.
H.-S. Fang, C. Wang, M. Gou, and C. Lu. GraspNet-1Billion: A large-scale benchmark for general object grasping. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 11444–11453, 2020.
B. Sundaralingam, S. K. S. Hari, A. Fishman, C. Garrett, K. Van Wyk, V. Blukis, A. Millane, H. Oleynikova, A. Handa, F. Ramos, et al. CuRobo: Parallelized collision-free robot motion generation. In 2023 IEEE International Conference on Robotics and Automation (ICRA), pages 8112–8119. IEEE, 2023.
K. Black, N. Brown, D. Driess, A. Esmail, M. Equi, C. Finn, N. Fusai, L. Groom, K. Hausman, B. Ichter, et al. π0: A vision-language-action flow model for general robot control. arXiv preprint arXiv:2410.24164, 2024.
J. Schulman, F. Wolski, P. Dhariwal, A. Radford, and O. Klimov. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347, 2017.
Y. J. Ma, J. Hejna, C. Fu, D. Shah, J. Liang, Z. Xu, S. Kirmani, P. Xu, D. Driess, T. Xiao, et al. Vision language models are in-context value learners. In International Conference on Learning Representations, volume 2025, pages 33984–34009, 2025.

奖励稀缺:机器人强化学习的关键瓶颈

机器人强化学习最难受的地方,往往不是“模型不够大”,而是“奖励太稀”。终局只给一个成败信号,机器人就像做题只看最后一页答案,前面哪一步错了、错在抓取还是移动、是碰撞还是掉落,统统不知道。结果就是信用分配很差,策略学得慢,学得还容易歪。
DenseReward 盯上的正是这个老大难问题。它不是简单地把奖励“加密”一下,而是先解决一个更麻烦的前置条件:训练奖励模型所需的失败数据从哪来。因为只有成功轨迹,模型很容易学成“成功识别器”;真正要让它会打分,就得让它见过大量翻车现场。
图1:密集机器人奖励模型总览。DenseReward通过自动生成多样失败轨迹构建27k条数据,输入任务指令与当前帧、历史帧后,输出逐帧密集奖励,并可用于后续强化学习优化策略。
图1把整条链路讲得很直白:先自动生成多样轨迹,尤其是失败轨迹,再给每一帧配上密集奖励标注,最后让模型根据任务指令、当前画面和历史画面,输出当前时刻的任务进度分数。这个分数不是“成了还是没成”的二值判断,而是更像“离成功还有多远”的连续刻度。
这类方法真正值钱的地方,在于它把“奖励”从结果导向改成了过程导向。机器人不是只需要知道“任务完成没”,更需要知道“现在是在接近成功,还是正在把局面搞砸”。对长时序操作来说,这种过程反馈比终局打分更像人类教练的风格:别等比赛结束才骂,动作刚歪就得指出来。

告别手动标注:自动化失败数据生成管线

DenseReward 的第一个狠活,是把失败数据的采集从“靠人手工造”变成了“靠管线自动生”。这里的关键不是省一点标注费,而是让失败的来源更真实、更系统。论文明确指出,伪失败如果只是从成功轨迹里截断、改标签,往往学不到真实机器人执行时会遇到的物理失误,比如碰撞、抓空、物体掉落、恢复动作等。
图2:自动数据生成与失败合成总览。五阶段操作流程结合目标扰动,合成多种真实物理失败模式。
图2展示了整套自动化流程。先把操作任务拆成五个阶段:Reach、Grasp、Lift、Move、Place,也就是靠近、抓取、抬起、移动、放置。这个拆法很朴素,但非常有用,因为一旦知道任务卡在哪个阶段,就能有针对性地制造对应失败,而不是胡乱加噪声。
生成流程里,系统先随机初始化场景,把目标物体和目标容器放到不同位置,再通过 GraspNet 预测抓取候选姿态。这里的 GraspNet 是一个抓取姿态预测模型,原论文中引用的是 GraspNet-1Billion,用来从多视角 RGB-D 观测里找出可行抓取位姿。随后再交给 CuRobo 做碰撞感知运动规划,CuRobo 的全称是 Parallelized Collision-Free Robot Motion Generation,中文可以理解为“并行化无碰撞机器人运动生成”,原论文引用于 ICRA 2023。
这一步的妙处在于,它不是随便编一个失败故事,而是让失败尽量符合真实物理过程。也就是说,模型见到的不是“假装失败”,而是“真的撞了、真的没抓住、真的掉了”。对奖励模型来说,真实失败的价值远高于漂亮但空洞的伪失败,因为前者包含了任务执行中最容易混淆的边界状态。

六大失败模式:目标性扰动模拟真实物理失误

DenseReward 没有把“失败”做成一个模糊大筐,而是拆成了六种具体模式:Success、Collision、Miss、Fall、Smooth、Recover。这个划分很重要,因为不同失败的奖励曲线并不一样,模型如果只会给一个统一的低分,那就还是没学会“失败的细节”。
Collision 指碰撞失败,通常在碰撞时奖励达到峰值后回落;Miss 指抓空,机器人闭爪了但没真正抓住;Fall 指抓住后在搬运过程中掉落;Smooth 指路径不够平顺、带有抖动的低质量执行;Recover 则更有意思,机器人先撞了,但后面又修正回来继续完成任务。也就是说,DenseReward 不是把失败当终点,而是承认“任务中间出过岔子,但最后还是救回来了”这种现实情况。
这些失败模式是通过目标性扰动诱导出来的。比如关闭碰撞规避会强行制造 Collision;偏移抓取目标会制造 Miss;在移动阶段加入随机旋转扰动会让物体掉下来;每步加一点关节噪声就会得到 Smooth;而 Recover 则是在撞上后重新规划一条可行路径。听起来像在“故意作妖”,但这恰恰是为了让模型见到足够丰富的失败分布。
如果没有这一步,奖励模型就很容易犯一个经典错误:把“没成功”都看成一样。现实里可不是这样,抓空、碰撞、掉落、恢复,每一种都对应不同的任务进度变化。DenseReward 的做法,就是把这种差异直接灌进训练数据里。

任务进度看得见:稠密逐帧奖励预测模型

数据有了,接下来才轮到模型登场。DenseReward 的核心模型建立在 Qwen3-VL-4B-Instruct 上,再做微调,让它从“通用视觉语言模型”变成“机器人奖励打分器”。这里的关键不是换一个更大的骨干,而是把输入和监督方式改对:给它任务指令、当前画面、历史画面,让它预测当前时刻的密集奖励值。
图3:密集奖励预测定性对比。DenseReward在成功和失败轨迹上都比强基线更贴合任务进度曲线。
图3是最能说明问题的一张图。DenseReward 的曲线更像“懂任务的人在看过程”,成功轨迹中分数会随着动作推进稳步上升,失败轨迹里则会在关键失误后明显下滑。相比之下,一些通用视觉语言模型或者已有机器人奖励模型,要么曲线太抖,要么只会在结尾附近给个粗糙判断,细节上就显得有点敷衍。
论文里还有一个很实用的小设计:奖励值保留三位小数。别小看这件事,它意味着模型被鼓励学习“更近一点”和“差一点点”的差别,而不是粗暴地把所有中间状态都压成一个模糊分数。对于机器人操作这种连续控制任务,这种细粒度差异往往就是策略能不能往前再挪一步的关键。
如果把这件事翻译成人话,就是 DenseReward 不再给机器人发“及格/不及格”两张票,而是每一步都发一张带分数的过程卡。机器人拿着这张卡往前走,知道自己是在加分还是扣分,学起来自然比只看终局结果更顺。
表1:密集奖励预测结果。DenseReward在所有数据源上都取得最低平均绝对误差,说明其对逐帧奖励估计更准确。
表1给的是密集奖励预测的平均绝对误差(MAE,Mean Absolute Error,中文是“平均绝对误差”)。DenseReward 在总体和各个数据源上都拿到了最低误差,尤其是在 DROID、IsaacSim、RoboSuite、LIBERO 上都压过了通用视觉语言模型和已有机器人奖励模型。这个结果说明,它不是只在单一数据集上会背题,而是真的学到了逐帧进度建模。
值得注意的是,强通用模型并不天然适合做机器人奖励。它们语义理解强,但对接触、碰撞、掉落这些物理细节的刻画并不天然占优。DenseReward 的优势恰恰来自“为机器人奖励专门补课”,而不是指望一个通用大模型顺手就能把物理进度也猜准。

全面超越:仿真与真实世界的双重验证

DenseReward 最让人信服的地方,不是离线指标好看,而是它真的能往下游任务里传。论文用了三层验证:先看奖励预测准不准,再看它能不能指导模型预测控制(MPC),最后看它能不能帮在线强化学习和真实机器人提成功率。这个链条一旦打通,说明方法就不是“只会报分数”,而是能参与决策。
图4:基于密集奖励的模型预测控制。
图4展示了 DenseReward 在 MPC 里的用法:每一步采样 28 个候选动作,再用奖励模型给候选转移打分,选分最高的执行。这里的候选动作空间也不是拍脑袋来的,而是覆盖了多个方向和夹爪开合动作。通俗点说,就是让奖励模型当“临时裁判”,帮控制器从一堆备选动作里挑更像样的那个。
表2:三种物体操作任务上的MPC表现。
表2显示,DenseReward 在 can、cup、lemon 三个任务上的平均最小距离更低,说明它在闭环控制里给出的方向更靠谱。这个指标越小越好,因为它代表机器人末端和目标物体靠得更近。比起只会给终局分数的模型,DenseReward 更能在动作选择阶段提供有效引导。
图5:在LIBERO上进行PPO微调。
图5进一步把 DenseReward 接到在线强化学习里。这里使用的是 PPO(Proximal Policy Optimization,近端策略优化),并在 LIBERO 基准上微调 π0 策略。DenseReward 作为中间奖励补上了稀疏终局信号的空白,训练曲线因此更稳,部分任务的最终成功率也更高。这个结果说明,密集奖励不只是“更细”,而且确实能帮助策略优化。
再往前一步,论文把 DenseReward 放到真实机器人平台上做在线学习。这里用的是 DSRL(Steering your Diffusion Policy with Latent Space Reinforcement Learning,中文可理解为“用潜空间强化学习引导扩散策略”),它不是直接大幅改策略参数,而是去调扩散动作头的潜空间,更适合真实世界里小步快跑式的策略改进。
图6:真实世界中的 DSRL 实验。
图6给出的真实世界结果很有分量:叠杯子任务成功率从 40% 提升到 80%,放球入篮从 30% 提升到 70%。真实机器人不像仿真里那么听话,能在这么少的 rollout 下把成功率拉上去,说明 DenseReward 的反馈不是纸上谈兵,而是真的能帮助策略在有限成本下变得更会干活。
图8:DenseReward在真实轨迹中捕捉失败与恢复。
图8专门展示了恢复行为:机器人一开始没抓稳,奖励下降;后面重新抓住并修正轨迹,奖励又重新抬升。这个细节非常关键,因为它说明 DenseReward 不是“一次失败就判死刑”,而是能识别任务中的阶段性挫折和后续补救。对真实操作任务来说,这种能力比单纯识别成功更有价值。
图9:DenseReward在真实轨迹中捕捉碰撞。
图9则展示了碰撞场景:机器人在接近篮筐时奖励先升后降,说明模型能把“短暂进展”和“真正完成任务”区分开。这个能力很像老司机看车:不是你往前挪了一下就算到位,撞了再退回来,那叫折腾,不叫完成。

让机器人从失败中学习:总结与展望

DenseReward 这篇工作最值得记住的,不是“奖励模型又变强了”这么简单,而是它把机器人学习里最难收集、也最有信息量的失败数据,做成了可规模化的训练资产。再配合逐帧密集奖励,模型终于不必只盯着终局结果,而是能读懂任务进度、识别失败拐点、甚至理解恢复行为。
它的工程价值也很清楚:离线奖励预测更准,MPC 里能直接帮选动作,在线 PPO 和真实世界 DSRL 里还能提升成功率。换句话说,这不是一篇只会在论文里“看起来很美”的方法,而是有机会进入机器人学习流水线的实用方案。当然,前提是仿真管线、控制接口和真实平台都能搭得起来。
不过边界也得说清楚。DenseReward 目前主要面向桌面级操作和相对标准化的 manipulation 任务,复杂长时序任务、工具使用、强遮挡场景、极端物理接触下的失败建模,后面还有不少坑。失败合成再聪明,也还是仿真驱动;一旦真实世界的物理细节更复杂,合成失败和真实失败之间的缝隙就会变成上限。
但从研究方向上看,这条路是对的。机器人学习如果总是只喂成功样本,模型迟早会变成“只会看毕业照”的老师;而 DenseReward 证明了,把失败做成数据,把进度做成奖励,确实能让机器人学得更像样一点。😀

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DenseReward 解决的核心问题是什么?核心是机器人强化学习里的奖励稀缺问题。它把原本只在终局出现的成功/失败信号,变成逐帧可用的密集奖励,让策略知道每一步是在接近成功还是偏离目标。

文中说的“失败合成”到底是什么意思?不是简单把成功轨迹截断,而是在仿真中通过关闭碰撞规避、偏移抓取位姿、加入旋转扰动等方式,合成碰撞、抓空、掉落、恢复等物理上更真实的失败轨迹。

MAE、MPC、PPO、DSRL 分别代表什么?MAE 是平均绝对误差,用来衡量奖励预测准不准;MPC 是模型预测控制,用奖励模型挑下一步动作;PPO 是近端策略优化,用于强化学习训练;DSRL 是潜空间强化学习方法,用来更稳地微调真实机器人策略。

龙哥点评

论文创新性分数:★★★★☆

失败数据合成和逐帧密集奖励结合得比较巧,不是单点小修小补,而是把奖励学习的两大痛点一起处理了。

实验合理度:★★★★☆

离线预测、MPC、仿真 RL、真实机器人四层验证都做了,链路完整,结果也能互相支撑。

学术研究价值:★★★★☆

奖励建模是机器人学习的核心问题之一,这篇工作对“失败数据如何变成有效监督”给出了很实用的答案。

稳定性:★★★☆☆

在仿真和受控真实任务里表现不错,但复杂接触、长时序、多物体场景下的稳定性还需要更多验证。

适应性以及泛化能力:★★★☆☆

跨数据源和跨任务都有提升,但目前还是偏桌面级操作,离“通吃所有机器人任务”还有距离。

硬件需求及成本:★★★☆☆

离线训练成本可控,但真实世界在线 RL 需要机器人平台和 rollout 预算,成本不低。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。