← 返回 PaperDaily
视觉与图像
上海交大最新基准:视频画质高≠机器人操作迁移成功,11个模型实测最高84.6
你第一眼看到的那种画面流畅、动作丝滑的机器人操作视频,可能只是“好看”,并不是真的“会干活”。上海交大与上海AI实验室等提出的H2R-Bench基准,把11个主流视频生成模型拉到真实的人类演示数据上逐一“体检”,结果发现视频画质与跨实体迁移成功率的相关系数只有0.14。想搞清楚视频生成模型到底能不能帮机器人学数据,这篇必读。
龙哥读论文
发布于 2026-08-17 00:20:09
阅读 4
查看原文
原论文信息如下:
引言:机器人学习的数据荒,与视频生成模型的“画饼”
做机器人学习的团队大概都有这种感觉:人类的操作视频网上一抓一大把,Ego4D、EPIC-KITCHENS这些数据集动辄几千小时,但机器人自己的演示数据却贵得离谱。要采一条像样的机器人操作数据,得买机械臂、搭遥操作台、标定相机、设置安全护栏,还得反复物理执行——时间成本、硬件成本、安全成本叠在一起,数据规模根本涨不上去。
于是大家自然想到一条“捷径”:用视频生成模型把海量的人类操作视频“翻译”成机器人操作视频,拿去做训练数据。这类方法通常被叫作世界模型或视频世界模型——给模型一段人类演示,让它生成一段指定机器人形态完成同一任务的视频。听起来很美对吧?但问题来了:怎么判断生成出来的机器人视频是真的“把活儿干对了”,还是只是“看起来像那么回事”?
现有的视频生成评测,比如VBench、WorldModelBench这类,主要看画质、时序一致性、文本-视频对齐、底层运动质量。这些指标放在通用视频生成上没问题,但放到“人→机器人”跨实体迁移场景里,就暴露了一个核心盲区:它们不关心生成视频里的人手有没有变成机器人手,不关心机器人的接触方式是否功能等价于人类演示,更不关心任务目标是否真的达成。
上海交通大学与上海人工智能实验室的研究者看到了这个gap,提出了H2R-Bench ——一个专门评测“人→机器人操作视频生成”的基准。基准的核心思想并不复杂:给定一段人类第一视角操作视频和一个目标机器人形态,模型生成一段机器人完成同一任务的视频;评测时不再只看画质,而是逐项检查任务目标、动作事件、功能接触、实体一致性和视频质量五个维度。论文在240个评测案例上(120个源视频×2种机器人形态)系统评估了11个当前最先进的视频生成模型,结论相当扎心:绝大多数模型能生成精美连贯的视频,但真正把任务“迁移”过去的寥寥无几。
问题背景及相关工作:为什么现有基准不够用
要理解H2R-Bench的定位,先得看看它之前的评测体系都覆盖了什么。通用视频生成基准这边,VBench、T2VBench、EvalCrafter等一大票工作主要关注视觉保真度、时序一致性、文本-视频对齐和运动质量。这些指标对通用视频生成没问题,但它们根本不涉及“这段视频里的操作是否真的完成了一个任务”。
最近一两年,面向机器人的视频评测基准开始出现,比如WorldModelBench评估视频物理合理性和动作完整性,RBench检查机器人结构和可执行性,RoboWM-Bench关注操作任务中的状态变化,RoboTrustBench则强调可信度。听起来覆盖挺全,但仔细一看,这些基准的输入条件基本都是文本指令、静态图像、初始机器人状态或机器人中心的场景,没有一个是要求模型“把某段人类演示迁移成指定机器人形态的操作视频”的 。也就是说,它们缺乏对人类演示作为源条件的建模,自然也就无法诊断H2R场景特有的失败模式,比如实体替换错误、与源演示不一致的交互等。
*表格超出部分左右可以滑动
Table 1: Comparison of H2R-Bench and existing videogeneration benchmarks across evaluation capabilities. “I2V”, “RV”, and “H2R” denote image-to-video generation, robotvideo evaluation, and human-to-robot transfer, respectively. Evaluation dimensions include visual quality, goal completion, action completion, functional contact transfer, and embodiment consistency. ✓, △, and × indicate full, partial, and no support, respectively.
表1:H2R-Bench与现有视频生成基准的评测能力对比。“I2V”“RV”“H2R”分别表示图生视频、机器人视频评测、人→机器人迁移。评测维度包括视觉质量、目标完成、动作完成、功能接触迁移和实体一致性。√、△、×分别表示完整支持、部分支持和不支持。
H2R-Bench恰好把这个空缺席位补上了。它要求模型不仅生成“像”机器人操作的视频,还要忠实于源人类演示中的任务意图、必要动作和功能交互——这才是跨实体迁移真正该有的评测姿态。
人类视频如何变成机器人操作视频?H2R-Bench给出答案
先把任务说清楚。H2R-Bench要评测的能力,是把一段人类第一视角操作视频,在给定目标机器人形态的前提下,转换成一段由机器人完成同一任务的视频。这里的H2R代表Human-to-Robot,也就是从人类到机器人的跨实体迁移。它建立在一个非常实际的假设上:大规模机器人演示数据采集太贵,而人类操作视频网上多得是,如果能用视频生成模型把人类演示“翻译”成机器人操作视频,就能低成本扩充机器人训练数据。
但难点在于:模型不是去复刻人类的动作轨迹,而是要从人类演示里读出“任务到底要干什么”,再用目标机器人的身体把这件事重新表达出来。比如人类用手抓起勺子舀冰、倒进杯子,换成平行爪机器人,它不需要模仿手的抓握姿势,但必须完成“把冰转移到杯子”这个核心目标,而且接触方式要对得起自己的机械结构。
更关键的是,源视频在这里扮演的是“任务证据”的角色,而不是“视觉风格参考”。也就是说,生成视频必须与源演示在任务目标、动作事件、功能交互上保持一致,同时把执行者替换成指定机器人形态。整个基准的评测管线如图2所示。
五个维度全面评估跨具身迁移能力
要判断一段机器人视频是否真的完成了迁移,只靠“画面好不好看”是不够的。H2R-Bench设计了五个互补的评分维度,其中前四个都锚定源演示中的具体证据来打分,第五个则跟任务内容无关。
M1:目标状态完成度(Goal-State Completion)。 每个案例定义了一组带权重的谓词,用来描述任务成功所需的最终状态——可能是空间或包含关系、机构状态、附接关系、形变状态、材料分布或表面变化。评分时统一采样25帧,序列帧提供上下文,最后几帧决定谓词是否被满足,加权平均后得到Sgoal。
M2:动作事件完成度(Action-Event Completion)。 任务要达成,光有结果还不够,中间的关键动作也得出现。M2检查抓取、插入、释放、倾倒、擦拭、折叠等必要动作事件是否被清楚地执行。同样使用25帧采样和加权平均,得到Saction。这里关注的是“操作是否发生”,而不是机器人是否复刻了人的姿态、轨迹或节奏。
M3:功能接触迁移(Functional Contact Transfer)。 这是H2R-Bench最核心的维度之一。M3要求机器人建立的交互与人类演示中的交互功能等价,评分时对比25帧源视频和25帧生成视频,外加从源视频导出的接触规范,考察接触的功能区域是否一致、接触是否可见地建立、操作模式是否匹配、物体响应是否合理、交互对目标实体是否可行。机器人可以使用不同的抓取方式或轨迹,只要接触服务了相同的操作功能即可。公式如下:
M4:实体正确性(Embodiment Correctness)。 M4检查生成结果在多大程度上符合目标机器人的形态要求。评分标准拆成了几个子项:画面中是否出现机器人、人类手是否残留、实体类别是否正确、末端执行器类型是否正确、机器人结构是否在时序上保持一致。之所以这么拆,是因为“有机器人手臂但装了错误的夹爪”和“干脆没有机器人、还是人手在干活”是两种截然不同的失败。如果画面中没有任何机器人,或者由人类主导了主要操作,Semb直接置零。计算公式为:
M5:视频质量(Video Quality)。 M5是唯一不参照任务标注的维度,专门用来度量画面本身的呈现水平。它平均四个子指标:成像质量由MUSIQ(Multi-Scale Image Quality Transformer,多尺度图像质量Transformer)逐帧估计;美学得分由LAION线性预测器在归一化CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)特征上计算;时序稳定性通过相邻帧差异衡量;运动平滑度则由AMT-S光流插值模型的重建误差衡量。四个子指标的算术平均就是Svideo。
H2RCore = 100 × (0.15 × Sgoal + 0.15 × Saction + 0.30 × Scontact + 0.30 × Semb + 0.10 × Svideo)
这个权重分配是深思熟虑的:接触和实体各占0.30,合计60%。因为有效的跨实体迁移必须同时满足“交互功能正确”和“机器人形态正确”,两者缺一不可。目标状态和动作完成各自只占0.15,因为一段人类主导或错误实体的视频,完全可能显示出正确的任务结果和动作过程——但它们并没有实现迁移。视频质量只给0.10,防止画质成为掩盖任务失败的遮羞布。
视频条件模型vs帧条件模型:差距惊人
H2R-Bench一共评测了11个当前主流的视频生成模型,按原生接口分成两组:一组是视频条件模型,可以直接把完整源视频吃进去,包括Seedance 2.0、Wan2.7和Kling-V3;另一组是帧条件模型,只能接收按时间顺序采样的源帧,包括Veo 3.1、Grok Imagine Video、LTX-2.3、SkyReels-V3-R2V、Wan2.2、LongCat、HunyuanVideo 1.5-I2V和Mitty-EPIC14B。
结果非常直观:三个视频条件模型占据了绝对领先身位。Seedance 2.0在平行爪目标下拿到77.3分,灵巧手目标下拿到84.6分,排名第一;Wan2.7和Kling-V3紧随其后。反观帧条件模型,大部分H2RCore集中在30到50分区间。LTX-2.3、SkyReels-V3-R2V、Wan2.2、LongCat、HunyuanVideo 1.5-I2V这些模型在实体正确性这个维度上几乎全军覆没,M4得分清一色接近0。
接近0是什么概念?就是模型压根没把人类演员替换成机器人,或者生成的机器人形态完全不对。这比“动作执行失败”严重得多——说明模型连“跨实体替换”这个基本要求都没做到。
有个反例特别值得玩味:Veo 3.1在平行爪条件下的目标完成度得分0.725,是全场最高的,灵巧手条件下的动作完成度也达到0.816,但它的实体正确性只有0.100和0.227。也就是说,Veo 3.1能准确理解“任务是什么”,动作也做了,但就是不知道该怎么把人手换成机器人末端。另一个典型是HunyuanVideo 1.5-I2V,它在两种目标下的视频质量都是全场最高(0.806和0.808),但H2RCore排在倒数——画质与迁移能力之间的脱节,在这里被展示得淋漓尽致。
定性结果也印证了量化分数。图5展示了同一段“舀冰倒进杯子”演示的生成效果对比。
Seedance 2.0生成的机器人手臂清晰可见,并且保持与勺子的可见接触,把冰块转移进杯子;HunyuanVideo 1.5-I2V的结果里,人类手仍然留在画面中执行操作,任务动作做了但迁移没有发生;Veo 3.1则产生了一个看似合理的交互,但末端执行器类型不对。这正好解释了为什么需要多维度的评测体系:单看最后帧状态,M1可能给它们都不低的分数,但M3和M4立刻把缺陷暴露出来。
视频质量高≠迁移成功:关键发现
这篇论文最扎心的发现,来自对视频质量与迁移能力之间关系的分析。把所有模型在两种实体下的22个组合画成散点图,横轴是视频质量M5,纵轴是H2RCore,结果如图4所示。
视频质量得分集中在0.73到0.81这个非常窄的区间,而H2RCore横跨30.0到84.6。两者的秩相关系数(Spearman ρ)只有0.14,基本等于没有相关性。也就是说,如果你只看画质,完全无法预测这个模型在跨实体迁移上表现如何。
表3显示,9/11的模型在灵巧手目标下得分更高,平均H2RCore高出3.3分。接触迁移M3在全部11个模型上都有提升,平均+0.055;实体正确性M4在8/11模型上提升,平均+0.047。原因不难理解:灵巧手形态更接近人类手,模型在做演员替换时,接触信息和操作模式更容易迁移。但这个优势不是普遍的——Grok Imagine Video和Mitty-EPIC14B在灵巧手目标下反而更低。
第二类因素是是否给模型提供目标机器人的参考图。表4的结果很有意思:参考图不是“给了就有用”。Wan2.7加了参考图后,平行爪接触迁移从0.766涨到0.871,实体正确性从0.772涨到0.875,H2RCore从76.5涨到83.1;但Kling-V3和Seedance 2.0反而掉分,Kling-V3平行爪H2RCore直接掉了13.5分。这说明当前模型对参考图的使用方式很不稳定,有的模型过度拟合了外形一致性,反而偏离了源演示中的交互。
基准构建与评估协议详解
数据从哪来?H2R-Bench使用了EgoDex测试集中的120段第一视角人类操作视频作为源数据。EgoDex是一个收集大规模第一人称手物交互数据的公开数据集,论文从中筛选出任务相关实体、交互和状态变化都清晰可见的片段。每个源视频配对两种目标实体——平行爪夹爪(Parallel-Jaw Gripper)和灵巧手(Dexterous Hand),最终构成240个评测案例。
数据分布上,120个源视频均匀覆盖六个操作任务族:刚体搬运或重排(F1)、关节机构驱动(F2)、插入或连接(F3)、形变物体配置(F4)、散料转移或混合(F5)、表面或材料变化(F6)。每个任务族20个源视频。
标注流程也是基准的核心竞争力之一。论文先用Qwen3.7-Plus这个多模态语言模型对每一段约5秒的源视频生成结构化标注,记录初始状态、最终状态、相关物体和工具、必要动作事件、源端接触证据;再针对每个目标实体额外标注功能接触区域、操作模式、期望物体响应、双手配合角色等信息。所有标注都经过人工对照源视频逐条核查,确保质量。
评估协议上还有一个关键设计:每个模型都使用它最强的、公开可查的源条件接口。支持视频条件的模型接收完整源视频;只支持帧条件的模型接收按时间顺序采样的源帧,在接口限制内尽量保留首尾关键帧。所有模型的文本提示词保持对齐,主设定下不给目标机器人参考图,生成视频保持原生分辨率、时长和帧率。评测时统一采样固定数量的帧,保证每个模型拥有相同的“证据预算”。
为了让分数经得起检验,M1到M4由三个多模态大语言模型(MLLM, Multimodal Large Language Model)独立打分——分别是Gemini 3.5 Flash、Qwen3.7-Plus和GPT-5.4,使用统一的0到4评分标准:0表示没有或矛盾的证据,4表示清晰且完整满足。三个judge的分数取平均。M5则完全采用自动化指标。数据集层面的分数先对每个视频计算,再取平均得到H2RCore。
自动化评测的可靠性如何?论文专门做了人类验证:三名人类评分员在全部11个模型、两种目标实体下,对每个任务族采样5个场景进行独立评分,一共评测了660段生成视频。结果如图3所示,人类评分与MLLM评分在场景内的Spearman相关系数平均达到0.883,聚合后的Pearson r达到0.930,说明自动评测在很大程度上保留了人类的模型偏好。
实验结果分析:为什么迁移这么难
把表2的分数掰开看,会发现一个清晰的规律:所有模型在M1和M2上的得分都远高于M3和M4。这说明当前视频生成模型对“任务是什么”有一定理解能力,但对“怎么用另一个身体把它做出来”普遍缺乏控制力。尤其是帧条件模型,它们拿到的只是一组稀疏的源帧,很难从中推断出连续的手物交互过程,更谈不上在保持功能接触的同时完成实体替换。
为什么视频条件模型明显更强?因为完整视频保留了动作的时序结构和因果链条:手怎么接近物体、怎么建立接触、物体怎么响应。这些信息在稀疏帧里很容易丢失。Seedance 2.0和Wan2.7的领先,本质上不是因为它们的生成质量碾压对手,而是因为它们接收了更完整源信息。
另外,诊断性分析也印证了这一点。帧条件模型中最常见的两类失败是“人类手残留”和“接触区域错位”,而视频条件模型在这两类失败上的出现率大幅降低。平行爪目标下“末端执行器错误”仍然频发。这意味着:提高跨实体迁移能力,不能只靠加参数量,还需要模型在训练阶段就理解“不同形态的末端如何与物体发生功能交互”这一物理常识。
未来展望:从视频生成到机器人学习
H2R-Bench的价值不只是一张排行榜。它把“视频生成模型能否当世界模型用”这个问题,变成了可量化、可诊断的工程问题。根据本次评测暴露出的短板,可以清晰地看到三个改进方向。
第一,实体替换能力是当前最大的瓶颈。帧条件模型大量出现人类手残留,说明模型没有真正学会“把执行者换成另一个形态实体”这个操作;未来可以尝试在训练数据中引入更多成对的跨实体演示,或者用解耦的实体表征来显式控制生成。第二,功能接触迁移需要更强的监督信号。当前模型能识别“手在抓东西”,但不理解“抓”这个动作在不同末端上的物理含义。引入接触图或手部-物体交互先验,可能是一条路。第三,评测闭环要向真实机器人学习延伸。H2R-Bench目前评测的是生成视频本身,下一步值得验证的是:用高H2RCore视频作为数据扩充来源,训练出来的机器人策略是否真的比基线更好。
参考图的实验也提醒研究者:与其盲目给模型堆条件,不如先搞清楚模型对视觉条件的注意力机制。为什么同样的参考图,Wan2.7加分、Kling-V3掉分?这本身就是一个很有价值的研究题目。
龙迷三问
这篇论文到底在解决什么问题? H2R-Bench是上海交大等提出的跨实体人→机器人操作视频生成评测基准。要求模型将人类演示视频转换为指定机器人形态的操作视频。
这篇工作最值得看的点是什么? 视频条件模型(Seedance 2.0, Wan2.7, Kling-V3)显著优于帧条件模型;Seedance 2.0在平行夹爪(77.3)和灵巧手(84.6)两个目标具身上均排名第一;视频质量与迁移质量相关性弱(Spearman ρ=0.14)
这篇工作的边界或风险在哪里? 优点:1)首次系统性地定义了人类到机器人视频迁移的评估框架;2)五个评估维度设计合理,覆盖了迁移的关键方面;3)包含120个源视频和240个迁移案例,规模适中;4)人工评估验证了自动评估的可靠性。缺点:1)仅使用EgoDex单一数据源;2)只覆盖两种目标具身;3)评估依赖MLLM判断,可能存在偏差;4)未评估生成视频的实际可执行性
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
构建一个从人类操作视频到指定机器人形态操作视频生成的跨具身迁移基准,通过五个维度(目标完成、动作事件完成、功能接触迁移、具身正确性和视频质量)系统评估视频世界模型的迁移能力。
实验合理度: ★★★★☆
H2RCore(综合分数),M1目标状态完成度,M2动作事件完成度,M3功能接触迁移,M4具身正确性,M5视频质量
学术研究价值: ★★★★☆
构建一个从人类操作视频到指定机器人形态操作视频生成的跨具身迁移基准,通过五个维度(目标完成、动作事件完成、功能接触迁移、具身正确性和视频质量)系统评估视频世界模型的迁移能力;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1)仅使用EgoDex单一数据源;2)只覆盖两种目标具身;3)评估依赖MLLM判断,可能存在偏差;4)未评估生成视频的实际可执行性
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!