龙哥导读:
世界模型生成的视频越来越逼真,但它可能一边把画面做得很漂亮,一边悄悄执行错了相机指令。复旦、腾讯混元、上海创智学院、上海交大和上海人工智能实验室等团队提出 WorldReward:不再只看单帧美不美,而是逐段检查“动作有没有做对、画面有没有崩”。在 760 对人工标注视频上,它对动作、外观和运动质量的判断一致率分别达到 77.63%、81.32% 和 73.03%。
如果让世界模型执行“向前移动、左转、抬高镜头”,最后生成的视频看起来像电影,但镜头根本没按指令走,这个模型算成功吗?反过来,如果轨迹大致正确,画面却不断闪烁、物体变形、白天突然变成黄昏,它又能不能进入游戏、虚拟拍摄或机器人仿真?
这正是 WorldReward 要解决的矛盾:世界模型不能只追求“看起来像”,还必须证明“动作做对了”。论文把动作一致性和视觉质量放进同一个奖励模型,并尝试用它反过来训练世界模型。
一、旧评分为什么会奖励“漂亮的错误”
现有奖励大致分成两类。几何方法从视频中恢复相机轨迹,再判断它是否贴合控制指令;这类方法懂“往哪走”,却很难判断纹理是否漂移、运动是否自然。图像质量方法擅长判断单帧美感,却可能忽略闪烁、运动断裂和长期外观变化。
直接让视觉语言模型一次看完整段视频也不理想。一个转向动作可能只在几帧内出现;上下文太长后,局部错误容易被整体观感稀释。于是会出现一种很现实的奖励漏洞:模型学会生成“评分器喜欢的画面”,却没有学会可靠执行动作。
二、核心设计:把长视频拆成动作证据块
WorldReward采用局部到全局的判断方式。它先把动作序列切成多个块,每块包含四个动作槽,再为每块整理六张结构化输入:一张源图、一张视频帧总览,以及四张动作前后对比图。
公式1:在相同源图、描述和动作轨迹下,判断视频A优于视频B的概率。m分别取act和vis,意味着动作与视觉质量保留两套独立结论。
公式1可以逐项理解:x₀是两段视频共同的源图,d是场景描述,a₁:N是完整控制序列,Vᴬ和Vᴮ是待比较的两段视频。模型不输出一个混成总分,而是分别回答两个问题:谁更听指令,谁的画面更稳定。这样可以避免“画质优势掩盖动作错误”。
公式2:第k个局部输入zₖ由场景描述d、这一段动作a以及结构化图像证据Iₖ组成。
这里的 Iₖ 不是随便抽几帧。源图负责检查身份和场景有没有漂移;帧总览负责观察整段变化;动作面板只比较每个动作的首尾帧。三种视角分别回答“还是不是原来的世界”“过程稳不稳”“这一动作到底有没有执行”。
图片来源:WorldReward论文图1。长视频被切成与动作对齐的片段,每段分别判断动作执行与视觉质量,最后通过投票得到全局偏好。
对“向前”动作,判断重点是物体是否逐渐放大;对“向左转”,则观察场景内容是否按预期向右移动。与此同时,模型还检查三类视觉问题:时间一致性、动态生成质量,以及伪影与结构完整性。每个块分别选出视频 A、视频 B 或平局,最后通过投票形成整段视频的动作偏好和视觉偏好。
论文图1里的越野车案例值得细看。两段视频都大致完成了左转,但视频B的运动更像平面平移,缺少真实视差;它还把白天荒漠悄悄改成黄昏,背景地貌也发生变化。WorldReward因此可以在“动作基本完成”的同时,单独指出“3D动态不可信、源场景漂移”,而不是粗暴地给出一个总分。
公式3:分别统计各动作块支持A或B的票数;A票多则A胜,B票多则B胜,相等则整段视频判为平局。
这个投票公式看似简单,作用却很关键。它不让某一个特别漂亮或特别糟糕的片段支配全局,而是要求优势在多个局部动作中持续出现。代价是不同片段被等权处理:关键转弯和普通静止段目前拥有相同票重,未来可以继续研究按动作难度、风险或置信度加权。
这里真正重要的不是“切四段”这个数字,而是把模糊的整体观感变成可归因的局部证据。哪一步动作错了、哪一段开始漂移,奖励模型必须能指出来,训练信号才可能有效。
三、训练数据:先让强模型判断,再反复审计
团队用多个世界模型在相同源图和相同相机轨迹下生成成对视频,共得到 5 万个视频对。每条训练轨迹包含 11 个动作,加上起始静止帧后被拆成三个块,最终从 15 万个候选块中抽取约 10 万个进行推理标注。
标注并不是简单询问一次大模型。初始判断由 Gemini 3.1 Pro生成,再由基于 GPT-5.5 的工具型智能体多轮审计,最后对被修订样本进行定向人工校准。WorldReward本身从 Qwen3.5-9B 初始化,训练三轮。
让模型监督模型并不天然可靠,关键在于审计、人工校准和独立评测是否真正补上偏差。
四、760对视频,它真的比通用大模型更会判断吗
WorldReward-Bench包含 760 对视频,来自 9 个世界模型。每一对视频共享源图、文本描述和相机轨迹,由人工分别标注动作一致性、外观质量和运动质量。测试轨迹包含 23 个动作,并与训练轨迹独立构建。
图片来源:WorldReward论文表3。WorldReward在全部视频对上的动作、外观和运动一致率分别为77.63%、81.32%和73.03%。
与 GPT-5.5 相比,WorldReward三个维度分别提高 3.42、1.45 和 3.56 个百分点。与只看图像质量的 HPSv3、只看几何轨迹的 DepthAnything3 相比,它的优势是能在统一上下文中同时判断动作和画面。
消融实验也支持结构化输入的作用:去掉源图、帧总览或动作细节面板,平均一致率都会下降;只训练最终偏好标签时平均为 72.47%,加入整体比较和逐视频分析后提升到 77.33%。这说明“给答案”不如“让监督过程保留可检查的推理结构”。
表3还揭示了不同评分器各自的盲区。DepthAnything3在动作一致性上达到70.53%,但无法给出外观和运动质量;HPSv3外观一致率为73.68%,却不理解控制指令。Qwen3.5-27B虽然参数更大,动作和外观一致率只有63.68%与44.34%。这说明任务结构与监督质量,比单纯扩大通用模型更重要。
五、奖励模型不是裁判摆设,它真的参与了训练
更关键的实验,是把 WorldReward用于 HY-WorldPlay 1.5 的强化学习后训练。团队保持基础模型、数据、评测集和训练协议不变,只替换奖励信号,以尽量隔离奖励模型本身的贡献。
图片来源:WorldReward论文表4。与WorldCompass相比,WorldReward-RL在短、中、长三种时域均提高动作执行和HPSv3视觉质量。
与 WorldCompass相比,组合动作准确率提高 1.58—2.78 个百分点,基础动作提高 2.28—5.81 个百分点;六种设置中的 HPSv3质量分也全部提高。长时组合动作中,动作准确率从 54.82% 提升到 56.40%,质量分从 0.73 提升到 1.02。
图片来源:WorldReward论文图4。上方为HY-WorldPlay 1.5,下方为使用WorldReward后训练的结果;论文报告后者动作变化更明确,后段结构也更稳定。
六、代码、模型和基准都公开了,但复现并不轻
项目已经公开 WorldReward代码、9B参数模型、760对视频基准以及强化学习后训练代码。仓库结构和 Python源码可以正常解析;预处理不需要 GPU,但完整推理依赖 vLLM和匹配的 CUDA环境,模型体量也决定了它不是普通笔记本上的轻量评分器。
另一个值得注意的细节是位置偏差。官方说明模型仍有轻微偏好左侧候选,因此比较两个系统时应平衡左右位置,或交换位置重复评分。一个奖励模型即使总体准确,也可能被输入顺序影响;把这种限制写进使用说明,比只展示最高分更有工程价值。
七、放进世界模型演进史,它补的是哪一块
PaperDaily中几篇相似工作可以帮助定位 WorldReward。DreamerV3代表“在潜在世界里想象未来并学习策略”的经典路线,重点是用统一配置跨任务决策;iVideoGPT把视觉、动作和奖励离散成序列,强调可扩展的视频预测与规划;WHALE关注策略分布变化和想象轨迹的不确定性。这些工作主要回答“世界模型如何生成或用于决策”。
更近的 Drive-HWM和 StyleDrive把问题推进到长时驾驶:前者用快慢两层世界模型连接多步未来与即时动作,后者通过时间一致性正则降低长时想象误差。它们关注的是“怎样让预测更稳定、更适合规划”。WorldReward则站在另一侧追问:当多个世界模型都能生成视频时,谁来判断它们到底有没有执行正确动作?
横向看:几何奖励懂轨迹,图像奖励懂画质,WorldReward试图用同一套视觉证据统一两者。
纵向看:DreamerV3/iVideoGPT解决“怎么想象”,Drive-HWM/StyleDrive解决“怎么想得更久”,WorldReward解决“怎么判断想象是否值得信任”。
仍缺的一环:奖励判断还没有直接连接真实物理反馈;视频得高分不等于机器人在现实中安全成功。
八、龙哥点评:世界模型需要“质检员”,但不能只有一个质检员
WorldReward最有价值的地方,不是赢了几个百分点,而是把评价目标从“画面好看”推进到指令—动作—视觉结果的闭环。世界模型未来若要进入游戏、虚拟拍摄、机器人规划和空间智能,这种闭环是基础设施,不是锦上添花。
但对漂亮结果仍要保持克制。训练监督主要来自两个前沿闭源视觉语言模型,人工只承担定向校准;基准和模型由同一团队构建,覆盖的是相机控制视频,不等于复杂物体交互和真实物理已经解决。奖励模型进入强化学习后,还必须持续防范“模型学会讨好裁判”而不是真正改善世界一致性。
更稳妥的落地方式,是把 WorldReward与几何约束、人工抽检、跨模型评价和真实任务成功率组合起来。单一奖励可以提高训练效率,却不应该成为世界模型唯一的真相来源。长期看,可靠世界模型的关键不是生成更长的视频,而是让每一步行动都能被验证、追责和纠正。
龙迷三问
1. 为什么不直接用GPT-5.5当奖励模型?
专用模型可以针对动作片段组织输入,成本、可控性和批量训练效率也更适合强化学习;但这篇论文没有给出完整生产成本对比,不能只凭准确率判断总成本更低。
2. 它能评价机器人动作吗?
当前对象是相机控制的生成视频,动作主要是平移和旋转。真实机器人还涉及接触、力、物体状态和安全约束,不能直接外推。
3. 最值得复用的设计是什么?
不是某个具体模型,而是“动作对齐分块—局部证据判断—全局投票”的评价范式。任何长序列系统,只要关键错误短暂出现,都可以考虑把整体评价拆成可归因的局部检查。
参考资料
论文:WorldReward: Reward Modeling for Camera-Conditioned World Models
https://arxiv.org/abs/2609.03952
项目页:
https://codegoat24.github.io/WorldReward/
开源仓库:
https://github.com/CodeGoat24/WorldReward
本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。论文指标以作者公开材料为准,尚未完成9B模型的独立GPU复现实验,请读者结合原文和代码判断。