
原论文信息如下:
物理视频生成:从"像"到"是"的跨越
事件链推理:给物理现象装上"因果骨架"
关键帧路由:让每个物理变化都有"专属导演"
反事实引导:教会AI"什么不该发生"
实验验证:四大基准全面领先
视频模型在“像素空间”里很强,但在“物理空间”里很弱。它能渲染出玻璃杯的光泽、水花的晶莹、火焰的跳跃,却不知道玻璃杯掉到地上应该先弹一下,还是直接碎开;也不知道火焰需要可燃物、氧气和温度积累,而不是“啪”一下凭空烧起来。
为什么会这样?因为常规训练数据只给了模型大量“文本—视频”对,却没有给中间过程做显式的物理标注。模型看过千万个“苹果落下”的画面,却没有人告诉它:苹果在重力作用下先加速,碰到地面后速度反向,能量损耗导致弹跳逐次衰减,最后靠摩擦力停下来。数据里隐含了规律,但模型并不一定能把规律抽象成可迁移的因果知识。
更麻烦的是,单纯靠提示词也很难弥补。有人想过用思维链(CoT)让大语言模型先把物理原理写出来,比如“这里有重力、摩擦力、动量守恒……”,再把这段长篇大论交给视频模型。听起来合理,但自由文本是整体性描述,它把“原因、过程、结果”全部揉成一团,模型依然很难知道哪个阶段对应哪个状态、物体在每一刻应该长成什么样。换句话说,AI背了一肚子物理公式,却仍然不知道“倒水”应该先倾斜壶身,再让水流出,然后看着杯内液面上升。
这篇来自四川大学的工作,给出的解法非常直接:别让AI脑补物理过程,先把物理过程拆成一条带约束、带数值、带画面的“事件链”,然后再去生成视频。
物理视频生成:从“像”到“是”的跨越
论文把这种思路概括为 事件中心生成(Event-Centric Generation)。所谓事件,不是“倒水”“燃烧”“滚动”这种粗粒度动作标签,而是一次由物理约束驱动的状态转移:前一个状态是什么,后一个状态是什么,中间经历了什么变化,这个变化由哪条物理规律支配。把一串事件首尾相接,就构成了一条事件链。
对比一下传统提示词和事件链的差别。传统提示词写“把水倒进玻璃杯”,模型收到的是一个整体指令;事件链则会把现象拆成“手将壶身倾斜→壶嘴处出现水流→水流在重力作用下落入杯中→杯内液面逐步上升→液面趋于静止”。其中每一步都对应一个可验证的物理状态,而不是一团模糊的语义。
这个表述上的转变看似简单,实际上是把“物理合理性”从模型的隐性负担里拿了出来,变成一种显式的中间表征。有了事件链,视频生成就不再是一步到位的“文本→视频”映射,而是“文本→事件链→关键帧→视频”的逐步落地过程。后面所有的技术模块,都是在给这条事件链配上合适的推理、视觉和语义条件。
事件链推理:给物理现象装上“因果骨架”
事件链不是随便拆出来的,论文第一个核心模块叫 Physics-driven Event Chain Reasoning(PECR),即“物理驱动的事件链推理”。它的任务,是把一个物理现象拆解成带因果顺序的事件序列,并给每个事件配上可量化的物理量。
PECR的第一个关键设计,是用场景图(Scene Graph)来表征每个事件边界上的物理状态。什么是场景图?简单说,就是把画面里的对象和关系画成一张“图”:节点是物体及其属性,比如“水壶(材质:陶瓷,倾斜角:30°)”“杯子(容量:300ml)”“桌面”;边是物体之间的交互,比如“水壶倾斜于杯子上方”“水流从壶嘴落入杯中”。相比自由文本,场景图的好处是结构清晰,便于比较两个状态之间的差别,也便于把物理量挂到具体的物体和关系上。
具体来看,PECR先把用户输入的描述解析为初始场景图,然后进入递归推理过程。每一步都基于当前场景图,去推断下一步可能涉及的物理约束,比如“这里存在重力作用下的自由落体”“这是酸和碱的中和反应”,再在这些物理约束的引导下生成多个候选后继场景图。这个时候,需要一个打分函数来判断哪个候选最合理。论文用一个简单而有效的公式来描述:
其中 Ĝₙ 代表候选的后继场景图,Gₙ₋₁ 代表当前状态,Pₙ 代表这一步演化所遵循的物理约束。打分函数 Φ 由大语言模型实现,它的核心比较逻辑是:候选场景图带来的物体属性变化和关系变化,越符合 Pₙ 描述的物理规律,得分越高。每一轮都选出得分最高的后继图,循环往复,最终得到一条场景图链:G₀ → G₁ → … → Gₙ。
但场景图只解决了“定性描述”的问题,还缺一个最硬核的部分——物理量的数值从哪来?比如,水壶究竟要倾斜多少度,水流速度是多少,液体体积如何变化?如果直接让大语言模型估计这些数值,结果往往会“一本正经地胡说八道”,因为语言模型擅长文本生成,却不擅长数值计算和物理一致性校验。
论文的解决方案是:让模型去检索真实的物理公式,再用符号代数引擎解析和计算。流程大致分四步:第一步,基于当前物理约束生成公式查询,比如“流量与流速、截面积的关系”;第二步,用这些查询去在线检索候选公式,并计算每个候选公式与查询之间的语义相似度;第三步,选出相似度最高的公式;第四步,借助符号代数引擎解析公式中的变量,让大语言模型把这些变量对应到场景图中的具体节点和边,最后通过解方程或查询知识库得到数值。
公式 2 里的 F*ₙ 表示最终选定的最优物理公式,f 遍历候选公式集合,N_Pₙ 是根据物理约束生成的公式查询向量,sim 就是语义相似度函数。如果最优公式的相似度仍然低于阈值,模型会基于已有候选重新组织查询,再来一轮,直到找到足够可靠的公式为止。
这一步做完,场景图里每个对象节点和关系边都被“挂上”了具体的物理量,比如倾斜角度、体积、流速、温度变化速率。接下来,相邻两张带物理量的场景图放在一起做差分,差出来的内容就是事件的完整定义:
事件 eₙ 由前一张场景图 G*ₙ₋₁、后一张场景图 G*ₙ,以及支配这次转移的物理约束 Pₙ 共同组成。也就是说,每个事件不仅告诉模型“画面变成什么样”,还告诉它“这种变化是在什么物理条件下发生的、变化的幅度有多大”。这份带数值的因果骨架,就是后续视觉生成和语义引导的共同基础。
关键帧路由:让每个物理变化都有“专属导演”
事件链是“剧本”,但光有剧本还不行,还得有人把它画成分镜图。论文的第二个核心模块叫 Transition-aware Routed Keyframe Conditioning(TRKC),也就是“兼顾转移类型的路由式关键帧条件”。它的职责是:为事件链里的每一个事件生成一个关键帧,再把这些关键帧转成视频生成过程中的视觉引导。
为什么不能直接让图像生成模型根据文字描述一个个画关键帧?因为物理事件带来的视觉变化类型差异极大:铁块烧红是颜色变化,表面结霜是纹理变化,皮球滚下坡是整体位移,易拉罐被压扁是几何形变。如果所有事件都套同一个编辑模型,常常会顾此失彼——处理颜色变化的模型可能擅长改色调,却很难把物体从一个位置“搬”到另一个位置还保持外观一致。
TRKC的巧思在于“路由”二字。它先让视觉语言模型(VLM)观察前后两张场景图的变化,以及前一个关键帧的画面内容,推断这次事件应该走哪条编辑路线。然后设计了四个专用物理仿真算子:颜色变化算子、纹理变化算子、位移算子、形变算子,外加一个处理物体新增或删除的默认算子。
以“位移”为例。先把前一帧里的运动物体分割出来,做成一个可移动的前景层,再让 VLM 根据场景图变化估计物体在图像平面上的平移量和旋转量,把物体挪到目标位置后,由图像编辑模型补全留下的空白区域。这样做可以尽量保证物体外观在运动前后保持一致,而不是像很多端到端生成模型那样,物体一动就“变形”。再看“形变”,VLM 会参数化缩放比例和轮廓偏移量,重画一个形变后的物体遮罩,再让编辑模型在这个新遮罩里按照形变语义重建物体。
整个关键帧合成过程可以写成这样:VLM 根据场景图转移和上一帧关键帧,推出空间编辑信号和语义编辑条件,再用分割模型确定编辑区域,最后用图像编辑模型生成新关键帧。关键帧生成后,难点又来了:事件边界是离散的,视频是连续的,怎么让模型在相邻两个关键帧之间平稳过渡?
论文的做法是,先把关键帧编码到扩散模型的潜空间,再沿时间轴对相邻关键帧的特征做线性插值。这样任意一个中间时刻都能得到一条“软引导”特征。但这里有一个细节:如果直接把插值特征当作引导条件,模型容易产生画面跳变。论文干脆换了一种思路,用插值特征减去初始关键帧的特征,得到一个累积变化增量:
这个增量 d 既包含了前面所有已完成事件带来的累计变化,也包含了当前正在发生的这一段事件的变化。去噪过程中,把它按一定强度加到当前噪声特征上:
这种“残差引导”的本质,是不断告诉扩散模型“从起点到现在画面已经改变了多少”,然后再让模型去决定接下来应该怎么变。相比直接把目标关键帧硬贴上去,这能大幅减少中间状态的跳跃感,让物理过程看起来像是一个连续展开的故事,而不是几张幻灯片在轮流播放。
反事实引导:教会AI“什么不该发生”
有了事件链,有了关键帧,视频模型已经能大致沿着正确的物理路径走了。但还有一个隐患:物理上“不对”的画面,往往和“对”的画面非常接近,差别可能只是速度方向反了,或者水位上升变成了下降。仅靠正向提示词,模型很难建立起这种“反物理禁区”的概念。
第三个核心模块 Physics-injected Contrastive Semantic Guidance(PCSG),就是专门解决“什么不该发生”的问题。它的做法可以拆成两步:正向条件压缩,以及反向反事实构造。
先说正向压缩。一个复杂的物理现象可能包含七八个事件,如果每个事件都写成一句话,全部堆给视频模型,模型很容易“看不过来”,反而抓不住重点。PCSG模块会把事件链里逐事件的描述提炼成一段紧凑的正向提示,只保留那些会显著影响画面变化的物理过程和可观察效果。比如“水壶逐步倾斜,水流从壶口落入杯中,杯内液面不断上升”,一句话讲清主干,而不是把大量冗余的细节全部塞进去。
再说反事实构造。这一步非常有意思:论文会刻意对事件中的物理量施加违反物理规律的扰动,生成一段“如果物理定律出了错,画面会怎样”的负向提示。例如,将“液体从倾斜容器中向下流出”改成“液体沿倾斜容器向上流出”,将“冰块入水后浮在水面”改成“冰块入水后直沉到底”。这类反事实提示,和正向提示共享几乎完全相同的对象与场景,唯一不同的就是偏离了物理约束,因此能给模型提供很强的对比信号。
两种语义条件最终是通过无分类器引导(Classifier-Free Guidance,简称 CFG)发挥作用的。CFG 本来是一种让扩散模型在生成时增强条件控制的技术,常见用法是在“无条件生成”和“有条件生成”之间做插值。PCSG把它升级成了一个对比版本:
在这个公式里,ε₀ 代表扩散模型的去噪预测,W₋是反事实负向条件的文本编码,W₊是压缩后的正向条件文本编码,γ 是引导强度。模型会先以反事实条件为“起点”,然后沿着“正向条件减反事实条件”的方向推一步。直观理解就是:物理上不该发生的事是地板,物理上应该发生的事是天花板,模型被夹在中间,被明确告知应该往哪个方向走。
这种“正反成对”的语义引导,比单纯写一句负面提示“低质量、模糊、画面扭曲”要精准得多,因为通用的负面提示并没有针对当前事件的具体物理规则。物理模拟里最怕的不是整体画质崩坏,而是“一切看起来都很正常,唯独运动方向反了”。PCSG的反事实提示,恰好把这一类“细粒度物理违规”暴露在模型面前。
实验验证:四大基准全面领先
方法设计得再漂亮,也得看成绩单。论文在四个公开基准上进行了全面评测:PhyGenBench 覆盖力学、光学、热学、材料四个物理域;VideoPhy 重点考察固-固、固-液、液-液等物体交互类型;PhyWorldBench 则额外加入了一类“故意违背物理常识”的反物理场景;Physics-IQ 的玩法不太一样,它需要模型根据一张初始状态图,预测接下来的物理过程。评测基准覆盖面和难度都相当可观。
尤其值得注意的一点是:整个框架不需要对视频生成模型做任何训练或微调,而是以“条件注入”的方式直接驱动现成的开源视频基座模型。论文在 CogVideoX-5B、Wan2.1-14B 和 Wan2.2-14B 三个不同的基座上都做了测试。可以在 PhyGenBench 看到,将 CogVideoX-5B 的物理贴合度均值从 45.0% 提升到 72.5%,把 Wan2.1-14B 从 40.0% 提升到 70.8%,把 Wan2.2-14B 从 54.0% 提升到 72.1%。不同基座、不同规模的模型,都能获得十几到二十几个百分点的显著增益,说明事件链条件确实具有较好的跨模型迁移能力。
再看看另外三个基准上的表现。VideoPhy 的评测结果里,在 CogVideoX-5B 基座上,综合得分明显高于 PhysHPO 等近期方法;PhyWorldBench 上,基础物理场景和反物理场景均有提升,特别是在反物理场景中,模型需要学会“拒绝”那些不符合常识的动态;Physics-IQ 上的表现也值得一提,甚至超过了使用奖励模型做 Best-of-N 挑选的 WMReward 方法,而后者的推理成本要高得多。
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出事件中心的思维链框架,将物理现象分解为因果关联的事件链,通过物理公式增强的场景图演化进行推理,并利用路由关键帧与对比语义引导来条件化视频扩散模型,从而生成物理上合理的视频。实验合理度:★★★★☆
PCA (Physical Commonsense Alignment), SA (Semantic Adherence), PC (Physical Commonsense), Spatial IoU, Spatiotemporal Io。学术研究价值:★★★★☆
提出事件中心的思维链框架,将物理现象分解为因果关联的事件链,通过物理公式增强的场景图演化进行推理,并利用路由关键帧与对比语义引导来条件化视频扩散模型,从而生成物理上合理的视频;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
未明确给出具体FLOPs,实验在单张NVIDIA H100 GPU(80GB)上进行复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1) 依赖LLM和VLM的推理质量,存在误差累积风险;(2) 关键帧编辑质量直接影响最终视频质量;(3) 计算开销较大,涉及多阶段处理;
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!