← 返回 PaperDaily 视觉与图像

北大+中科院提出PhysRAG:7K视频让生成更守物理

这篇 PhysRAG 很像给视频生成模型塞了个“物理常识外挂”:先把训练数据洗干净,再把物理参考视频检索进来,用可学习查询提炼成真正有用的先验。结果不是只会“看起来像”,而是开始“物理上像”。

北大+中科院提出PhysRAG:7K视频让生成更守物理
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇 PhysRAG 很像给视频生成模型塞了个“物理常识外挂”:先把训练数据洗干净,再把物理参考视频检索进来,用可学习查询提炼成真正有用的先验。结果不是只会“看起来像”,而是开始“物理上像”。


原论文信息如下:
论文标题:
PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
发表日期:
2026年06月
发表单位:
Peking University; Institute of AI for Industries, Chinese Academy of Sciences
原文链接:
https://arxiv.org/pdf/2606.26916v1.pdf
开源代码链接:
https://github.com/sediment1024/PhysRAG
项目链接:
https://github.com/sediment1024/PhysRAG

让视频动起来更“真实”:PhysRAG如何让AI理解物理世界

视频生成这几年进步很快,但也有一个老毛病:画面能看,物理不太行。比如水该怎么流、头发该怎么飘、物体碰撞后该怎么反弹,模型经常给出一种“看着挺像,细想离谱”的效果。PhysRAG 的思路很直接:既然模型自己学物理学得磕磕绊绊,那就别让它闭门造车,直接去检索真实物理视频,把“物理常识外挂”装进去。
图1:PhysRAG总体框架与定性结果
图1:PhysRAG总体框架与定性结果。上半部分展示了检索增强框架:先从数据库里找出和当前提示词相关的物理参考视频,再用 VideoMAE 提取特征,最后通过可学习查询注入到 DiT 块中。下半部分则能看到,和基线相比,PhysRAG 在水流、头发摆动这类复杂物理交互上更自然。
这篇工作的核心并不是“再堆一个更大的视频模型”,而是把检索增强生成(Retrieval-Augmented Generation,简称 RAG)搬进视频生成里。RAG 原本常见于文本任务,意思是先从外部知识库里检索相关信息,再把这些信息喂给生成模型。PhysRAG 的新意在于:它检索的不是百科词条,而是物理参考视频。模型不是“背物理题”,而是“看物理现场录像”后再开工,听起来就比死记硬背靠谱一点🤨。

从“看起来像”到“物理上对”:为什么视频生成需要物理意识?

传统文本到视频模型最擅长的,是把“像”做出来;但物理世界更关心“对不对”。比如球掉下去要先下落,液体要先接触再扩散,光照反射要符合空间关系。只要这些顺序错了,视频就会立刻露馅。人眼一看会觉得“这 AI 还挺会糊弄”,但对机器人、自动驾驶、具身智能这些场景来说,这种糊弄可一点都不好笑。
PhysRAG 先把问题拆成两层:第一层是数据不够干净,第二层是模型缺少可控的物理先验。前者会让模型学到一堆“伪物理”,后者会让模型即便见过物理视频,也不知道该把哪部分知识用到当前生成里。于是论文选择了一条更像工程师的路线:先把训练数据筛干净,再把可检索的物理知识库搭起来,最后用可学习查询把真正有用的动态提炼出来。
这里顺手解释几个关键词。DiT 是 Diffusion Transformer,中文可理解为“扩散式 transformer 骨干”,是当前视频生成里很常见的主干。VideoMAE 是一种视频自监督编码器,这里负责把参考视频压成更适合检索和注入的时空特征。FAISS 则是 Facebook AI Similarity Search 的缩写,中文可理解为“高效相似度检索库”,专门干“从一堆向量里找最像的那个”这种苦力活。

巧妇难为无米之炊:两阶段数据过滤打造高质量物理视频库

PhysRAG 很清楚一个现实:模型再强,喂进去的东西太脏也白搭。原始的 WISA-80K 数据集虽然大,但里面混着不少标题党、无关内容、以及“文字看着像,视频完全不是那回事”的样本。训练这种数据,模型很容易学成一个“物理胡说八道生成器”。所以论文没有急着训练,而是先做了一轮耐心的清洗。
图2:WISA-80K两阶段预处理流程
图2:WISA-80K 两阶段预处理流程。第一阶段只看文本描述,用 Qwen3-VL 先筛出前 10% 的候选;第二阶段再把关键帧和文本一起送进去,检查提示词与画面是否一致,最终得到约 7K 条高质量视频。
这个两阶段过滤很像做菜前先挑食材。第一阶段是“粗筛”:只看字幕质量和物理相关性,先把大部分不靠谱样本扔掉,成本低、速度快,但会有少量“看起来还行、其实不行”的漏网之鱼。第二阶段是“精筛”:把关键帧和文本一起检查,确认视频内容真的和物理现象对得上。这样做的好处很明显——数据更干净,模型更容易学到稳定的物理规律,而不是把噪声当真理。
这一步还有一个很现实的工程考量:如果把整段视频都拿去做多模态核验,代价会非常高。论文用关键帧代替全视频,是一种很典型的“先把大头问题解决,再别跟算力死磕”的做法。最终从 8 万条里筛出大约 7 千条,数量看着少了,但质量上去了,训练时就不容易被脏数据带偏。

看视频学物理:RAG+可学习查询,精准注入物理先验

插图
PhysRAG 的真正关键,不是“检索”本身,而是怎么把检索来的视频知识用对。因为参考视频里既有物理规律,也有无关背景、风格、镜头运动等杂质。如果一股脑全塞给生成模型,模型很可能学到一堆背景纹理,最后把“物理先验”学成了“背景复读机”。
图3:检索增强视频扩散框架
图3:检索增强视频扩散框架。视频扩散 transformer 在文本和噪声的驱动下生成视频,同时从物理数据库中检索相关参考视频。参考视频先经过 VideoMAE 编码,再通过 Query Inject 模块注入到 DiT 块里。
为了解决这个问题,论文设计了一个可学习查询模块。可以把它理解成一群“挑食的提问者”:它们不是被动接收整段参考视频,而是主动去问“这里面哪些信息和当前生成最相关”。这个过程本质上是一次跨注意力(cross-attention)操作,查询向量去关注参考视频特征,最后只把最有用的物理动态提炼出来。
论文里这套流程可以概括成三步:先用 VideoMAE 把检索到的参考视频编码成时空特征,再用一组可学习查询对这些特征做筛选,最后把筛出来的物理先验和原始 DiT 特征拼接并投影回去。这里的“投影”不是搞电影分镜,而是把不同维度的 token 对齐到统一空间,方便后续继续去噪生成。再加一个可学习门控系数 α,模型就能决定这次该“多听参考视频的话”,还是“少掺和点外来意见”。
如果把它说得更接地气一点:普通检索像“把整本参考书直接扔给学生”,而 PhysRAG 更像“老师先划重点,再把重点讲给学生听”。这就解释了为什么它比简单拼接和直接交叉注意力更稳——因为它先做了信息瓶颈,过滤掉了大量无关细节,只保留“物理这部分别跑偏”。
图3:不同注入方式的消融实验
图3:不同注入方式的消融实验。直接拼接、直接交叉注意力、以及 PhysRAG 的可学习查询注入做对比,结果显示后者在物理正确性上更占优,说明“筛掉噪声再注入”确实比“全盘端上来”更靠谱。

碾压SOTA:PhysRAG在PhyGenBench和VBench上的全面胜利

论文把评测分成两类:一类看“物理对不对”,一类看“视频本身好不好”。前者用 PhyGenBench,后者用 VBench。这样的设计比较合理,因为只盯着画质,模型可能把物理搞崩;只盯着物理,画面又可能变得僵硬。两头都看,才知道是不是既会讲物理,又不会把视频做成科普幻灯片。
表1:PhyGenBench定量对比结果
表1:PhyGenBench 定量对比结果。PhysRAG 在总体平均分上达到 0.58,拿到当前最优;和 Wan2.2 基线相比,在热学和材料相关指标上提升也比较明显。更重要的是,它还超过了同类记忆增强方法 DiT-Mem,说明“显式检索物理视频”比“泛化记忆 token”更对路。
从结果看,PhysRAG 在机械、光学、热学、材料这些维度上都更稳,尤其是对“复杂物理交互”更友好。这个提升并不奇怪:因为它不是让模型凭空猜物理,而是把相似物理过程的视频当作参照物。对于“水流”“碰撞”“反射”这类强时序依赖现象,参考视频的价值很高,能帮助模型少走很多弯路。
表2:VBench定量评测结果
表2:VBench 定量评测结果。把 PhysRAG 接到 Wan2.2 上之后,低层指标和高层指标都在提升,Low-Avg 达到 65.48%,High-Avg 达到 82.88%。这说明它不是只会“补物理短板”,也没有把整体视频质量拖下水。
更有意思的是,PhysRAG 在颜色、主体一致性、空间关系这些维度上也没有明显退步,反而还能保持竞争力。这说明它注入物理先验的方式比较克制,没有把模型原本的语义生成能力搅乱。很多方法一加条件就开始“顾头不顾尾”,PhysRAG 至少在这点上比较老实。
图4:物理一致性定性对比
图4:物理一致性定性对比。以机械臂蚀刻电路板、液体滴落等场景为例,PhysRAG 比 Wan2.2-5B 和 PhyT2V 更能把连续动作、流体扩散、材料属性这些关键细节做对,红框区域的差异尤其明显。
从定性结果看,基线模型常见的问题是“提前发生”或者“该发生的不发生”。比如液体还没碰到表面,表面上的液体却先变多了,这种非因果现象非常典型。PhysRAG 的优势就在于,它从参考视频里学到的是时序上的物理约束,而不是只学到一个“液体长什么样”的外观模板。对视频生成来说,这种因果顺序比花里胡哨的纹理更重要。
图5:训练策略与注入方式消融对比
图5:训练策略与注入方式消融对比。无论是“无人机悬停看水面反射”,还是“油滴落到纸面”的场景,SFT 和 SFT+RAG 都容易丢掉关键物理现象;而 PhysRAG 能更好保留反射、下落和积累过程,说明它不只是“训练得更久”,而是“学得更对”。
表4:17类物理概念探测结果
表4:17 类物理概念探测结果。该表说明检索到的物理先验并不是“只对少数场景有效”,而是覆盖了多个物理类别。换句话说,PhysRAG 不是只会处理某一种“花式水流”,而是对机械、热学、光学等多种现象都有一定可迁移性。

不仅是组合,更是创新:PhysRAG的潜力与未来展望

PhysRAG 看起来像是把“数据清洗”“视频检索”“可学习查询”三件事拼起来,但真正的价值在于,这三件事是围着同一个目标设计的:让生成模型学到可控、可迁移、尽量不掺杂噪声的物理先验。如果只做检索,可能只是给模型塞参考图;如果只做清洗,可能只是把数据变干净;如果只做注入,可能又会被噪声拖累。PhysRAG 把这三步连起来,才形成了一个闭环。
它的启发也很明确。以后如果要做更强的物理视频生成,或许不一定非得让一个超大模型从零学会所有物理规律;更现实的路线,可能是把物理世界拆成可检索、可组织、可注入的知识单元,再让生成模型在需要时调用。这和人类记忆很像:不是每次都重学一遍,而是遇到相似场景时把过去看过的经验拿出来用。
不过这条路线也有现实限制。第一,物理数据库目前只有 170 个手工整理的视频,规模不算大,覆盖面再广也难免有限;第二,检索质量高度依赖数据库组织方式和检索器本身;第三,当前更偏向“已有物理现象的迁移”,而不是“凭空推演复杂新物理”。所以它更像是一个物理增强器,还不是完整的世界模拟器。
如果未来把这个框架扩展到更大规模的物理知识库,或者接入更细粒度的事件级标注、力学状态、材质属性,PhysRAG 的上限还会继续抬高。到那时,视频生成可能不只是“生成得像”,而是开始具备一定的“物理常识记忆”。这一步要是走稳了,对具身智能、仿真训练、机器人数据合成都挺有想象空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它主要解决视频生成“物理不真实”的问题。简单说,就是让模型别再把液体、碰撞、反射、热学这些现象生成得乱七八糟,而是尽量符合真实世界的物理规律。

RAG 在这里是什么意思?RAG 是 Retrieval-Augmented Generation,中文常译为“检索增强生成”。这里不是检索文本知识,而是检索和当前物理现象相似的参考视频,再把其中的物理动态注入生成模型。

可学习查询为什么比直接拼接更好?因为直接拼接会把很多无关背景、风格信息一起塞进来,容易干扰生成;可学习查询会先“挑重点”,只提炼和物理规律相关的部分,相当于给模型做了一次信息筛选。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是简单把 RAG 套到视频上,而是围绕“物理先验注入”做了数据、检索、注入三位一体设计,思路完整,且问题切得比较准。

实验合理度:★★★★☆ 用 PhyGenBench 和 VBench 双重评测,既看物理正确性又看通用视频质量,比较能说明问题;消融也覆盖了数据过滤和注入机制,逻辑是顺的。

学术研究价值:★★★★☆ 对“物理感知视频生成”这个方向有明确推进作用,尤其给后续做世界模型、具身数据合成的人提供了一个可复用思路。

稳定性:★★★☆☆ 方法本身不算脆,但依赖检索库质量和参考覆盖范围;数据库太小或者检索不准时,效果会打折。

适应性以及泛化能力:★★★☆☆ 对已有物理现象的迁移比较有效,但遇到数据库没覆盖的新物理场景,泛化能力还得继续观察。

硬件需求及成本:★★★☆☆ 训练成本不低,尤其是数据筛选和多模态核验都要花算力;不过推理阶段的检索和注入相对可控。

复现难度:★★★☆☆ 核心代码准备开源,思路清楚,但数据清洗、数据库构建和检索细节会影响复现结果,不算“拿来即跑”的那种。

产品化成熟度:★★★☆☆ 适合做物理感知视频生成的研究原型或特定场景增强,离大规模稳定商用还需要更大数据库和更强评测。

可能的问题:数据库规模偏小,检索覆盖有限;一旦物理场景超出参考库,模型仍可能“物理失忆”。


参考文献

[1] Cheng K, Liu Z, Gao M, Song C, Tang H. PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation. arXiv:2606.26916v1, 2026.
[2] 项目主页与代码:https://github.com/sediment1024/PhysRAG
[3] 演示与封面图:见文中 PhysRAG 架构概览图。

视频生成最怕什么?不是画不出来,是一眼假、满嘴物理胡话。想看更多这类“让模型先懂世界再动手”的论文拆解,欢迎加入龙哥读论文星球~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。