← 返回 PaperDaily
视觉与图像
视频生成告别翻车?PhysRAG先检索再注入
这篇 PhysRAG 很像给视频生成模型补了一本“物理常识小抄”:先把高质量物理视频筛出来,再把相关参考视频检索出来喂给模型。结果不光物理更靠谱,视觉质量也没掉链子,挺适合想看“RAG 怎么跨到视频生成里”的读者。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇 PhysRAG 很像给视频生成模型补了一本“物理常识小抄”:先把高质量物理视频筛出来,再把相关参考视频检索出来喂给模型。结果不光物理更靠谱,视觉质量也没掉链子,挺适合想看“RAG 怎么跨到视频生成里”的读者。
原论文信息如下:
视频生成总是“翻车”?物理定律成了最大难题!
视频生成这几年进步很快,画面越来越像样,但一碰到真实世界的物理规律,模型就容易原地露馅:水该怎么流、火该怎么烧、物体碰撞后该怎么弹、光线反射该怎么变,常常一言不合就“穿帮”。
PhysRAG 的思路很直接:既然模型自己记不住物理,那就给它找“物理小抄”。先从物理相关视频里检索参考,再把这些参考里真正有用的物理信息抽出来,喂给视频扩散模型,让它生成时别再瞎编。
龙哥导读:这篇论文最有意思的地方,不是“又做了一个视频模型”,而是它把 RAG 这套“外部知识检索”思路搬到了视频生成里。视频不再只靠参数记忆,而是先去“翻物理课本”,再动笔作答。
从“看世界”到“懂物理”:PhysRAG如何赋予AI物理常识?
先把几个基础概念捋顺。这里的 RAG 是 Retrieval-Augmented Generation,中文一般叫检索增强生成。它的经典套路是:先从外部知识库里找相关内容,再让生成模型参考这些内容输出结果。以前这招更多用在文字问答里,PhysRAG 则把它搬到了视频生成。
论文的核心判断很朴素:人类理解物理,不一定是先背公式,再做题;很多时候是先见过类似场景,脑子里自动调出经验。比如看过水往低处流、球会落地、风会吹动头发,就会对新场景有个大致预判。PhysRAG 试图让模型也走这条路:先检索相似物理现象,再把其中的物理先验注入生成过程。
它解决的不是“视频能不能动起来”这种低阶问题,而是“视频动得像不像真的”这种更难的问题。因为一旦涉及热传导、流体、碰撞、反射、材料变化,单靠文本提示很容易把模型带沟里。视频看着再炫,物理不对,观众一眼就会觉得“这玩意儿不太对劲”。
*表格超出部分左右可以滑动
| 项目 | 内容 |
| 应用场景 | 面向文本到视频生成,尤其是需要遵守物理规律的场景,如流体、碰撞、反射、热效应和材料变化。 |
| 问题建模 | 把物理常识注入视频扩散模型,让模型在生成时参考真实物理视频中的动态先验,而不是只靠文本提示“脑补”。 |
| 模型Backbone及选择原因 | 基于 Wan2.2-5B 的 Video DiT(Video Diffusion Transformer,视频扩散变换器)骨干;它本身具备较强的视频生成能力,适合作为承载物理先验的底座。 |
| 损失函数 | 论文主要沿用扩散模型的去噪训练目标,并联合训练可学习查询与主干模型;正文未强调新增复杂损失。 |
| 训练数据集 | 以 WISA-80K 为原始数据源,经两阶段过滤后得到约 7K 高质量物理视频子集。 |
| 测试数据集 | PhyGenBench 与 VBench。 |
| 训练方法 | 先清洗数据,再用检索增强机制构建物理参考视频数据库;训练时将检索到的物理特征通过可学习查询注入 DiT 早期层。 |
| 实验效果 | 在物理正确性与常规视频质量上都取得了稳定提升,并在 PhyGenBench 和 VBench 上达到最优或接近最优结果。 |
| 方法优势 | 能显式利用外部物理视频作为先验,既提升物理一致性,又尽量不牺牲整体画质。 |
| 方法缺点 | 依赖高质量物理参考库与检索效果;数据库规模较小,覆盖范围仍有限,通用化能力还有继续扩展空间。 |
从“看”到“懂”:PhysRAG如何“观看”物理视频并“理解”物理规律?
PhysRAG 的方法可以拆成两段:先把“靠谱的物理视频”挑出来,再把“有用的物理信息”抽出来。这两个动作看似简单,实际上都在帮模型避坑。
第一步是构建训练数据。原始数据来自 WISA-80K,但论文明确指出,这类互联网视频虽然量大,质量却不一定稳,很多字幕和画面对不上,物理现象也可能只是“看起来像”。于是作者设计了一个两阶段过滤流程。
这个设计很像做题前先把“题目质量”筛一遍。第一阶段用 Qwen3-VL-4B 只看字幕,挑出前 10% 的候选;第二阶段再把关键帧和字幕一起送进去,检查画面和提示词是否一致,保留其中 90%。这样做的好处是成本可控,坏处是会损失一些样本,但论文显然更在乎“少而精”。
第二步是构建物理视频数据库。作者不是随便把视频堆在一起,而是手工整理成 17 类物理现象,每类收集 10 条高质量视频,总共 170 条。类别包括碰撞、燃烧、爆炸等常见物理场景。这个库不大,但胜在“有明确主题”,检索时更容易找到真正有帮助的参考。
第三步才是真正的“注入物理常识”。检索到的视频先经过 VideoMAE V2 编码,得到时空特征。但这里有个麻烦:这些特征太密了,直接全塞进生成模型,容易把无关背景、外观细节也一股脑带进去,反而污染生成。于是作者提出了 Query Inject 模块,用可学习查询做信息瓶颈。
论文里的公式不复杂,核心就是一件事:让查询去“问”视频特征,筛出真正有物理价值的部分。交叉注意力负责聚合信息,前馈网络负责再加工,投影层负责把维度压回去,最后通过门控残差把这些物理先验加进 DiT。这样做的直觉很像“老师给你划重点”,而不是把整本书直接砸脸上。
这里的关键缩写也顺手解释一下。DiT 是 Diffusion Transformer,中文可理解为扩散变换器,是一类把 transformer 用在扩散生成里的骨干结构。VideoMAE 则是视频掩码自编码器系列方法,论文使用的是 VideoMAE V2 作为特征提取器。FAISS 是 Facebook AI Similarity Search,用于高效近邻检索。
实验证明:PhysRAG让视频生成的“物理课”成绩显著提升!
实验部分的逻辑很清楚:先看它能不能把“物理正确性”做上去,再看它会不会把常规视频质量拖下水。毕竟很多方法一加控制就开始变丑,像戴上紧箍咒之后连动作都不敢做了。PhysRAG 的目标是两边都要顾到。
从定量结果看,PhysRAG 在 PhyGenBench 上拿到了最高平均分 0.58。这个基准主要考察物理常识,覆盖 mechanics、optics、thermal、material 等维度。相比 Wan 2.2 基线,PhysRAG 在 thermal 和 material 上都有明显提升,说明它对“热”和“材料”这类更容易翻车的场景确实有帮助。
更有意思的是,它不是只会“物理分数高”,在 VBench 这种更偏通用视频质量的评测上也没有掉队。VBench 关注颜色、风格、主体一致性、空间关系、多目标处理等指标,PhysRAG 接入 Wan 2.2 后,Low-Avg 和 High-Avg 都有提升,说明物理先验并没有把画面搞得更僵,反而让生成更稳。
消融实验也挺有说服力。作者比较了直接拼接、直接交叉注意力和 Query Inject 三种方式。结果显示,简单拼接最弱,直接交叉注意力会好一些,但仍会把无关视觉噪声带进来;而 Query Inject 通过可学习查询充当“过滤器”,把重点物理信息留下,把背景噪声踢出去,所以效果最好。
从可视化结果看,PhysRAG 的优势不是“更花哨”,而是更符合因果顺序。比如液体滴落时,液体不会莫名其妙提前扩散;水面反射不会凭空消失;机械臂不会在该动的时候装死。这些细节虽然不起眼,但正是物理一致性的核心。
实验还做了线性探针,验证 Query Inject 是否真的保留了物理类别信息。结果表明,经过查询瓶颈后,隐藏 token 的分类性能虽然略低于原始特征,但仍然很接近,说明它确实把“有用的物理信息”压缩并保留下来了,而不是一股脑丢掉。
龙迷三问
这篇论文到底解决了什么问题?它主要解决视频生成“不懂物理”的问题。方法不是单纯靠模型记忆,而是通过检索物理视频、抽取物理先验、再注入生成过程,让生成结果更符合真实世界的规律。
Query Inject 是什么意思?可以把它理解成“筛重点”的模块。它用可学习查询去注意检索视频特征,只保留和当前生成相关的物理动态,再把这些信息送进 DiT,避免把背景噪声也一起塞进去。
为什么要先做两阶段数据过滤?因为原始互联网视频太杂,很多字幕和画面对不上,物理现象也不一定靠谱。先粗筛再精筛,能用较低成本留下更干净、更适合学物理规律的数据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 这篇论文的点子不算“凭空造神”,但把 RAG 正经搬进视频物理生成,还做成了可落地的检索增强管线,思路挺新。
创新点主要在“检索什么”和“怎么注入”两处:不是检索一般参考图,而是检索物理视频;不是粗暴拼接,而是用可学习查询抽取先验。
实验合理度:★★★★☆ 评测覆盖了物理正确性和通用视频质量两个方向,比较完整。消融也围绕数据过滤、检索和注入方式展开,逻辑比较顺。
如果说还有一点可挑剔,那就是物理数据库规模不大,检索库的覆盖范围会影响结论上限。
学术研究价值:★★★★☆ 对“物理感知视频生成”这个方向很有启发,尤其适合后续继续做检索、记忆、物理先验注入等研究。
它提供了一个很清晰的范式:外部知识不一定只存在于文本里,视频本身也可以是物理知识载体。
稳定性:★★★☆☆ 在论文设定的物理场景里表现不错,但对数据库质量和检索准确性比较敏感。
如果检索错了参考,注入的先验也可能跟着跑偏,所以它不是“开箱即无脑稳”的类型。
适应性以及泛化能力:★★★☆☆ 对常见物理现象有帮助,但数据库只覆盖 17 类、170 条视频,离“什么物理都能懂”还差得远。
不过它的框架是可扩展的,只要后续把物理库做大、做细,泛化空间还是有的。
硬件需求及成本:★★★☆☆ 训练用了 4 张 NVIDIA H20,周期两天,还要做检索、编码和数据过滤,成本不算低。
好消息是推理阶段主要是检索加注入,理论上比重新训练大模型友好一些。
复现难度:★★★☆☆ 代码计划开源,这点加分;但数据清洗、物理库构建、检索链路和训练细节都不算轻松。
要完整复现,工程能力得在线,不是“复制粘贴就跑飞”的那种简单活。
产品化成熟度:★★★☆☆ 在需要物理真实性的视频生成场景里很有潜力,比如仿真、教育、机器人内容生成。
但要真正落地到通用产品,还需要更大规模的物理库、更稳定的检索和更强的跨场景鲁棒性。
可能的问题:方法依赖高质量检索库,覆盖有限;物理类别与真实世界长尾场景之间仍有距离,未来更像是一个可扩展框架,而不是终局答案。
主要参考文献
[1] Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang. PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation. arXiv:2606.27361, 2026.
[2] 代码与项目主页:https://github.com/sediment1024/PhysRAG
[3] 论文原文:https://arxiv.org/pdf/2606.27361v1.pdf

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

