← 返回 PaperDaily 视觉与图像

CVPR 2026斯坦福新作:一张图推演3D世界,碰撞也能预测

斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物

CVPR 2026斯坦福新作:一张图推演3D世界,碰撞也能预测
原论文信息如下:
论文标题:
Perceptual 3D Simulation With Physical World Modeling

发表日期:
CVPR 2026(具体日期未找到)

发表单位:
Stanford University(斯坦福大学)

原文链接:
https://openaccess.thecvf.com/content/CVPR2026/papers/Lee_Perceptual_3D_Simulation_With_Physical_World_Modeling_CVPR_2026_paper.pdf

开源代码链接:
未找到

项目链接:
未找到


从一张图预测3D世界演化:P3Sim如何实现感知级物理模拟

想象这样一个问题:你面前

从一张图预测3D世界演化:P3Sim如何实现感知级物理模拟

先来一个思想实验。假如你在一个游戏引擎里,想看哪个视角就看哪个视角,想推哪个物体就推哪个物体,一切光照、材质、碰撞响应都按物理引擎实时算好——这就是所谓的“上帝模式”。但现实世界中,我们手里的传感器只有摄像头,拍回来的是一堆被遮挡、模糊、不完整的像素。你推了一下桌上的杯子,它到底会不会撞倒旁边的花瓶?花瓶又会怎么倒?没人给你3D几何,也没人给你物理引擎的调试台,所有这些只能靠模型自己从图像里“脑补”出来。
斯坦福大学在CVPR 2026上提出的P3Sim(Perceptual Physical Simulation System,感知物理模拟系统),就是想把这个“上帝模式”装进AI里。P3Sim这个名字听起来像一款沙盒游戏,但其野心远不止玩游戏:它用一个统一框架,把新视角合成(NVS,Novel View Synthesis)、刚体操作、可变形物体操作、碰撞推理甚至多智能体动作预测全部塞进同一个模型——而且输入只有一张图片。
图1:P3Sim系统总览
图1:P3Sim系统总览。P3Sim感知3D模拟系统由三个组件构成:物理世界模型(Ψ)、几何条件化器(Γ)和持久场景记忆(µ)。Ψ对多模态场景变量(RGB、深度、光流)进行概率推断,从部分输入预测未观测元素;Γ推导描述3D变换的线索(如部分目标深度和运动一致的光流);µ随时间整合这些预测,形成连贯且时间一致的3D表征。
如果读者接触过传统三维重建和渲染,会觉得这画面太美不敢想——因为过去任何一个新视角合成模型都要单独训练,物体操作要单独训练,动态场景预测又是另一套东西。P3Sim偏偏用一套机制全部打通。这篇文章的写法也很“工程流”:没有堆砌花里胡哨的模块名,核心就是概率图模型+自回归Transformer+几何条件化三大件,配合一个7B参数的物理世界模型,把3D场景演化这类经典难题包装成了“可控的序列预测”问题。咱们一层层拆开看。

概率图模型+自回归Transformer:统一的多模态场景推断框架

先说清楚P3Sim的核心建模思想。在P3Sim看来,一个3D场景不是什么连续的神经辐射场,也不是一串高斯点云,而是一整套随机变量集合。每个变量对应一个“局部场景元素”——比如某个空间位置的RGB小片、某个位置的深度小片,或者某段时间内的光流小片。这些变量之间的条件依赖关系,构成了一张概率图模型(PGM,Probabilistic Graphical Model)。
概率图模型这个名词听起来很吓人,其实一句话就能讲明白:它用一张图表示“一堆变量之间谁能影响谁”。比如“杯子的位置”会影响“花瓶的位置”,“深度”会影响“遮挡关系”。P3Sim要做的就是在给定一部分变量取值的情况下,推断出其他变量的概率分布。用数学语言描述,物理世界模型Ψ的输入是当前已观测状态X和任意一个未观测变量p,输出是p所有可能取值的条件概率分布。
公式:物理世界模型的条件分布定义
公式中符号说明:X为当前已观测状态,由一组“指针-值”对构成;p为指向某个未观测变量的指针(pointer),比如“第3帧第10行第20列的深度块”;v为该变量的取值;P表示从所有可能取值v∈V中计算条件概率Pr[(p,v)|X]。整个Ψ本质上干的事就是:你给我任意一堆观测,我告诉你任意一个没观测到的东西可能是什么。
问题来了:直接在这么多变量上做PGM推断是出了名的难——变量组合数爆炸,几乎不可能直接训练。P3Sim的解决思路极其清奇:把所有变量序列化成“指针-值对”,用Transformer做自回归预测。所谓“指针”,你可以理解成“这个变量的门牌号”,它说明了这个变量是哪个空间位置、哪个时间点、哪个模态;而“值”是变量具体的内容,比如某个RGB颜色值、某个深度值、某个光流位移值。
公式:自回归序列预测形式
这个公式的意思就是:给定一串指针和值交替的序列,模型用标准GPT式next-token prediction方式预测当前指针p对应的值v_k。关键在于——指针本身也是变量,序列的遍历顺序(先预测哪个位置、哪个模态)是可以被控制的。这就是P3Sim所谓的“随机访问解码”(random-access decoding)——不是像画图一样一行行往右画,而是按需任意跳跃选择先预测哪里,因此天然支持“给定任意条件组合、预测任意未知变量”的灵活推理。
图2:基于多模态概率预测的物理世界建模
图2:基于多模态概率预测的物理世界建模。模型从RGB、深度、光流、相机位姿的部分观测中模拟3D场景演化:(a)多模态时空输入定义部分结构和运动;(b)模型灵活地以可用线索(如已知光流、部分深度)为条件,预测其余变量;(c)概率图模型将多模态场景变量表示为局部节点;(d)随机访问序列建模把这些节点序列化为“指针-值对”,实现跨空间、时间、模态的可控推断。
训练细节也相当硬核:7B参数自回归Transformer,3百万段RGB视频片段,总共约1.4万亿token,batch size 512,训练150万步,序列长度4096(最后2万步涨到8192)。这规模虽然没到视频生成大模型的体量,但也绝对算得上大户人家了。整篇论文最有意思的地方就在这:它没有发明什么复杂的专门架构,而是把3D物理模拟问题巧妙地“降维”成了GPT式序列预测问题——很朴素,但确实聪明。

几何条件化与持久记忆:物理约束与时间一致性的关键设计

光靠一个概率模型“脑补”是不够的,尤其在3D变换任务里,几何信息必须精确。这就是几何条件化模块Γ(geometrizer)登场的理由。Γ的职责是:给定上一时刻深度图、相机内参K、目标相机位姿P_t,以及每个物体o期望的3D变换T_t^(o),推导出两个条件信号——光流F_{t-1→t}和稀疏目标深度D_t^sparse。简单说,Γ把“用户想怎么动相机、怎么动物体”翻译成世界模型看得懂的几何约束语言。
公式:几何条件化模块的输入输出
其中{D_{0:t-1}}表示过去各时刻的深度图序列,K是相机内参(焦距、光心等),P_t目标相机位姿,{T_t^(o)}是每个物体期望施加的3D变换矩阵。Γ输出的F_{t-1→t}是二维图像空间的运动场,D_t^sparse则是从参考视角重投影到目标视角、并且仅保留可靠几何证据的稀疏深度图。
图3:构建几何条件化信号与持久场景记忆
图3:构建几何条件化信号与持久场景记忆。(a)从参考深度图构建部分几何,识别有效和可见表面;(b)应用已知3D变换后,几何条件化器Γ将有效区域重投影到目标视角,生成部分深度和光流条件;(c)持久场景记忆µ随时间整合预测和观测几何,修剪不一致或被遮挡区域,维持连贯的3D表征。
这里的细节值得多说两句。Γ并不是把整张深度图直接拿来用,而是先做一个表面有效性甄别:只有那些表面法线和观察方向的夹角小于阈值的表面才被认为是有效的。为什么?因为掠射角过大的区域深度估计通常不可靠,直接拿去做变换会产生严重伪影。针对静态场景,P3Sim把有效表面从参考视角投影到目标视角,并且只保留那些在进入遮挡之前就打中可见区域的射线,这样生成的稀疏深度本身就携带了几何一致性。
光有空间几何还不够,时间维度的连贯性也得有人管。持久场景记忆模块µ把每一帧的深度反投影成3D几何,再把非刚体运动的3D运动场M_t变换到全局坐标系,最后做双向一致性检查:过去的未观测体积如果投影后挡在当前观测深度前面,就删掉;当前新几何如果投影回过去的视角时和旧观测冲突,也删掉。留下来的,就是跨多帧仍然自洽的稳定3D结构。
公式:每帧几何反投影
G_t表示第t帧重建出的几何,包含可见表面几何以及由遮挡和相机视野限制造成的未观测体积;BackProject表示通过深度图D_t和相机参数T_t反投影得到3D几何。
公式:持久场景记忆更新规则
µ_t的更新函数Update_µ把上一时刻的记忆µ_{t-1}、当前几何G_t、3D运动场M_t、深度D_t和相机参数T_t综合起来,产生新的全局场景估计。这样反复迭代下来,P3Sim就能在多帧观测中维持一个全局一致的3D场景表示,而不是逐帧独立推断,同时也具备了amodal completion(模态补全)的能力——把那些在任意单帧中都没法完整看到的遮挡结构拼出来。

从新视角合成到碰撞推理:P3Sim的多任务能力展示

理解P3Sim的任务覆盖能力,关键看一个概念:推理路径(inference pathway)。P3Sim通过控制两个条件维度来定义不同任务——一个是光流密度(dynamics已知多少),一个是目标深度稀疏度(变换后几何已知多少)。这两个维度一组合,就能派生出各种不同的推理模式。
公式:已知动态下的条件生成
当运动场F_{0→1}完全已知时(密集光流),模型只需要根据稀疏目标深度D_1^sparse先推断完整的目标深度D_1,再根据深度推断目标图像I_1。这就是已知动力学条件下的“确定性渲染”,对应新视角合成(NVS)和刚体操作这类任务。
公式:未知动态下的条件生成
当只有稀疏光流F_0→1^sparse和非常稀疏的深度D_1^sparse时,运动场和结构都是不完整的,模型就必须“脑补”缺失的动力学和几何信息。这类“开环推理”路径对应可变形物体操作、物体碰撞和多智能体交互等任务。
这种设计思路的高明之处在于:它让“有精确几何约束的确定性模拟”和“缺少信息时的概率性猜测”存在于同一个模型里,用同一套参数应对不同条件下的推理需求。下面看图说话,看看它具体能做什么。
图4:新视角合成
图4:新视角合成。模型渲染静态场景的未见视角。这一能力可支持室内导航、机器人生成数据增强和以物体为中心的重建。
图5:刚体物体操作
图5:刚体物体操作。模型在期望3D变换下模拟刚体物体移动后的场景外观,可用于物体操作和规划任务。
图6:相机与物体联合运动
图6:相机与物体联合运动。当相机和刚体物体同时移动时,模型预测场景外观,结合了全局与局部的3D变换。
图7:可变形物体操作
图7:可变形物体操作。当物体局部在3D空间移动时,模型模拟由此引发的其他连接区域的变形。红色箭头表示输入运动,黄色箭头表示模型预测的诱发运动。
图8:碰撞推理
图8:碰撞推理。当局部3D运动造成接触或撞击时,模型预测物体之间如何相互作用。红色箭头表示输入运动,黄色箭头表示模型预测的诱发运动。
图9:多智能体行为预测
图9:多智能体行为预测。模型预测一个智能体的运动如何影响场景中的另一个智能体,并受到对方影响。红色箭头表示输入运动,黄色箭头表示模型预测的诱发运动。
比较惊艳的是图8和图9这两组。碰撞推理里,红箭头只告诉模型“这个物体往那边动了”,模型却自动推断出另一个物体被撞击后的运动方向;多智能体场景里,输入的运动线索其实非常含混,模型甚至能给出对未来的概率性分布预判,而不是强行输出一个确定答案。这才是感知级模拟该有的样子。
图10:提取完整场景描述
图10:提取完整场景描述。(a)场景级描述:模型将逐帧几何聚合为跨视角全局一致的3D地图;(b)物体级描述:以物体为中心的新视角合成实现几何一致的物体形状补全;(c)模态补全:模型重建被遮挡或未观测的结构,得到更完整的3D场景表征。
图10展示的模态补全尤其值得注意:模型并不是简单插值画面,而是通过持久场景记忆把多帧信息融合成统一3D地图,把藏在遮挡后面的结构“补”出来。这在机器人操作和自动驾驶场景中意义重大——毕竟现实世界没有无限次试错的机会。

定量评估与对比:P3Sim在NVS和3D操作任务上的表现

定性看演示很惊艳,定量也不能含糊。论文用了两个标准化基准做评测:NVS用SEVA基准(SEVA是一个单图像新视角合成的评估框架,全称是Single-image novel view synthesis Evaluation with Viewpoint Adaptability,由SEVA论文提出),物体操作用3DEditBench基准。
表1:SEVA基准NVS的PSNR结果
表1:SEVA基准NVS的PSNR结果。在Reconfusion划分的小视角NVS设置下,对RE10K、LLFF和DTU三个数据集进行了评估。表格对比了ViewCrafter、SEVA和P3Sim(本方法)的PSNR指标(PSNR即峰值信噪比,Peak Signal-to-Noise Ratio,数值越高代表图像重建质量越好)。P3Sim在三个数据集上均取得最高分:RE10K 21.54,LLFF 15.18,DTU 15.50。
需要客观指出的是,RE10K上的提升为0.66dB(20.88→21.54),LLFF上相对最强基线提升1.15dB(14.03→15.18),DTU上提升1.03dB(14.47→15.50)。属于稳定的正向增益,但并非“碾压式”提升——不过考虑到NVS本身评测指标已高度内卷,能在三个数据集上保持全线提升已经很能说明问题了。
表2:3DEditBench上3D物体操作结果
表2:3DEditBench上3D物体操作结果。对比DragAnything、DiffusionHandles、LightningDrag和P3Sim四个模型。评估指标包括PSNR(重建质量,越高越好)、LPIPS(感知相似度,Learned Perceptual Image Patch Similarity,越低越好)和EA(编辑一致性,Edit Adherence,越高代表变换越忠实)。P3Sim以PSNR 23.12、LPIPS 0.121、EA 0.827全面领先。
3D物体操作上的优势比NVS更明显:PSNR比LightningDrag提升3.6dB,LPIPS从0.184降到0.121,EA从0.722涨到0.827。这说明P3Sim在处理实际3D变换时,不只是图像质量更高,更重要的是变换的“忠实度”更可靠——物体摆到位了,遮挡关系也对了,没有拖影和鬼影。
实验设计的合理之处在于,NVS和3D物体操作恰好对应了“静态场景+相机变换”和“动态场景+物体变换”两类基础能力,其他演示(变形、碰撞、多智能体)都是这两项能力的延伸。而论文也比较坦诚:碰撞推理等任务目前没有标准评测基准,所以只做了定性展示,没有强行造数字。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?斯坦福大学提出P3Sim感知级3D物理模拟系统,融合概率世界模型、几何条件化与持久场景记忆,从单张图像预测3D变换下的场景演化,支持新视角合成、物体操作、碰撞推理等任务,SEVA与3DEditBench基准上多项指标领先。
这篇工作最值得看的点是什么?在NVS任务上,P3Sim在RE10K、LLFF、DTU三个数据集上均取得最高PSNR(21.54、15.18、15.50);在3D物体操作任务上,P3Sim在PSNR(23.12)、LPIPS(0.121)和EA(0.827)指标上全面领先对比方法。
这篇工作的边界或风险在哪里?优点:(1)统一框架处理多种3D变换任务,包括新视角合成、物体操作、动态场景预测等;(2)概率推断框架天然处理不确定性;(3)几何条件化模块提供物理约束;(4)持久记忆支持在线更新。缺点:(1)7B参数模型训练成本极高;(2)定量评估仅覆盖NVS和刚性物体操作,其他任务的评估缺乏标准化基准;(3)对复杂真实场景的泛化能力有待验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出P3Sim系统,将3D场景模拟建模为多模态场景变量上的概率推断问题,通过指针-值序列化的自回归transformer实现灵活的随机访问解码,结合几何条件化模块和持久场景记忆实现从部分观测和局部动作推断完整3D场景演化。

实验合理度:★★★★☆

PSNR、LPIPS、Edit Adherence (EA)。

学术研究价值:★★★★☆

提出P3Sim系统,将3D场景模拟建模为多模态场景变量上的概率推断问题,通过指针-值序列化的自回归transformer实现灵活的随机访问解码,结合几何条件化模块和持久场景记忆实现从部分观测和局部动作。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

7B参数模型,训练使用1.4万亿tokens,序列长度4096(最后20K步增至8192),训练步数150万步。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)7B参数模型训练成本极高;(2)定量评估仅覆盖NVS和刚性物体操作,其他任务的评估缺乏标准化基准;(3)对复杂真实场景的泛化能力有待验证。

主要参考文献

[1] Lee W, Kotar K, Venkatesh R M, et al. Perceptual 3D Simulation With Physical World Modeling[C]. CVPR 2026.
[2] SEVA: Benchmark for single-image novel view synthesis evaluation (CVPR 2025).
[3] 3DEditBench: A benchmark for 3D object manipulation and editing.
[4] ViewCrafter: Taming video diffusion models for high-fidelity novel view synthesis.
[5] DragAnything: Motion control for anything using entity representation.

融会贯通

把这篇论文放到PaperDaily已收录论文的坐标系里看,能观察到一些有趣的脉络。7月底刚收录的同团队PhyWM工作,重点在于让模型“理解物理”——从视觉输入中提取物理状态和因果关系;而P3Sim更进了一步,把“理解物理”升级成了“能模拟物理演化”——给定部分观测和部分变换信号,直接预测未来的3D场景状态。前者是感知,后者是推演,两者结合恰好构成具身智能中“感知-预测-行动”闭环的上半场。
不过需要提醒各位读者:目前PaperDaily已收录论文范围内,缺少足够的同基准(RE10K/LLFF/DTU)NVS或3DEditBench的定量对比数据,因此暂时无法对P3Sim做跨库的整体领先性判断。从论文自身报告的数值来看,P3Sim在SEVA基准三个数据集上都有提升,但幅度有限(RE10K上约0.66dB),而在3DEditBench上的优势更明显(PSNR提升3.6dB)。建议把结论限定为“在所报告基准上全面优于对比方法”,而不是“全领域显著领先”。后续如果有更多同基准测试结果入库,再做横向比较会更严谨。
从更宏观的视角看,P3Sim代表了一种趋势:传统的NVS、物体操作、物理预测这些割裂的计算机视觉子领域,正在被统一的世界模型框架重新整合。虽然P3Sim本身离真正的“通用3D模拟器”还有距离——模型规模、推理速度、真实场景适配性都是坎——但它是这个方向上值得关注的一块基石。做机器人、自动驾驶和交互式内容生成的朋友,建议把这篇纳入阅读清单。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
一张图推演万物演化,P3Sim带你看懂3D世界如何"动"起来~
想第一时间解锁更多世界模型、3D视觉前沿干货?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 3D视觉+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。