CVPR 2026 PhyWM:1.4万亿token训练通用世界模型
继2026年5月推送的NeoVerse之后,斯坦福又带来一款暴力物理世界模型PhyWM。它没有标注,没有动作标签,仅靠自回归预测光流和RGB,就能零样本完成物体分割、3D操纵甚至Visual Jenga。对机器人、具身智能来说,这是一条通往物理智能的捷径。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
继2026年5月推送的NeoVerse之后,斯坦福又带来一款暴力物理世界模型PhyWM。它没有标注,没有动作标签,仅靠自回归预测光流和RGB,就能零样本完成物体分割、3D操纵甚至Visual Jenga。对机器人、具身智能来说,这是一条通往物理智能的捷径。
你是不是也遇到过这种尴尬:下载了一个精美的3D模型,结果纹理一放大全是马赛克,UV接缝处裂开得像补丁?传统图像超分模型拿到纹理图上直接翻车,生成模型又一味“自由发挥”不保留原细节。浙大团队这次祭出Texture++,用“自适应视角+四叉树掩码+局部单步扩散”三板斧,既保真又无缝,4倍超分PSNR飙到37.53,比SOTA高出1.5个dB,关键是——不需要梯度
一段单目第一人称视频,竟然想同时“读出”身体、手、注视、相机轨迹和深度。ReViV最有意思的地方,不是它又做了一个单任务模型,而是把这些本来就互相牵连的信号,硬是塞进了一个统一生成框架里,还跑得很快。
THz成像最烦的不是“看不见”,而是“看见了也看不清”。这篇工作把3D打印透镜和65nm CMOS源阵列拼成一套完整系统,直接把0.2mm细节、QR码和多层PCB内部结构都拎出来了,工程味很足。
3D场景检索最怕“指令说改一处,系统却把整间屋子都翻了”。这篇工作直接把问题拆成可执行的重排流程,还顺手补了一套新基准,实用性比很多只会讲概念的方案更硬。
多视图Transformer最怕什么?不是算力不够,而是位置编码“认不出同一块内容”。RayRoPE直接把patch绑到射线上,再让模型自己猜深度、补不确定性,结果就是:既要几何一致,又要多频细节,还能保持SE(3)不变。Apple Research这篇,属于把老问题拆开后重新装对了。🤨
高速运动把图像“拍糊”这件事,常见到让人麻木,但真要把它从3D重建里彻底修好,难点就来了。JADE-GS的思路很直接:让事件相机补时间信息,再让3D几何反过来约束2D去模糊,效果和效率都比单向流水线更像样。
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。
3D场景生成一直卡在两个字:太大。SceneTok偏偏反着来,把场景先压成少量无序token,再把“渲染”和“生成”拆开做,结果是压缩率高得离谱,速度还不慢,挺像把大卡车拆成乐高再开回去。
单图生成3D场景,最难的不是“能生成”,而是“生成后还能不能继续细化且不跑偏”。HIVE-3D把粗场景、2D分割、注意力对齐和体素超分辨率串成一条链,思路很工程,也很实用。
这篇论文最有意思的地方,不是又测出一个“更强的评审模型”,而是直接把评审这件事拆成了管线问题。模型、视角、输入、提示词,谁都别想装作无关;结果也很实在:六视图RGB加规则提示,成了最稳的低成本默认方案。
3D贴图最烦的不是“有没有”,而是“能不能把复杂花纹贴得像真的”。Ink3D的思路很直接:几何交给3D模型,纹理交给视频生成,再用烘焙把两边缝起来,工程味很足,也很有启发。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球