CVPR 2026斯坦福新作:一张图推演3D世界,碰撞也能预测
斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物
图像取证是典型“平时用不上、出事就救命”的技术。这篇论文不依赖训练数据、不查设备指纹库,仅凭单张可疑图像就能定位篡改区域,RTD数据集上AUC达0.839、IoU 0.725,多项指标领先同类方法。做内容安全、多媒体取证的朋友值得一读。
扩散模型做MRI重建效果好,但动辄几百上千步的迭代采样让临床落地遥遥无期。明尼苏达大学这篇CM-RED,把一致性模型塞进RED优化框架,4步出图,PSNR/SSIM全面超越1000步的DPS和100步的DDS,计算量直降25—250倍。生成式MRI重建的“速度焦虑”,这次是真的被治好了。
想象一个场景:某情报分析系统正在滚动监测全球事件流,屏幕突然弹出一条提示——“未来一周,A国可能与B国启动贸易谈判”。
史上最亮伽马暴GRB 221009A飞过天际时,IXPE用了三天才转过头,偏振只能给出一个上限;而规划中的EXPO能在约50秒内自主重指向,把"上限"变成"精度"。这篇文章讲的就是这台把X射线偏振能段拓宽4倍、重指向快8000倍的下一代空间天文台。
训练扩散Transformer最烧钱的不是模型,而是优化器?Meta这篇新作把Muon优化器从1.3B一路验证到15B,生成质量稳定赢过AdamW最高19.1%,又用「周期性行式」设计把优化器通信量砍掉66.7%。质量不掉、速度反超,训练成本敏感的同学值得细读。
这是一篇被引1647次的深度学习经典之作。当所有人都在用CNN最后一层特征时,UC Berkeley团队提出“超列”表示,将多层特征融合用于像素级定位,在分割、关键点、部件标注三大任务上全面领先,至今仍是多尺度特征融合的思想源头。
这篇来自Apple的新研究直接把“视觉思维”做进了训练:模型在训练时预测未来帧的潜在表示,推理时不再生成中间图像,端到端延迟比显式视觉CoT降低5倍以上,同时在6个评测设置上稳定超越纯文本后训练。对视频理解、实时预测和统一多模态模型感兴趣的同学值得细读。
当离散路径选择和连续轨迹优化纠缠在一起,传统方法常在无限解空间里迷路。这篇最新论文把Steiner旅行商问题搬进凸集图,用统一分支定界把访问顺序、传感模式和连续轨迹一次打包,180个基准实例30秒内全部找到可行解,还自带ε-最优性证书。搞机器人自主规划的同学值得读一读!
先问大家一个问题:如果你是一个放射科医生,看到一张腹部CT片子,有人问你“肝脏在脾脏的左边还是右边?”,你会怎么回答?
关节物体重建一直是机器人操作里的硬骨头,以前的方法要么依赖关节类型先验,要么遇到螺旋关节就翻车。REArtGS++ 直接拿两张不同状态的多视角 RGB 照片,就把零件级网格、关节参数一起端出来,螺旋关节误差比之前最好的方法降了一个量级,单卡 4090 只要 20 分钟,值得一读。
图表理解长期卡在数据上:规模小、模态不全、代码缺失。MIT、IBM联合开源ChartNet,150万张图表、24种类型、6种绘图库,五种模态完全对齐,居然让2B小模型在图表重建、数据提取上超越GPT-4o,这数据质量有点东西。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球