← 返回 PaperDaily 视觉与图像

VPW代码世界模型:比代码基线高23.5%,接触操作从0到96%

如何让机器人学会像人一样理解物理世界?港浸大团队提出了VisualPatchWorld,它不依赖人工搭建的物理引擎,而是从几个专家轨迹中自动学习可执行的代码级世界模型。这种方法既保留了神经模型的自动化能力,又让模型变得清晰可见、可编辑。

原论文信息如下:
论文标题:
VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
发表日期:
2026年07月
发表单位:
Hong Kong Baptist University (香港浸会大学)
原文链接:
https://arxiv.org/pdf/2607.25236v1.pdf
开源代码链接:
https://github.com/HKBU-KnowComp/VisualPatchWorld/
今天龙哥要聊的这篇,来自香港浸会大学团队的 VisualPatchWorld(VPW),读完之后龙哥只想说:这思路,真特么清奇。 这帮人居然把“世界模型”写成了活生生的、可执行的 Python 代码——你可以在代码里看到“哦,原来机器人认为物体是这样移动的”,然后还能手动改两行参数,让它的物理直觉变得更好。这可比黑盒神经网络让人踏实多了。
先别急着说“不就是写个物理模拟器嘛”,VPW 不是手工撸的,而是从几条专家轨迹中自动“学”出来的代码。它用了两阶段归纳:先通过短促的主动探测选出正确的动力学“草图”(是接触驱动还是线性导航?是关节空间还是笛卡尔?),再根据多步预测误差拟合参数。最终产出的,就是一个可以像模拟器一样滚动、可以像程序一样检查修改、可以直接塞进规划器用的 python 文件
龙哥看到这个想法的时候,脑子里蹦出来的表情是下面这样的👇

1. 代码也能当世界模型?VisualPatchWorld 横空出世

先简单说一下背景。“世界模型”(World Model)——这词在不同领域有不同含义,但核心目标都一样:代理(Agent)用模型预测环境在动作下如何变化,从而支持感知、仿真和规划。目前有两类典型实现:

神经世界模型 比如 Dreamer、LeWM 等,直接从交互数据中学习,把动力学压缩成连续向量空间的隐表示。优点是可扩展、数据驱动;但问题是,当它预测错了,你根本不知道错在哪——没有可编辑的方程,也没有可检查的规则。

显式物理引擎 比如 MuJoCo、PyBullet,状态和物理定律都是显式的、可查看可修改。但坏处是,每个新环境都需要人类专家从头搭建,工程量大到令人发指,根本不可能大规模自动生成。

那么问题来了:有没有一种方法,既能像神经模型那样自动从数据中学习,又能像物理引擎那样给出可解读、可编辑的代码? VPW 给出的答案就是:把世界动力学直接写成代码——代码本身就是一种结构化的隐表示。这不是比喻,VPW 真的产出一个可执行的 Python 函数,你把它 import 进来,喂给它当前状态和动作,它就能输出下一时刻状态。
先感受一下全景图——下面这张图展示了 VPW 在“世界模型”光谱中的位置:左边是隐向量空间的黑盒,右边是手工精调的数字引擎,而 VPW 恰好用代码架起了一座桥。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球