← 返回 PaperDaily 大模型与智能体

超越DARTS的NAS新范式:0.26M参数拿下99.63%准确率

世界模型这两年火得发烫。无论是视频生成、机器人控制还是游戏AI,都指望它能学会在脑子里模拟真实世界的变化规律。可大伙儿慢慢发现一个尴尬现状:让世界模型在开放世界里随便"脑补"未来,它玩得挺欢;

超越DARTS的NAS新范式:0.26M参数拿下99.63%准确率
原论文信息如下:
论文标题:
Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models
发表日期:
未找到日期
发表单位:
UC Davis, Open Path AI Foundation
原文链接:
https://arxiv.org/abs/2510.26782

世界模型这两年火得发烫。无论是视频生成、机器人控制还是游戏AI,都指望它能学会在脑子里模拟真实世界的变化规律。可大伙儿慢慢发现一个尴尬现状:让世界模型在开放世界里随便"脑补"未来,它玩得挺欢;一旦要它精确克隆一个固定环境——比如把某个3D迷宫的每一条路线、每一帧画面都准确复现出来——模型就"失忆"了,往往几步之后就开始天马行空,画面飘得亲妈都不认识。
UC Davis团队的最新工作(已被CVPR 2026录用)直接挑明了这个问题的"罪魁祸首"——不是动力学模型不够强,而是潜在表示的几何结构压根没对齐真实世界。本文提出了一种名为GRWM(Geometrically-Regularized World Models,几何正则化世界模型)的即插即用模块,仅靠给自编码器加两条对比学习约束,就能显著拉长世界模型的高保真预测范围。从3×3小迷宫到9×9大迷宫,再到Minecraft复杂场景,误差曲线一路压制各路SOTA。

世界模型为何"失忆"?——长时程预测的隐形瓶颈

先来聊聊世界模型到底在忙活什么。简单说,世界模型就是让AI在脑子里建立一个"环境模拟器":给它当前看到的一帧画面(observation,观测)和即将执行的动作(action,行动),它要能预测出下一帧甚至未来很多帧的画面。有了这种能力,AI就能在正式行动之前先在脑内"预演",不管是机器人导航、游戏对战,还是自动驾驶,都能少踩很多坑。
但问题来了。现在的主流世界模型,从Sora到各种视频生成大模型,走的是"开放世界随机生成"的路子:目标是生成看起来合理的画面,而不是精确复现某个真实环境的唯一轨迹。这种模式在生成"有想象力的视频"时确实惊艳,可一旦把场景换成一个固定地图的迷宫、或者一个室内机器人导航任务,模型立刻就露馅了——预测误差随步数指数级累积,几步之后画面就开始扭曲、跳变,甚至出现"瞬移"到相似场景的诡异现象。
UC Davis团队盯上的正是这个痛点:确定性环境的精确克隆。所谓确定性环境,就是规则完全固定、给定初始状态和动作序列后结果唯一的环境——比如固定布局的迷宫、静态地图上的导航任务。在这种场景下,世界模型的唯一目标就是做到"高保真克隆":把你走过的每一步真实画面,原原本本地复现出来。
听起来不难对吧?但论文用实验结果给我们泼了一盆冷水:所有现有SOTA世界模型,在这个任务上全都扛不住长时程预测。哪怕是在一个仅3×3的小迷宫里,模型跑个几十帧就开始偏离真实轨迹。问题究竟出在哪儿?是预测未来画面的动力学模型太弱,还是喂养动力学模型的那个"中间表示"本身就长歪了?这正是本文最想回答的核心问题。

诊断实验:表示质量才是"罪魁祸首"

要搞清楚瓶颈在哪,最直接的办法就是做一个"换零件"实验。团队设计了一个巧妙的oracle(先知)模型:绕开从图像里猜状态的难题,直接把环境里真实的物理状态变量——也就是智能体的位置坐标(x, y)和朝向角θ——喂给动力学模型。除此之外,oracle模型的结构和一个标准的VAE世界模型完全一致。
实验结果一出来,对比极其鲜明:oracle模型在63步的预测中几乎零误差,而标准VAE世界模型的误差曲线则一路飙升。两个模型架构完全相同,唯一区别是潜在状态从哪来——一个用的真实坐标,一个用的自编码器学出来的表示。这直接说明了一个重要结论:高保真长时程克隆完全可行,真正的瓶颈不在动力学模型,而在潜在表示空间的几何结构。
图1:表示质量是世界模型保真度的核心瓶颈。左侧为简单确定性3D导航环境中的逐帧MSE曲线。oracle模型(黑色虚线)几乎零误差,确立了性能上界;标准VAE世界模型(蓝色虚线)误差快速累积;GRWM(绿色实线)显著缩小了差距。右侧展示了GRWM学习到的结构化潜在空间(下)与VAE相对混乱的潜在空间(上)的对比。
图1:表示质量是世界模型保真度的核心瓶颈。左侧为简单确定性3D导航环境中的逐帧MSE(均方误差)曲线。oracle模型(黑色虚线)几乎零误差,确立了性能上界;标准VAE世界模型(蓝色虚线)误差快速累积;GRWM(绿色实线)显著缩小了差距。右侧展示了GRWM学习到的结构化潜在空间(下)与VAE相对混乱的潜在空间(上)的对比。
那为什么标准VAE的潜在表示会翻车?论文给出的分析很透彻:VAE的训练目标主要是"重建",它能让每个画面的压缩误差尽量小,却并不会保证潜在空间里"离得近的点"在真实世界里也离得近。换句话说,潜在空间的邻域结构跟真实状态空间的结构完全脱节。在真实环境里相距很远的两个位置,可能因为视觉上长得像(比如两堵同颜色的墙),被VAE映射到潜在空间的相邻区域。这就给动力学模型埋了一颗大雷——它在预测下一步时,发现跳到另一个"视觉相似但实际无关"的潜在点几乎无成本,自然就学会了"偷懒",长时程预测随之崩坏。

GRWM:用对比学习重塑潜在空间几何

问题的根源找到了,接下来就是怎么治。UC Davis团队拿出的方案叫做GRWM(Geometrically-Regularized World Models,几何正则化世界模型),核心思路是:用时间对比学习(temporal contrastive learning)作为几何正则化器,重塑自编码器的潜在空间,让它跟环境的真实状态流形对齐。
首先,GRWM在编码器设计上做了一点关键改动。传统VAE通常只编码单帧图像,但在视觉高度相似的迷宫里,单帧图像携带的信息根本不够定位全局位置——这就是所谓的感知别名问题(perceptual aliasing)。比如迷宫中两处长得很像的岔路口,单看一帧画面根本分不清在哪。因此,GRWM使用了一个因果编码器(causal encoder),接收最近k帧观察序列作为输入,让每一个潜在编码都能融合短时间上下文信息,从而获得更完整的全局定位能力。解码器部分则保持不变,仅解码当前那一帧。这个过程的数学表达如下:
公式1:因果编码与解码。z_t = E(o_{t-k}, ..., o_t),表示编码器E将最近k+1帧观察映射为潜在表示z_t;o_hat_t = D(z_t),表示解码器D从z_t重建当前帧o_t。
公式1:因果编码与解码。这里的E表示因果编码器,接收从第t-k帧到第t帧的观察序列,输出t时刻的潜在表示z_t;D表示解码器,从z_t重建当前帧。通过在潜在表示中融合多帧上下文,模型能够区分那些单帧视觉上难以辨别的不同物理位置。
当然,光给编码器加个时间窗口还不够。标准的重建损失并不保证潜在空间具备良好的几何结构——模型完全可以偷懒,忽略历史帧信息,只靠当前帧硬解。为此,GRWM引入了两条对比正则化约束,作用在潜在向量经过投影层和L2归一化后的单位超球面嵌入上,逼迫潜在空间"长对"了。
第一条叫时序慢变损失(temporal slowness loss)。直觉上讲,物理世界的变化是渐进的——智能体在迷宫中移动时,位置坐标是连续变化的,不会瞬移。因此,同一段轨迹内在时间上相邻的帧,对应的潜在表示也应该靠在一起。这条损失强制把轨迹内所有帧的嵌入互相拉近,让潜在空间中的轨迹变成一条光滑连续的曲线,而不是到处乱跳的散点。公式如下:
公式2:时序慢变损失。L_slow = E_b~D[E_{p_i,p_j~P_b×P_b}[||p_i - p_j||_2]],表示对同一轨迹内所有帧对的平均欧氏距离取期望,鼓励同轨迹潜在嵌入相互靠近。
公式2:时序慢变损失。其中b表示采样自数据集D的一条轨迹,P_b是轨迹b中所有帧的归一化嵌入集合,(p_i, p_j)是从中采样的帧对。这个损失计算同轨迹内所有帧嵌入之间的平均欧氏距离,最小化它意味着让同一条轨迹的潜在表示在超球面上形成紧凑连续的路径,反映状态随时间的缓慢演化。
但只拉近还不够——如果不加约束地拉近所有点,模型很快会撞上特征坍缩(feature collapse)的坑:把所有输入一股脑映射到超球面上很小的区域,省事但毫无区分度。于是第二条潜在均匀性损失(latent uniformity loss)登场了。它专门负责"推开"不同轨迹之间的嵌入,让它们尽可能均匀地分布在超球面上,保留足够的区分度,避免特征坍缩。
公式3:潜在均匀性损失。L_uniform = log E_{p_i,p_j~P_neg}[e^{-2||p_i-p_j||_2^2}],其中P_neg是批内来自不同轨迹的帧嵌入对分布,鼓励不同轨迹的嵌入相互均匀分散。
公式3:潜在均匀性损失。其中P_neg表示同一个训练批次内,来自不同轨迹的帧嵌入对的分布。这个损失通过计算所有跨轨迹帧对之间的径向高斯核期望并取对数,最小化它等价于让不同轨迹的嵌入在超球面上均匀分散,避免坍缩到局部区域。
两条正则化损失加上原本的VAE重建损失和KL散度项,就组成了GRWM的完整训练目标:
公式4:总体训练目标。L_total = L_recon + β·L_KL + λ_slow·L_slow + λ_uniform·L_uniform,其中β、λ_slow、λ_uniform为控制各项权重的超参数。
公式4:总体训练目标。L_recon是图像重建损失,L_KL是变分自编码器中的KL散度项,β、λ_slow、λ_uniform是平衡各项贡献的超参数。整个自编码器以端到端方式训练,GRWM模块仅添加了少量计算开销即可显著改善潜在空间的几何结构。
这套设计的巧妙之处在于,GRWM并没有改动任何动力学模型的结构,而是作为一个轻量级的即插即用模块嵌入到世界模型框架的自编码器部分。任何使用VAE作为表示模块的世界模型,都可以直接套上GRWM获得长时程保真度提升——这正是它的工程价值所在。

实验验证:从3D迷宫到Minecraft的全面超越

为了严格评估世界模型的克隆保真度,团队专门构造了三个确定性环境的基准数据集:M3×3-DET(3×3小迷宫)、M9×9-DET(9×9大迷宫)以及MC-DET(Minecraft复杂场景)。所有环境的布局完全固定,智能体只能看到第一人称视角的画面,俯视图仅用于可视化,不会输入给模型。
环境布局示意图开始部分 图2a和图2b:M3×3-DET与M9×9-DET迷宫俯视图 图2c:MC-DET环境俯视图
图2:三个封闭环境的俯视可视化图。(a) M3×3-DET、(b) M9×9-DET为迷宫环境,(c) MC-DET为Minecraft环境。这些地图仅用于展示整体布局,不会作为输入提供给智能体——智能体接收的只有第一人称观察画面。
在动力学模型的选择上,团队挑选了三款当前SOTA的潜空间生成世界模型:Standard Diffusion(SD,标准扩散)、Video Diffusion Models(VD,视频扩散模型)和Diffusion Forcing(DF,扩散强制)。GRWM不改变这些模型的动力学部分,只是把它们的标准VAE表示模块替换为带几何正则化的版本,由此保证对比的公平性。
评估指标是逐帧像素空间MSE——预测帧与真实帧之间的均方误差。数值越低说明克隆保真度越高。在确定性环境下,任意初始状态和动作序列都对应唯一真实轨迹,这一指标可以精确反映模型预测与事实的偏离程度。
图3a:M3×3-DET数据集上的滚动预测性能对比 图3b:M9×9-DET数据集上的滚动预测性能对比 图3c:MC-DET数据集上的滚动预测性能对比
图3:滚动预测性能。在(a) M3×3-DET、(b) M9×9-DET和(c) MC-DET数据集上,逐帧计算预测轨迹与真实轨迹之间的MSE。oracle模型(黑色虚线)基于真实底层状态运行,确立误差下界。对全部三种动力学模型——Diffusion Forcing(DF)、Video Diffusion(VD)、Standard Diffusion(SD)——GRWM(实线)均持续优于基线(虚线),在63步内显著降低误差累积,大幅缩小了与oracle模型之间的性能差距。
从图3可以清楚看到,GRWM带来的提升是全面的,而且随着预测步数增加,优势越来越明显。基线模型误差曲线几乎呈指数上升,而GRWM的曲线保持平缓,展现出极强的时间一致性。
更硬核的是超长时程测试。团队用Diffusion Forcing作为基础动力学模型,在M9×9-DET上要求模型从同一出发点连续生成10000帧画面。结果显示,基线VAE-WM生成到后面就陷入"循环播放"模式——反复输出同一堵粉墙的画面,变成了一台复读机。而GRWM的10000帧轨迹时刻保持着连贯的探索行为,不同区域的特征按物理可达的顺序依次呈现,没有出现"瞬移"或者反复卡死的情况。
图4:M9×9-DET中程滚动预测定性对比。展示了第100帧和第400帧附近的连续画面。GRWM(下)在整个过程中与真实轨迹保持高度一致,而基线VAE-WM(中)则被困在粉色墙附近,倾向于在视觉相似但实际不同的位置之间瞬移。
图4:M9×9-DET中程滚动预测定性对比。展示了第100帧和第400帧附近的连续画面。GRWM(下)与真实轨迹(上)保持高度一致,而基线VAE-WM(中)则被困在粉色墙附近——说明VAE-WM倾向于在视觉相似但因果上无关的位置之间"瞬移"。
图5:MC-DET中程滚动预测定性对比。从上到下依次为真实轨迹、VAE-WM和GRWM的生成结果。基线VAE-WM无法建模复杂相机轨迹,在第60帧生成了错误的物体(树代替了石墙);GRWM成功跟踪复杂运动,全程保持与真实轨迹一致的高保真生成。 图6:Maze 9x9-CE数据集上超长时程滚动预测定性对比。从10000步滚动预测中每1000步采样一帧。基线VAE-WM频繁卡在相同颜色状态,无法有效探索环境;GRWM生成了连贯且多样化的轨迹,成功探索不同区域并保持长期时空一致性。
图5和图6:定性对比结果。图5为MC-DET环境。基线VAE-WM(中间)在第60帧就把石墙生成了树木,偏离真实轨迹(上);GRWM(下)全程与真实轨迹高度一致。图6为M9×9-DET上10000步超长滚动预测,每1000步采样一帧。VAE频繁卡死在同一颜色状态,GRWM则生成连贯多样的探索轨迹,黄墙的出现是连续穿越物理可行路径的证据,而非随机生成。
除了生成效果,团队还从"潜在空间里到底藏了什么信息"这个角度做了量化分析。他们用训练好的编码器提取所有帧的潜在向量,然后在上面训练一个小型MLP探针(probe),让它仅凭潜在向量来预测智能体的真实坐标(x, y)和朝向θ。如果潜在空间真的和真实状态空间对齐,那么探针的预测误差应该很低,反之则说明潜在表示并没有学好。
表1:潜在探针分析结果。GRWM学到的表示始终更能预测真实底层状态。表格报告了MLP探针在留出集上的回归MSE(越低越好)。三个数据集上GRWM均显著低于VAE-WM。
表1:潜在探针分析结果。GRWM学到的表示始终更能预测真实底层状态。表格报告了MLP探针在留出集上的回归MSE(越低越好)。在全部三个数据集上,GRWM都比VAE-WM显著更低——说明GRWM的潜在空间本质上更"懂"物理世界。
进一步,团队用K-means聚类(K=20)把潜在向量分组,再按每个帧的真实(x, y)坐标画出来。从图7可以直观看到,VAE-WM的聚类结果就像打翻的调色盘,不同颜色点互相穿插,空间上相距很远的帧被归到了同一个簇;而GRWM的聚类则呈现出清晰的空间分块,每个簇对应环境中一个连续区域——潜在空间的几何结构终于和真实世界对齐了。
图7:通过聚类分析可视化潜在空间结构。对帧的潜在表示执行K-means聚类(K=20)。每个点对应一帧,按真实(x,y)坐标在环境中定位,颜色为潜在簇ID。上排VAE-WM的聚类分散且噪声大,空间上相距很远的帧被错误归组;下排GRWM的聚类边界清晰、空间连贯,证明潜在空间与真实状态流形结构对齐。
图7:通过聚类分析可视化潜在空间结构。每个点对应一帧图像,按真实(x,y)坐标放置,颜色为K-means聚类(K=20)分配的簇ID。上排为VAE-WM,聚类散布混乱,空间上相距遥远的帧被错误地分到同一簇;下排为GRWM,聚类轮廓清晰且空间连续,证明学习到的潜在空间与环境的真实状态流形对齐。
这一系列的实验结果传递出一个强有力的信号:表示质量的提升可以直接转化为世界模型长时程保真度的提升。动力学模型本身可能早就具备了学习复杂转换模式的能力,但在一个混乱的潜在空间里,它根本无从发挥。

启示与展望:表示学习将成为世界模型的下一个主战场

这篇论文最大的贡献,不只是提出了GRWM这个模块,更是用一个精巧的诊断实验把世界模型研究的注意力拉回到了表示学习这个根基问题上。过去几年,社区把大量精力花在设计更强的动力学模型上——更深的Transformer、更复杂的扩散机制、更丰富的因果归纳偏置——这些努力当然有价值,但如果潜在表示本身就是一团乱麻,再强的动力学模型也不过是在垃圾堆上盖高楼。
GRWM给出的解法——时间对比学习——并不复杂,甚至可以说简洁得有些"朴素":一条损失让轨迹内部靠拢,一条损失让轨迹之间分散,仅此而已。但正是这两条简单约束的组合,恰好击中了潜在表示几何与真实状态流形对齐的要害。它揭示了一个更深层的规律:世界模型要具备长期稳定性,潜在空间必须保持"时间和空间的双重连贯性"——时间上相邻的帧不能乱跳,空间上不同的位置必须可区分。
从应用角度讲,这项技术对机器人导航、游戏AI等确定性场景意义不小。比如在固定布局的仓储机器人调度场景中,机器人需要精确预判每一步移动后的环境变化,GRWM让这种精确预判变得可行。不过也要清醒看到,本文在完全确定性的环境中验证效果,真实世界往往充满随机性(比如行人突然出现、光照变化等),还有部分可观测性问题需要与更丰富的推理手段结合。从确定性克隆到开放世界的泛化,中间还有很长的路要走。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?UC Davis联合Open Path AI Foundation提出GRWM:通过诊断实验证明世界模型长时程预测失真的主要瓶颈是潜在表示的几何结构而非动力学模型;用时间对比正则重塑自编码器潜在空间,让多个SOTA世界模型在万帧长
这篇工作最值得看的点是什么?GRWM在所有三个数据集和三种动力学模型上均一致优于基线方法,显著降低了长时程预测误差累积,大幅缩小了与oracle模型的性能差距。在10,000帧超长时程生成任务中,GRWM保持连贯多样的轨迹,而基线方法陷入模式坍缩。
这篇工作的边界或风险在哪里?优点:(1) 揭示了表示质量而非动力学模型是长时程预测的主要瓶颈,具有重要理论意义;(2) GRWM作为即插即用组件,可无缝集成到现有世界模型中;(3) 时间对比正则化有效改善了潜在空间结构。缺点:(1) 仅在相对简单和受控的环境中评估,扩展到更复杂场景(部分可观测、随机、照片级真实)仍待解决;(2) 仍存在视觉伪影,无法完全恢复细粒度场景细节;(3) 与oracle性能仍有较大差距。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出几何正则化世界模型(GRWM),通过时间对比学习原则作为几何正则化器重塑自编码器的潜在空间,使其与环境的底层状态流形对齐,从而提升长时程预测保真度。

实验合理度:★★★★☆

帧级MSE(主要指标),SSIM,rFID,PSNR,潜在探针回归MSE

学术研究价值:★★★★☆

提出几何正则化世界模型(GRWM),通过时间对比学习原则作为几何正则化器重塑自编码器的潜在空间,使其与环境的底层状态流形对齐,从而提升长时程预测保真度;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

GRWM在标准VAE基础上增加了时间聚合和几何正则化的额外计算开销,计算量随序列长度增长而增加。

复现难度:★★★☆☆

https://github.com/XiaFire/Clone_Deterministic_Environment

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 仅在相对简单和受控的环境中评估,扩展到更复杂场景(部分可观测、随机、照片级真实)仍待解决;(2) 仍存在视觉伪影,无法完全恢复细粒度场景细节;

主要参考文献

Xia Z, Lu Y, Li X, et al. Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models[C]//CVPR 2026. arXiv:2510.26782.
论文链接:https://arxiv.org/abs/2510.26782
项目地址:https://github.com/(项目开源信息见论文页面)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
世界模型为何总在关键时刻"掉线"?潜在空间几何的坑,群里已经聊明白了!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 世界模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。