← 返回 PaperDaily 视觉与图像

世界模型规划总翻车?VIScore三个维度直接定位病根

潜在世界模型越来越火,可学界一直缺一把能解释“为什么这个模型规划成功、那个却失败”的尺子。本文从SIGReg与VISReg的受控对比入手,把诊断对象从单一编码器扩展到编码器+预测器+规划器三件套,提出VIScore;相关度冲到0.75以上,校准误差还能低于常量拟合,属于世界模型方向稀缺的工具型工作。

世界模型规划总翻车?VIScore三个维度直接定位病根
原论文信息如下:
论文标题:
VISCORE: DIAGNOSING PLANNING-RELEVANT QUALITY IN LATENT WORLD MODELS

发表日期: 2026年8月

发表单位: Altos Labs、布朗大学

原文链接: https://arxiv.org/pdf/2608.11174v1.pdf

项目链接

潜在世界模型的规划质量为何难以诊断?

先聊个事儿。最近这一年,潜在世界模型在机器人决策和自动驾驶圈子里火得一塌糊涂。所谓世界模型,简单说就是让智能体在“脑海”里模拟环境接下来的走向——看了当前画面,猜一猜下一步会发生什么,然后再决定怎么动。而“潜在”(latent)指的是这些预测都发生在压缩后的特征空间里,而不是直接对着像素预测。这样做的好处是训练数据效率高、模型也轻量,其中的典型代表就是端到端联合嵌入预测架构,也就是JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)。
可问题来了:世界模型做规划的时候,有时候成功率高,有时候成功率低。同样的架构、同样的训练数据,换一个任务或者换一个目标距离,表现就天差地别。那到底是谁在拖后腿?是编码器没提取好特征?是预测器想象力不够?还是规划器不靠谱?
现有的诊断方法大多只盯着某一个环节。比如直线度(straightness)测量的是编码器产生的轨迹几何有多“直”;物理状态探测(physical-state probing)检查的是当前潜在表达里有没有包含物理状态信息;行为能力(empowerment)度量的是动作能在多大程度上影响未来的状态。这些指标单独拎出来都有道理,但它们有一个共同的问题——都没有真正去测“规划”这个动作本身,也没有把编码器、预测器、规划器放在一个系统里通盘考虑。
图1:不同数据集和规划器下,成功率与现有诊断指标之间的斯皮尔曼相关
图1:不同数据集和规划器下,成功率与现有诊断指标之间的斯皮尔曼相关
图1把这个问题暴露得很彻底。某些指标在某个任务上跟成功率的相关性看着还不错,换一个任务就急剧下降甚至变成负数。这种“此一时彼一时”的诊断,根本没法在模型开发过程中提供稳定指导。
本文来自Altos Labs和布朗大学,核心思路特别朴素:既然规划是由编码器、预测器和规划器三个组件共同完成的,那就要设计一个指标,把这三个组件都覆盖进来,从“完成规划任务”的角度反过来评价潜在世界模型的质量。这就是论文提出VIScore——Veracity-Influence-Sobriety score(真实性-影响力-清醒度评分)——的出发点。

龙哥导读

如果把世界模型的训练比作教一个学生做物理题,那现在大多数评估方式只看学生“认字多不多”(编码器表征好不好)或者“草稿纸写得整不整齐”(潜在轨迹直不直),却没人认真批改他到底有没有把题做对。VIScore的野心,就是给“做题能力”本身出一张考卷。

VISReg vs SIGReg:正则化干预揭示的规划差异

要理解VIScore为什么设计成三个维度,得先从论文前面一个很有意思的“受控实验”说起。世界模型在自监督训练中很容易遇到一个问题:编码器偷懒,把所有的输入都映射到同一个点,这时候模型的预测能力就废了,这种现象叫表征坍缩(representation collapse)。防止坍缩的常见做法是加一个正则化项,把潜在空间的分布拉向各向同性的标准高斯分布。
LeWorldModel(简称LeWM,世界模型领域一个端到端基线)用的正则化是SIGReg。SIGReg通过Epps–Pulley检验统计量,把嵌入向量在随机一维方向上的投影拉向标准高斯。去年有工作提出了VISReg,同样瞄准各向同性高斯目标,但把它拆成了中心、尺度、形状三个独立约束,好处是可以在数据长尾分布或低秩的情况下分别调节权重。论文在这里做了一个很大胆的替换实验:把LeWM里的SIGReg直接换成VISReg,其他什么都不动,看看规划成功率会怎么变化。
先看自监督学习(SSL)这边的结论。表1是SIGReg和VISReg在ImageNet-LT和Galaxy10上的线性探测准确率对比。
表1:SIGReg与VISReg在ImageNet-LT和Galaxy10上的线性探测准确率(%)
表1:SIGReg与VISReg在ImageNet-LT和Galaxy10上的线性探测准确率(%)。星号表示中心/尺度/形状权重取{0.5, 0.5, 2}。
可以看到,在自监督场景下,VISReg(尤其是经过权重调整的VISReg*)在ImageNet-LT的整体和稀有类准确率上都有明显优势。这说明VISReg在SSL领域确实有它的价值。但到了世界模型规划任务上,事情就没那么简单了。表2给出了四个离线像素控制基准——PushT、Reacher、OGBench-Cube、Two-Room——上的短视野规划成功率。
表2:PushT、Reacher、OGBench-Cube和Two-Room上的短视野规划成功率
表2:PushT、Reacher、OGBench-Cube和Two-Room上的短视野规划成功率。带星号的结果为作者复现。
如果只按传统的“单评估种子”(即只用一组固定的目标和随机种子来跑50个回合)来看,VIS-WM在PushT上做到98%、OGBench-Cube上77%、Two-Room上97%,确实是相当能打。但论文特别做了三颗新种子的评估。换了个评价种子后,两个模型的成功率差距就缩小了很多,很多“领先”在统计噪声范围内就不再显著了。这个现象很值得做世界模型研究的人警惕:单种子评估的结果很可能高估了模型之间的差异。
再看长视野规划。表3是在PushT上用不同目标距离步数d进行评估的结果。
表3:PushT上的长视野规划成功率
表3:PushT上的长视野规划成功率。d越大代表任务视野越长。带星号结果为作者复现。
d=25的时候VIS-WM做到98%,d=50降到62%,d=75进一步掉到21%。这个下滑幅度相当陡峭,说明长视野规划本身就是端到端潜在世界模型的短板,不管用哪种正则化,预测误差都会随步数累积,希望一步登天不现实。
更关键的实验在OOD泛化上。论文构造了六个未见过的物体形状,如图2所示。模型只在原始的“T”形上训练,然后直接去推这六种新形状。
图2:表4中使用的OOD PushObj形状。重放相同的动作会产生不同的轨迹,因为物体几何形状改变了动力学
图2:表4中使用的OOD PushObj形状。重放相同的动作会产生不同的轨迹,因为物体几何形状改变了动力学。
表4给出了这六个形状上的成功率。
表4:六个未见过的PushObj形状上的成功率
表4:六个未见过的PushObj形状上的成功率。上半部分是各目标用自己最优批次大小的结果;下半部分是匹配批次控制及VIS-WM的批次大小阶梯。
这里有个很有意思的细节:如果批次大小匹配(都是128),SIGReg的迁移效果其实更好;但当VISReg把批次加大到256或512时,分布的逼近精度提高了,OOD的成功率反而反超了。这篇论文用这个结果说明了一个道理:正则化方法在自监督学习中的灵活性优势,并不能直接迁移到世界模型的规划任务上;真正影响OOD规划表现的,是正则化对目标分布的实际逼近精度
表5还把VISReg的三个分量权重做了消融,结果同样耐人寻味。
表5:VISReg在DMC上的分量权重消融
表5:VISReg在DMC上的分量权重消融。这组结果说明VISReg在SSL中有益的灵活性,在世界模型训练中并不能带来帮助。
当形状正则项的权重λshape提高到2.0时,成功率直接从基线水平的78%崩到12%。这不是调参没调好,而是说明过度强调特征形状的分布逼近,反而可能扭曲对规划有用的潜在结构。这个结果是明确的负向结果,但论文没有回避它,反而把它当作构建VIScore的重要依据——因为单纯看正则化方法本身的优劣,并不能解释规划的成功与失败。

VIScore三维诊断:真实性、影响力与清醒度

前面铺垫了这么多,真正的重头戏来了。论文把规划成功拆解成三个必须同时满足的条件:第一,预测器要把潜在状态“滚”得足够准,准到什么程度呢?要在任务能容忍的误差范围之内。第二,不同的动作要能在潜在未来中产生足够可区分的差异,也就是动作的影响要足够大。第三,规划器不能“幻想”——不能自己虚构出一堆在模型看来挺好、但实际上根本达不到的动作。
这三个条件分别对应VIScore的三个分量:真实性(Veracity)、影响力(Influence)、清醒度(Sobriety)。三者相乘得到最终的VIScore,取值范围在0到1之间。整体公式为:
VIScore公式:真实性(erf函数)、影响力(min(m_emp/τ, 1))、清醒度(1-p̂)的乘积
其中d_tol表示任务成功容差对应的潜在距离,σ_roll表示H步开环rollout的RMS终端误差,m_emp表示潜在行为能力(latent empowerment),τ是共享的充分性阈值,p̂是规划器“幻觉率”。
下面逐个拆解。

真实性:rollout误差离“成功半径”有多远?

真实性在做的事情,是去问预测器:让你开环(open-loop)跑H步,你的最终状态误差比起任务允许的“成功半径”来说,够不够小?这里的关键不是绝对误差,而是比值d_tol/σ_roll。因为潜在空间的尺度可以随意缩放,只有把这个比值拿出来,才能在两个潜在维度不同的模型之间做公平比较。论文用erf函数把这个比值映射到0到1之间,本质上是一个有界单调变换。当然,实际误差分布不一定真是高斯分布,但论文用的是rank-based相关度(斯皮尔曼相关),所以换任何单调映射结果都一样。
这样设计的好处是:同一套绝对误差,在粗粒度导航任务里完全够用,在精密的机械臂操控任务里就是灾难。通过比值化的处理,真实性能自动适应不同任务的容差尺度。

影响力:动作能撬动多少“未来比特”?

影响力其实就是潜在行为能力(latent empowerment),它衡量的是:通过改变动作,智能体最多能让H步之后的潜在状态产生多少可区分的差异。计算方式基于动作扰动与未来状态之间的互信息,利用局部的线性-高斯近似来估计。公式为:
潜在行为能力(latent empowerment)计算公式:I(δ; z_t+H) = 1/2 log det(I + Ê_H^{-1} G Σ_a G⊤)
其中G是动作到未来状态通路的局部雅可比矩阵,Σ_a是动作扰动的协方差,Ê_H是预测器在这个视野上的残差协方差。分子上的“信号”越大、分母上的“噪声”越小,行为能力的数值就越高。
这里有一个特别值得注意的设计:原始empowerment在表6里单独用时,跨任务合并的相关性会崩塌,但VIScore的处理是把它先做饱和截断——min(m_emp/τ, 1),超过阈值τ的部分一律封顶变成1。为什么要封顶?因为行为能力是一个“够用就行”的量,不是越大越好。如图3所示,当empowerment超过某个任务对应的“膝盖点”之后,继续增加对成功率的提升非常有限。
图3:原始empowerment与规划成功率的关系。实线标记任务特定的拐点,虚线标记共享的影响力上限τ=82
图3:原始empowerment与规划成功率的关系。实线标记任务特定的拐点;虚线标记共享的影响力上限τ=82。

清醒度:规划器有没有“自嗨”?

清醒度是VIScore里最有意思的一个分量。它专门用来抓一类容易被常规指标漏掉的“隐性幻觉”。
具体做法是这样的:取来一条专家轨迹上的64个锚点动作,对每个锚点动作,用它的实际到达位置作为目标,然后让规划器在预测器内部做一次小规模搜索,看能不能找到一个“比专家动作更好”的动作——也就是让预测器的成本函数J变得更小。如果模型真的能找到这样的动作,那这个计数器就加一。计算方式为:
清醒度中幻觉率p̂的计算公式:统计搜索动作成本低于专家动作的锚点占比
这里有个微妙之处:既然专家动作真的到达了那个目标位置,那在真实环境里,不存在任何未执行的动作会比专家动作更“接近”这个目标——因为专家动作已经精确到达了。如果搜索算法在预测器里找到了更低成本的未执行动作,那就说明预测器相信了一些“幻觉轨迹”,这些轨迹在真实环境里根本走不通。这样的模型一旦被用到规划任务中,就会产生“自信满满但实际撞墙”的问题。清醒度就是1减去幻觉率。幻觉率越高,说明预测器越容易被规划器钻空子。
三个分量乘积之后,任何一个条件不满足都会把VIScore整体拉低。这种“必须同时成立”的设计,比简单的加权平均更严格,也更贴合规划成功的实际语义。

跨任务、跨方法、跨规划器的全面验证

光有指标定义还不够,一个诊断指标到底靠不靠谱,得看它跟实际规划成功率之间的相关性稳不稳定。论文设计了一套非常严谨的验证体系,把评测池分成了四层:开发池(用来选阈值)、留出检查点池(训练运行与开发池完全不相交)、留出训练方法池(换四套完全不同的世界模型方法)、留出数据集池(换一个全新的MAZE任务)。
表6是全文最核心的评估结果。
表6:在运行级划分下,与成功率的斯皮尔曼相关(任务内和合并)及校准误差
表6:在运行级划分下,与成功率的斯皮尔曼相关(任务内和合并)及校准误差。
先看开发池。在单个任务内部,VIScore和原始empowerment的表现其实非常接近(PushT上+0.80 vs +0.82,Reacher上+0.83 vs +0.86,Two-Room上都是+0.71)。但是一旦到了跨任务合并池,情况就完全不同了:empowerment的相关性直接崩到+0.40,而VIScore仍然保持+0.88。校准误差方面,VIScore是10.2个百分点,远低于empowerment的23.1和常量预测器的24.4。
这说明一个很关键的问题:empowerment的单位“纳特”(nats)在不同任务之间没有可比性。同样的数值可能在一个任务里意味着“足够用”,在另一个任务里连门槛都摸不着。VIScore通过饱和截断把它变成了充分性条件,让这个指标在不同任务之间共享一个统一的数值标尺。
再看出能力最强的部分——留出池。在33个与开发池完全无关的训练运行上,VIScore在PushT上的相关性做到了+0.84,Two-Room上+0.83,合并池+0.91,校准误差7.0个百分点,是唯一一个在所有测试场景下校准误差都低于常量预测器的指标。跨四个留出方法时,其他指标的相关性都掉到0.4以下甚至0.12,VIScore依然守着+0.75。这种稳定性说明VIScore不是“在特定数据集上调出来的”,而是真的抓住了规划成功的一般性条件。
论文还做了一组更“卷”的验证:把规划器从CEM换成其他四种采样型规划器——MPPI、iCEM、预测采样以及梯度下降式规划。结果是一致的:VIScore在所有规划器上的相关性仍然是最稳定最靠前的。这等于在说,VIScore的诊断结论不依赖于具体用哪个规划器来实现规划。
顺便一提,论文提到OGBench-Cube这个数据集之所以在合并池和校准误差中被排除,是因为它的成功率分布太窄(全部挤在一起),区分度本身不够。这个处理是合理的,也避免了把一个“已经有答案”的数据集硬塞进评估带来误导。

诊断工具的未来与开放问题

这篇论文的工作可以看作一个完整的工具型贡献:从受控的正则化干预实验出发,发现自监督学习里的经验不能直接照搬到世界模型规划里;再从规划成功的三个必要条件出发,设计出VIScore这个度量;最后用横跨任务、方法、规划器三个维度的系统评估证明它的有效性。
但也必须说清楚,VIScore定位是“诊断工具”而不是“成功率的预测回归器”。论文自己在结尾也强调:一个高分的VIScore并不意味着规划一定成功,毕竟环境奖励结构、状态覆盖率这些因素并不是VIScore能全部覆盖的。它的核心价值在于,当世界模型的规划效果不理想时,能通过三个分量的数值快速定位问题出在哪个环节——是预测误差太大(真实性低),还是动作对未来的控制力不足(影响力低),又或是预测器存在幻觉、规划器在钻空子(清醒度低)。
这种做法对做世界模型研究的人极有价值。以前模型规划失败了,只能靠试错;现在有了VIScore这个“显示器”,可以像看仪表盘一样看到模型内部气压、油量、温度。未来如果能把这三个分量的计算做得更轻量,甚至放到训练过程中实时监控,那世界模型的训练将不再是一个黑盒。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出VIScore,从真实性、影响力与清醒度三维诊断潜在世界模型规划质量,覆盖编码器、预测器与规划器。相比既有指标,VIScore与成功率的相关性稳定超过0.75,且是唯一在所有测试中校准误差低于常量拟合的诊断方法。
这篇工作最值得看的点是什么?VIScore在所有测试场景中达到最强且最稳定的Spearman相关性(≥0.75),是唯一在所有测试场景中校准误差低于常数预测器的指标
这篇工作的边界或风险在哪里?优点:1)首次提出覆盖编码器、预测器和规划器三个组件的诊断指标;2)三个因子具有可解释性,能诊断互补的失败模式;3)跨任务、跨方法、跨数据集验证了泛化性。缺点:1)不适用于无预测器的摊销规划器;2)对离散状态转换(如OGBench-Cube的抓取)不敏感;3)影响因子的饱和阈值需要跨验证选择。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把诊断指标从单一组件扩展到编码器、预测器、规划器三维乘积,并用受控正则化干预反向验证,角度新且逻辑闭环,属于工具型贡献里少见的系统化工作。

实验合理度:★★★★☆

多种子评估、运行级划分、跨方法跨规划器验证等设计都相当扎实。少量扣分在于OGBench-Cube因分布太窄被排除,而现实中遇到类似低区分度数据集时VIScore的适用性还有待观察。

学术研究价值:★★★★☆

给出了一个可复现、可扩展的评估框架,把潜在世界模型的研究从“只看成功率”拉向了“可诊断的组件质量分析”,对后续研究有实质参考意义。

稳定性:★★★☆☆

VIScore的准确性依赖任务容差d_tol和影响力阈值τ的合理标定;τ开发池选了82,论文说明55-129之间结论不变,说明有一定稳健区间,但跨更广阔任务域时是否需要重新标定需注意。

适应性以及泛化能力:★★★★☆

覆盖了四类任务、四套留出方法、五种规划器、一个全新桌面环境,在几乎所有场景中都能稳定排第一,泛化能力在同类诊断指标中相当突出。

硬件需求及成本:★★★★☆

VIScore计算不需要与环境交互,只需要在模型上做开环rollout和局部搜索,单次计算成本远低于真实规划评估。唯一较重的地方在于清醒度计算中要做小规模搜索,但整体仍属轻量级诊断工具。

复现难度:★★★★☆

方法描述清晰,三个分量的计算流程和公式都比较明确,且论文提供了代码。难点主要在于任务容差d_tol的确定需要理解各任务的物理语义。

产品化成熟度:★★★☆☆

目前更适用于世界模型研究的离线诊断和模型选择,距离直接嵌入实时控制系统的在线监控还有距离。三颗评估种子的做法在工业界成本仍偏高。

可能的问题:VIScore的清晰度分量需要专家轨迹作为锚点,在无专家数据场景下应用受限;另外论文主要验证了桌面级控制任务,在更复杂的连续控制、部分可观测场景中的有效性尚未确认。


主要参考文献

[1] Maes et al. LeWorldModel: Simple yet effective joint-embedding predictive world models. 2026.
[2] Balestriero & LeCun. SI-GReg: covariance-based regularization for joint-embedding architectures. 2025.
[3] Wu et al. VISReg: factorized center-scale-shape regularization. 2026.
[4] Wang et al. Temporal world model with straightness metrics. 2026.
[5] Zhou et al. DINO-WM: world models on pretrained visual features. 2025.
[6] Sobal et al. PLDM: goal-conditioned latent dynamics models. 2025.
[7] Klyubin et al. Empowerment: universal intrinsic control objective. 2005.
[8] Tassa et al. DeepMind Control Suite. 2018.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
世界模型规划火得烫手,可能不能打不能光看成功率的冷冰冰数字。VIScore给大家递上一把尺子:真实性、影响力、清醒度,三把尺子量出规划成色。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 世界模型+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。