← 返回 PaperDaily
大模型与智能体
LLM竟是世界模型特例?Meta论文拆出连续谱系
这篇文章最有意思的地方,不是又在给LLM贴新标签,而是把“token模型”和“世界模型”之间那道墙直接拆成了坡道。它把争论从“是不是”拉回到“走到哪一步、代价是什么”。
龙哥读论文
发布于 2026-08-14 09:10:52
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇文章最有意思的地方,不是又在给LLM贴新标签,而是把“token模型”和“世界模型”之间那道墙直接拆成了坡道。它把争论从“是不是”拉回到“走到哪一步、代价是什么”。
原论文信息如下:
真正有意思的地方,不是又多了一个“LLM 很强”的故事,而是这篇论文把争论里最容易打架的那堵墙,拆成了一条坡道:LLM 不是世界模型的对立面,而是世界模型家族里一个非常受限、但确实成立的特例 。这一下,很多原本吵成“二选一”的问题,突然变成了“中间到底还有几站、每一站要付什么代价”。
大型语言模型竟是世界模型的特例?
先把话说人话:世界模型 不是某一种神秘架构,而是一类“能记住当前状态、还能预测下一步会怎样”的模型。它的核心任务很朴素——先在脑子里“演一遍”,再决定要不要真的行动。机器人、自动驾驶、游戏规划,背后都离不开这个思路。
这篇论文的第一刀,切得很准:LLM 不是“不是世界模型”,而是世界模型里最极端、最受限的那一支 。如果把世界模型写成一个四元组 (S, A, T, ρ0) ,分别表示状态空间、动作空间、状态转移函数和初始状态分布,那么 LLM 也能硬塞进去,而且塞得还挺严丝合缝。
这里的关键不是“LLM 会不会思考”,而是它在形式上到底扮演了什么角色。论文把词表 V 当成状态集合,把“选下一个 token”当成唯一动作,把“把 token 接到序列后面”当成转移函数。这样一来,LLM 就成了一个特殊世界模型:状态极其离散,动作极其微小,转移极其简单 。它不像传统世界模型那样直接模拟真实环境,但它确实是在一个状态空间里滚动更新。
这篇论文还顺手把争论里的“含糊地带”补上了:LLM 的世界模型并不在输出 token 本身,而在隐藏状态 里。token 只是接口,真正保存“世界状态”的,是 transformer 内部那些激活值。这个观点并不空口无凭,论文引用了 OthelloGPT、棋类语言模型、以及位置与时间编码等工作,说明即使只训练 next-token prediction(NTP,下一个 token 预测),模型内部也会长出可线性读出的世界状态表示。
这张表最值得记住的,不是“LLM 有五条限制”这种教科书式总结,而是最后两条:训练监督 和层架构 。前者让 LLM 能吃互联网海量文本,不需要传感器、不需要环境标注、不需要机器人平台;后者则是 transformer 和离散 token 目标一起长出来的,彼此非常合拍。换句话说,LLM 的成功不是偶然,是“数据便宜 + 架构对口”这对黄金搭档一起发力的结果。
论文在这里其实做了一件挺聪明的事:它没有把 LLM 和世界模型摆成“谁淘汰谁”的关系,而是把它们放进同一张家谱里。这样一来,争论立刻从“是不是”变成“限制放松到哪一步,系统会从文本生成,逐渐变成真正的世界建模 ”。
从下一个token到未来状态:一个连续的进化谱系
论文第二个核心观点更像是“路线图”而不是“判决书”:从 NTP 到 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构),中间不是断崖,而是一条连续谱。每往右走一步,就放松一个 LLM 约束;每走一步,也会失去一点 LLM 最值钱的东西。
这个谱系里最先出现的是 MTP ,英文全称是 Multi-Token Prediction ,中文是“多 token 预测”。它不再只盯着下一个 token,而是一次预测未来多个 token。听起来像是“让模型多看两步”,但实际效果并不只是多说几句那么简单。论文引用的工作显示,这种改法能提升推理和代码能力,而且代价很低:数据还是互联网文本,架构还是 transformer,只是多了几个输出头。
再往右一步,是 Future Summary ,也就是“未来摘要预测”。这一步开始有点像把“预测文字”升级成“预测意思”。模型不再只学未来 token 的表面形式,而是学一个压缩后的未来表示,比如词袋或者某种摘要嵌入。这样做的好处是,预测目标终于开始脱离纯 token 空间,模型被迫去抓更高层的语义结构,而不是只背短期续写习惯。
再往后是 Next-Latent ,即“下一潜变量预测”。这一步更狠:预测对象不再是 token,也不再是摘要,而是模型自己的下一时刻隐藏状态。说白了,就是让模型去猜“自己接下来会怎么想”。这类方法已经很接近世界模型的味道了,因为它开始在连续状态空间里做预测,而不是在离散符号里打转。
这张图的意思很直白:即便输入只有走子 token,模型内部也能把整个棋盘状态“脑补”出来,而且还不是模糊猜测,而是可以被线性读出的表示。论文借这个例子想证明的不是“LLM 会下棋”,而是更重要的一点:世界模型早就在 LLM 的隐藏层里偷偷长出来了 ,只是外面那层 token 接口看起来像在背答案。
最后才轮到 JEPA 。它的全称是 Joint Embedding Predictive Architecture ,中文是“联合嵌入预测架构”。这类方法把未来预测放进连续潜空间里,通常还要结合动作条件,目标不是补全文本,而是预测状态如何随行动演化。论文的判断很清楚:JEPA 不是凭空冒出来的新宗教,而是这条连续谱的最远端。
这张图特别适合拿来纠正一个常见误解:很多人把 CoT 当成“模型突然学会了推理”,其实更稳妥的说法是,它让模型在 token 层面多走了几步,从而拉长了内部规划过程,但状态类型仍然是 token 序列。也就是说,它不是跳到了另一个宇宙,只是在同一条路上多绕了几个弯。
数据与架构的双重挑战:离真正的世界模型还有多远?
论文最冷静、也最有工程味的一段,是把“世界模型难不难”拆成了两个现实问题:数据从哪来,架构怎么配 。这俩问题看起来朴素,实际上比口号难多了。
先说数据。NTP、MTP、Future Summary,甚至一部分 Next-Latent,都还能继续吃互联网文本,因为监督信号可以来自文本本身,或者来自模型内部状态的自监督目标。这个阶段很舒服:数据大、便宜、标准化,训练管线也成熟。可一旦走到 JEPA 那边,情况就变了。真正的动作条件世界模型,需要的是“观察—动作—下一观察”的配对数据,而不是纯文本续写。机器人、驾驶、游戏引擎、视频环境,这些数据都更稀缺、更贵、更难对齐。
所以论文说得很直接:真正的“数据断崖”不是从 LLM 到世界模型的名字变化,而是从海量文本跳到带动作标注的环境数据 。这个断崖一旦跨过去,训练难度、采集成本、环境设计复杂度都会明显上升。很多人嘴上说“往世界模型走”,真到工程环节,立刻会被数据预算劝退。
再说架构。transformer 之所以在 LLM 上成功,不只是因为它强,而是因为它和离散 token 任务是共同进化 出来的。自注意力、位置编码、teacher forcing、softmax 输出头,这一整套组合拳,都是为离散序列预测精心搭出来的。可一旦目标变成连续状态预测,原来的“舒适区”就没那么舒服了。
论文提到一个很现实的现象:现在很多视觉或视频方向的 transformer,往往靠“重新离散化”继续工作,比如把图像切成 patch,把视频帧当 token。这个做法能跑,但也说明架构本身还没完全摆脱 token 思维。换句话说,transformer 目前像一个很能干的老员工:文本岗位干得最顺,换到连续世界建模岗位,也能上,但总得先适配一下工位。
这就引出一个很工程化的问题:如果未来真要做强世界模型,究竟是先补数据,还是先换架构? 论文的态度很谨慎——两个都得补,而且很可能要同时补。更好的架构能提升自监督效率,减少对动作标注的依赖;更好的数据管线又能让新架构真正学到长期动态。单独押一边,容易翻车。
再评Yann LeCun:LLM的潜力远不止于文本
这部分其实是论文最有火药味、但也最克制的地方。它没有直接“打脸”LeCun,而是把他的观点拆成两句,再分别讨论:LLM 只会预测 token,所以不能规划;JEPA 才是正确方向 。论文的回应是:这两句话都太二元了。
第一点,论文认为“token 不是状态”的批评,批评错了对象。token 确实只是接口,但状态并不一定非得显式写在输出上。OthelloGPT 这类工作已经说明,模型可以在内部激活里形成完整的状态表示。也就是说,外部看起来在续写,内部其实在维护一个世界状态 。这和“只会背字面内容”完全不是一回事。
第二点,CoT 和 extended thinking 这类方法,说明 LLM 已经在不改架构的情况下,先把“规划时长”往前推了一段。它们不是 JEPA,但也绝不是“纯文本玩具”。如果把规划能力看成一个维度,那么 token 级推理、长链思维、未来摘要、下一潜变量预测,都是这条连续路上的不同位置。
这也是论文最值得肯定的地方:它没有把“LLM vs 世界模型”写成一场宗教战争,而是把它改写成一张演化地图 。地图上有近路,也有死胡同;有低成本升级,也有必须换底座的拐点。比起简单地说“LLM 不行”或者“JEPA 必胜”,这种说法更接近真实研究现场。
研究前沿:一个亟待理论创新与工程突破的方向
如果把这篇论文压缩成一句话,那就是:从 token 到 state,不是换赛道,而是把赛道铺宽 。它真正留下的,不是一个新模型,而是一组更有操作性的研究问题。
第一个问题是,连续状态预测到底需要什么样的监督信号。纯文本已经证明了自己非常强,但离动作条件环境还有距离。第二个问题是,transformer 是否真能在连续世界里继续扛大梁,还是必须出现一种更适合连续时序的“新原语”。论文没有假装已经解决,而是明确把它们列成开放问题,这一点反而更靠谱。
从工程角度看,最现实的路径大概率不是一脚踹翻 LLM,而是沿着这条谱系逐步演进:先把多 token 预测、未来摘要、下一潜变量这些中间站点跑稳,再考虑更强的动作条件世界建模。这样做的好处很实际——既保留了大规模自监督数据的红利,也能逐步逼近真正的规划与模拟能力。
如果说这篇论文还有一点“遗憾”,那就是它本身是 opinion paper,更多是在搭框架、摆逻辑,而不是拿一组新实验把争论彻底封死。可这并不算缺点,因为研究前沿很多时候最缺的不是又一个跑分,而是一个能把散点工作串起来的解释框架 。这篇文章做到了。
龙迷三问
这篇论文到底解决了什么问题? 它没有发明新模型,而是解决了一个更基础的认知问题:LLM 和世界模型到底是什么关系。论文给出的答案是,LLM 可以形式化地嵌入世界模型框架,而且从 NTP 到 JEPA 之间存在连续谱,不是非黑即白。
MTP、Future Summary、Next-Latent 分别是什么意思? MTP 是 Multi-Token Prediction,多 token 预测;Future Summary 是未来摘要预测,预测压缩后的未来表示;Next-Latent 是下一潜变量预测,直接预测模型自己的连续隐藏状态。三者都比纯 next-token 更接近世界模型。
为什么论文一直强调“数据”和“架构”两个问题? 因为从 LLM 走向真正的世界模型,最难的不是换个名字,而是数据来源和模型底座同时变了。文本数据便宜且海量,动作条件环境数据稀缺且昂贵;transformer 很适合离散 token,但对连续状态预测并不一定天然匹配。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。创新点不在新模型,而在于把分散的观点和中间路线统一进一张连续谱,框架感很强。
实验合理度: ★★★☆☆。这是观点论文,不靠新实验取胜;论证主要依赖已有工作与形式化推导,逻辑是顺的,但不是实证型“硬锤”。
学术研究价值: ★★★★☆。对理解 LLM、世界模型、JEPA 及中间方法很有启发,尤其适合作为后续研究的概念地图。
稳定性: ★★★☆☆。作为理论框架很稳,但落地到真实连续环境时,数据和架构两端都还没完全打通。
适应性以及泛化能力: ★★★★☆。谱系视角本身适用面很广,能解释不少现有工作,但具体方法仍要看任务。
硬件需求及成本: ★★★★☆。论文讨论的是路线,不是重模型;若沿中间站点演进,成本仍可控,但越往 JEPA 端越吃数据和系统。
复现难度: ★★★★☆。核心是概念与已有工作串联,不需要特殊代码;但论文本身没有给出完整实验管线。
产品化成熟度: ★★★☆☆。中间谱系上的方法有产品潜力,真正的动作条件世界模型仍需更多环境、数据和工程验证。
可能的问题: 框架讲得很顺,但对“何时必须换架构”仍偏开放;更像地图,不是终点答案。
主要参考文献
Paul Dubois. From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond. arXiv, 2026. https://arxiv.org/pdf/2606.28127v1.pdf
Yann LeCun. A Path Towards Autonomous Machine Intelligence. OpenReview preprint, 2022.
David Ha, Jürgen Schmidhuber. World Models, 2018.
Fabian Gloeckle et al. Better & Faster Large Language Models via Multi-Token Prediction, 2024.
Adrien Bardes et al. V-JEPA 2: Self-supervised video models enable understanding, prediction, and planning, 2025.
Kenneth Li et al. Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这篇讲的是“LLM和世界模型到底谁更像谁”,群里正适合继续掰扯:是继续堆token,还是该往状态里走一步。