← 返回 PaperDaily
视觉与图像
Yann LeCun团队新作AdaJEPA:世界模型不再冻结,1步就能自适应
世界模型最怕的不是不会算,而是算着算着就跟现实脱节。AdaJEPA把自适应塞进MPC闭环里,用一次梯度步就能边规划边纠偏,思路很朴素,但很实用。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
世界模型最怕的不是不会算,而是算着算着就跟现实脱节。AdaJEPA把自适应塞进MPC闭环里,用一次梯度步就能边规划边纠偏,思路很朴素,但很实用。
原论文信息如下:
世界模型在测试时“冻结”的困境
世界模型这东西,训练时看着挺聪明,一到测试时却常常像“学会了背题,没学会做题”。原因很简单:规划依赖模型,模型又依赖环境。只要现实环境和训练数据稍微不一样,比如光照暗一点、噪声大一点、物体形状换一下、物理参数飘一下,模型的预测就可能开始跑偏。MPC(Model Predictive Control,模型预测控制)再聪明,也只能拿着一份“过期地图”去导航,最后经常把动作优化到错误方向上。
AdaJEPA这篇论文抓住的就是这个痛点:世界模型不该在测试时装死。既然智能体已经在环境里行动了,那每次执行动作后得到的新观察,本身就是最好的自监督信号。与其让模型一路“冻”到任务结束,不如让它一边规划、一边执行、一边适应,把预测误差现场修一修。这个思路听起来朴素,但落地后非常实用,尤其适合真实世界里那些分布总会漂移的任务。
这篇工作来自纽约大学的 Agentic Learning AI Lab。这个实验室长期围绕“如何让智能体从视觉经验中学习、持续适应并创造新概念”做文章,AdaJEPA 正好是这个方向里很典型的一步:不是把模型训得更大,而是让模型在部署时继续学。
AdaJEPA:让世界模型学会“边做边学”
先把术语说人话。JEPA 是 Joint-Embedding Predictive Architecture,中文可以理解为联合嵌入预测架构。它不是直接预测像素,而是把观测压成潜在表示,在潜在空间里预测未来状态。这样做的好处很现实:比直接生成图像轻,通常也更适合规划。
AdaJEPA 的新意不在“又造了一个世界模型”,而在于把测试时自适应塞进了 MPC 闭环里。传统做法是:训练完,模型冻结,测试时只负责滚动预测。AdaJEPA 则是:先规划,再执行第一步,再拿新观测更新模型,再重新规划。这个循环每转一圈,模型就更贴近当前环境一点。
这里的关键是“自监督”。测试时并没有额外专家标注,也没有奖励标签,更没有再收集一大坨新数据。智能体刚执行完动作,就已经拿到了下一帧观察 ot+1,这就足够拿来做适应信号。说白了,环境自己给答案,模型自己改错,省钱又省事。
AdaJEPA 还很在意工程成本。它不是每次都大动干戈,而是通常只更新一小部分参数,很多实验里甚至只做一次梯度步。这点很重要,因为测试时自适应最怕变成“理论上很美,线上一跑就卡”。AdaJEPA 的设计显然是冲着可用性去的。
三步走:规划、执行、适应
AdaJEPA 的核心流程可以拆成三件事。第一步是规划:用当前世界模型在潜在空间里模拟未来,优化一段动作序列。第二步是执行:只把这段动作里的第一小段真正扔到环境里。第三步是适应:把刚刚发生的真实转移拿来训练模型,再带着“修正后的脑子”重新规划。这个闭环和人开车很像,眼睛看路、手打方向、发现偏了再微调,而不是一路闭眼冲到底。
规划时,MPC 会在一个有限视野里搜索动作序列,目标是让预测到的潜在状态尽量接近目标状态。说白了就是:未来几步怎么走,才能离终点更近。AdaJEPA 用的不是“拍脑袋式动作选择”,而是基于模型 roll-out 的优化,这也是世界模型方法最经典的味道。
适应阶段更像是“在线纠错”。AdaJEPA 会把最近执行过的转移放进一个小缓冲区 B,然后用同样的潜在预测目标做一次轻量更新。为了防止表示塌掉,论文默认使用 stop-gradient,也就是让目标分支不回传梯度。这个技巧并不新,但放在测试时自适应里很实用,属于“老办法,解决新问题”。
实验揭秘:从形状变换到物理引擎,全覆盖提升
实验部分的结论其实很直接:AdaJEPA 不是只在某一种小场景里灵,而是在多种分布偏移里都能把成功率往上抬。论文主要测了两类环境:PushT 和 PointMaze。前者更像视觉和接触动力学混合问题,后者更像导航和物理变化问题,组合起来刚好覆盖了世界模型最常见的两种翻车方式。
PushT 上,论文专门设计了形状变化和视觉变化。形状变化就是把被推动的块从训练时见过的形状,换成没见过的几何外形;视觉变化则包括模糊、椒盐噪声、变暗,以及颜色替换。PointMaze 上则测试动力学变化和布局变化,前者改质量和阻尼,后者改迷宫结构。换句话说,AdaJEPA 面对的不是“同一道题换个说法”,而是“题干、图像、物理规则一起变”。
从结果看,最有意思的一点是:在分布内,AdaJEPA 既可能明显提升,也可能几乎不伤原本已经很强的基线;在分布外,它则常常能把掉下去的成功率重新拉回来。这个特性很像“补课型选手”:基础好的时候不添乱,基础差的时候能救场。对工程系统来说,这比单纯追求某个极限指标更重要,因为真实部署最怕的是“有时神,有时崩”。
论文还做了一个很关键的工程验证:适应带来的额外延迟几乎可以忽略。原因也不复杂——只更新少量参数,而且每次只走一步梯度。对在线规划来说,这种“几乎白送”的修正非常值钱,因为它把测试时自适应从“学术上可行”往“系统上可用”推了一大步。
更有意思的是,AdaJEPA 不是只对一种骨干模型有效。论文把它放到不同 JEPA 世界模型实现上,结果依然稳。这个结论说明,AdaJEPA 更像一种通用的测试时修正框架,而不是某个特定网络结构的巧合产物。换句话说,方法的价值不只是“这次跑赢了”,而是“以后别的世界模型也能照着抄”。
数据规模实验也很实在。结论并不是“有了自适应就不用数据了”,而是更多更丰富的数据仍然重要,但测试时自适应能补上训练覆盖不足的坑。这点非常符合真实系统:离线训练负责打底,在线适应负责纠偏,两者不是替代关系,而是互补关系。
这部分实验最能看出作者的工程思维:不是把适应做成一个复杂到飞起的系统,而是尽量把它压缩成“默认就能跑”的配置。学习率、步数、缓冲区都做了消融,最后给出的信号很清楚:轻量适应已经足够强,过度调参反而未必划算。这对落地来说很友好。
一张图看懂AdaJEPA的“威力”
如果把这篇论文浓缩成一句话,那就是:世界模型别只会“预测”,还得会“纠错”。AdaJEPA 最有价值的地方,不是某个单点指标,而是把“预测—行动—反馈—更新”这条链条闭合起来了。这个闭环一旦成立,世界模型就不再只是离线训练出来的静态工具,而是能在部署中持续校准的动态系统。
这张图背后的信息很关键:即使测试时出现了没见过的颜色、噪声或者形状,AdaJEPA 也不是胡乱重建,而是把观测拉回到训练中学到的潜在流形附近。直白点说,它不是“看见啥都信”,而是“先根据经验把世界重新理解一遍,再做决定”。这比纯粹的冻结模型更接近人类的适应方式。
总结与展望:持续学习,而非一成不变
AdaJEPA 这篇论文的态度很明确:世界模型不能只在训练集上聪明,到了部署环境就装睡。它把测试时自适应和 MPC 绑在一起,让模型在行动中不断修正自己。对于机器人、导航、交互式控制这类任务,这种思路比单次离线训练更接近真实需求。
不过,这种方法也不是万能药。论文自己也承认,如果测试环境需要的特征在预训练里根本没见过,轻量适应只能补一点,不能凭空造知识。也就是说,AdaJEPA 更像是把已有能力用得更稳,而不是从零发明新能力。未来如果能进一步结合持续学习、主动采样或者更强的不变性约束,这条路线会更完整。
对普通从业者来说,这篇论文最大的启发其实很朴素:别把模型当成一次性产品。如果系统会遇到变化,训练阶段就该考虑部署阶段的反馈回路。对学生来说,这也是一个很好的研究范式:不是一味堆更大模型,而是思考“模型如何在使用中变得更好”。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“世界模型在测试时容易失真,导致规划失效”的问题。AdaJEPA 的办法不是重新训练,而是在 MPC 闭环里利用新观察做轻量自适应,让模型边执行边校准。
文中的 stop-gradient 和 replay buffer 分别是什么意思?stop-gradient 的作用是让目标分支不回传梯度,防止在线更新把表示训塌;replay buffer 则是保存最近的转移样本,给适应阶段提供稳定的小批量自监督信号。简单说,一个负责“别乱学”,一个负责“拿什么学”。
为什么只做一次梯度步也能有效?因为适应目标和预训练目标是同一套潜在预测损失,更新对象又通常只是一小部分参数,所以一次小步修正就能把当前环境里的局部偏差拉回来。它不是靠“大力出奇迹”,而是靠“及时纠偏”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把测试时自适应嵌进 MPC 闭环里,思路不花哨,但切中了世界模型最真实的痛点:预测会漂,规划会跟着漂。
实验合理度:★★★★☆
PushT 和 PointMaze 的分布偏移设计比较完整,既有视觉扰动,也有动力学和布局变化,能看出方法不是只在单一场景里碰运气。
学术研究价值:★★★★☆
这篇工作把测试时训练、世界模型和控制闭环连起来了,对后续做自适应智能体、在线校准和持续学习都很有启发。
稳定性:★★★☆☆
轻量更新很加分,但方法仍依赖预训练覆盖;遇到训练中完全没见过的关键因素时,适应只能缓解,不能凭空补知识。
适应性以及泛化能力:★★★★☆
对形状、视觉、动力学、布局多类偏移都有效,泛化面不窄;但最强效果仍建立在预训练表征有一定覆盖的前提上。
硬件需求及成本:★★★★☆
只更新少量参数、每步一次梯度更新,额外延迟很小,工程成本比大多数在线学习方案友好得多。
复现难度:★★★☆☆
思路不复杂,但要稳定复现闭环规划、不同偏移设置和多种适应策略,仍然需要比较完整的环境与实现细节。
产品化成熟度:★★★☆☆
在仿真控制和部分具备在线反馈的任务里很有希望,但要进真实系统,还得继续验证噪声、延迟、异常动作和安全约束。
可能的问题:方法依赖预训练覆盖,遇到强分布外场景时只能局部修正;同时在线更新虽轻量,但在安全敏感任务里仍需额外约束。
主要参考文献
Wang, Y., Bounoua, O., LeCun, Y., & Ren, M. AdaJEPA: An Adaptive Latent World Model. arXiv:2606.32026, 2026.
项目主页:https://agenticlearning.ai/adajepa
原文链接:https://arxiv.org/pdf/2606.32026v1.pdf

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

