← 返回 PaperDaily 视觉与图像

复旦等提出ICWM:先探一探再控制

这篇论文把机器人“换视角就失忆”的老毛病,改写成一个系统辨识问题:先随机探一探,再把这段互动当上下文喂给模型。简单粗暴,但很对路,仿真和实机都给出了不错的增益。

复旦等提出ICWM:先探一探再控制
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文把机器人“换视角就失忆”的老毛病,改写成一个系统辨识问题:先随机探一探,再把这段互动当上下文喂给模型。简单粗暴,但很对路,仿真和实机都给出了不错的增益。


原论文信息如下:
论文标题:
In-Context World Modeling for Robotic Control
发表日期:
2026年06月
发表单位:
Fudan University; Shanghai Innovation Institute; Tongji University
原文链接:
https://arxiv.org/pdf/2606.26025v1.pdf

机器人也懂“先验身法”:如何零参数适应新环境

人类第一次拿到陌生遥控器,通常不会直接开干,而是先乱按两下,看看按钮和反应之间到底是什么关系。机器人这篇论文干的事,和这个动作几乎一模一样:先探一探,再办正事。区别在于,它不是靠人工教,而是把这段“试探期”塞进模型的上下文里,让模型自己悟出当前系统到底长啥样。
封面
图1:ICWM 的核心直觉。机器人先用自发探索收集“系统线索”,再根据这段上下文推断当前环境的动力学与几何关系。
这篇论文最有意思的地方,不是“又做了一个更大的模型”,而是把机器人适应新环境这件事,重新定义成了“系统辨识”问题。思路不花哨,但很顺手。
为了让后文不至于像术语轰炸机,先把一个关键词说清楚:VLAVision-Language-Action,中文可理解为“视觉-语言-动作模型”,也就是输入图像和语言指令,直接输出机器人动作的模型。它们很强,但常常有个小毛病:见过的环境很会,没见过的环境就开始发呆

标准VLA模型的“死穴”:为什么换个视角就“失忆”?

论文先点出了一个很现实的问题:大多数 VLA 模型默认训练和部署时的系统配置是固定的,比如摄像头视角、机械臂安装位置、末端执行器形态等。训练时它们把这些差异“揉进参数里”,于是到了新环境,模型就像突然换了个遥控器,脑子里只有一句话:这按钮到底管啥?
问题的根子不在“不会做任务”,而在“没认出当前系统”。作者把它拆成一个更本质的说法:标准 VLA 学的是 观察 → 动作 的静态映射,但真正需要的是先知道 当前系统配置 ψ,再决定怎么动。这里的 ψ 不是神秘代号,指的就是那些会影响控制关系的系统变量,比如相机角度、机械臂几何结构、安装偏移等。
图2:ICWM 训练与推理流程总览
图2:ICWM 的训练与推理流程。训练时把“任务无关的交互片段”前置为上下文;推理时先随机探测环境,再用这段上下文去指导后续动作生成。
这类问题为什么难?因为单张图往往不够。相同的桌面、相同的物体,在不同视角下看起来就像“同一个人换了三套妆造”。模型如果只盯着当前画面,很容易把“左边”误认为“前面”,把“靠近”误认为“已经碰到了”。于是,视角一变,动作就开始飘,抓取点偏了,夹爪提前闭合了,整套操作像被风吹歪的多米诺骨牌。

人类直觉的启示:新遥控器该怎么用?探一探就知道了!

作者的灵感其实很朴素:人类面对陌生控制器时,第一反应不是背说明书,而是先做几次无害试探,观察反馈,建立“操作—结果”的脑内地图。这个过程本质上就是系统辨识:不是先问“要完成什么任务”,而是先问“这个系统到底怎么工作”。
这里顺手解释一个常见概念:上下文学习,英文是 In-Context Learning, ICL。传统 ICL 常见于大语言模型,意思是模型不改参数,只靠上下文里的示例“临场学会”怎么回答。ICWM 的脑洞在于:上下文不再用来告诉模型“做什么”,而是告诉模型“这个世界怎么转”
图16:随机交互片段的起始帧与结束帧
图16:随机交互片段的起始帧与结束帧。无论仿真还是真机,ICWM 都先收集这类“试探性动作—视觉反馈”片段,再把它们当作系统上下文。
这就带来一个很实用的好处:不需要任务演示,不需要参数更新,不需要人工校准。机器人在正式执行任务前,先做几次随机但安全的探测动作,记录“我动了什么、画面怎么变了”,然后把这些片段前置给模型。模型读完这段上下文后,等于临时拿到了当前环境的“操作说明书”,再去执行抓取、放置、堆叠等任务。

ICWM的亮相:把“系统辨识”玩成“上下文学习”

ICWM 的核心可以概括成一句话:把系统配置识别,改写成上下文推理。它并没有额外造一个专门的“世界模型网络”,而是复用原来的 VLA 主干,让模型在读上下文时自动抽取出当前系统的隐含状态。这个设计很省事,也很符合工程直觉:既然模型本来就擅长读长序列,那就让它先读一段“环境自述”,再开始干活。
论文里这个隐藏状态记作 Ψ(T),其中 T 是一段交互上下文。这里的 T 不是普通文本,而是由多段 起始图像、动作、结束图像 组成的片段。它们的作用不是示范任务,而是暴露系统动力学:同样的动作,在不同视角、不同机构形态下会产生不同视觉反馈;模型只要看懂这种差异,就能反推出当前配置。
图13:真实机器人实验平台
图13:真实机器人实验平台。实验使用 6 自由度 UR5e 机械臂与 12 个相机视角,专门拿来测试“换个视角还会不会干活”。
训练阶段也很讲究:作者把来自不同系统配置的交互片段拼到训练样本前面,让模型在学习任务动作时,同时学习“如何从上下文里识别配置”。这样一来,模型不是死记某个固定相机角度,而是在训练中逐渐形成一种能力:先从交互中恢复世界,再在这个世界里做动作
推理阶段更直接:机器人先做 N 次随机探测,收集上下文,再把上下文和当前任务指令一起送入模型。因为 Ψ 和主干共享参数,所以实现上并不需要额外堆一套大而全的世界模型,代价主要就是多了一点上下文 token。说白了,模型不是“更笨了”,而是“先看说明书再动手”了。
论文还给出了一个很关键的判断:如果上下文是错的,模型表现会比没有上下文还差。这一点很妙,说明模型并不是把上下文当装饰品,而是真的在利用它做系统识别。也就是说,ICWM 不是“多喂点信息就变强”的朴素加法,而是确实学会了“读懂环境”。

模拟与实机双验:ICWM是如何“吊打”一众基线的?

实验设计挺有说服力:一边是 LIBERO 仿真基准,专门测跨视角泛化;另一边是真机 UR5e 平台,直接看换相机视角后还能不能稳住。这里的关键词是 OOD,即 Out-of-Distribution,分布外,意思是测试时遇到训练没见过的视角或配置。
图11:训练与测试视角分布示意。训练只覆盖 8 个角度,测试则故意挑 6 个没见过的角度,专门考验模型的视角外推能力。
图12:仿真中成功轨迹可视化
图12:仿真中成功轨迹可视化。利用交互前缀消除视角歧义后,模型能更稳定地完成抓取和多阶段任务。
先看仿真结果。ICWM 在 LIBERO 的已见视角和未见视角上都优于基线,尤其是 OOD 视角提升明显。论文里最关键的结论之一是:单纯增加多视角训练,并不能彻底解决几何外推问题。而 ICWM 通过测试时自发探测,把“换视角就失忆”的问题补上了。
图4:LIBERO 上已见与未见视角成功率
图4:LIBERO 上已见视角与未见视角的成功率。ICWM 在两类视角上都更稳,尤其在未见视角上提升更明显。
再看真机。UR5e 平台上,标准 VLA 在视角变化后成功率掉得很厉害,而 ICWM 仍能保持可用的操作精度。这个结果的意义不只是“分数更高”,而是说明这套方法真的抓住了机器人部署中的痛点:新环境不是换个参数就能蒙过去的,得先认清自己站在哪儿
图5:真实机器人上不同视角的评估结果
图5:真实机器人平台评估。ICWM 在新视角下明显优于多视角基线,说明它不是只会在仿真里耍帅。
图6:定性对比
图6:定性对比。没有 ICWM 时,常见问题是位置偏移和夹爪过早闭合;加上 ICWM 后,动作更贴合当前视角下的真实几何关系。
更有意思的是,ICWM 不只对摄像头视角变化有效。论文还测试了语义场景变化和机械形态变化,比如桌面纹理变了、障碍物变了,甚至给机械臂末端加了刚性垫片,改变运动学关系。结果显示,ICWM 依然保持优势,说明它学到的不是“某个固定视角的死记硬背”,而是更通用的系统映射。
图8:语义变化与形态变化鲁棒性
图8:面对语义扰动和机械形态变化时,ICWM 仍能保持性能优势。
图9:WindowX 形态泛化
图9:WindowX 平台上的形态泛化。随着连杆长度变化,ICWM 比基线更能扛住运动学偏移。
还有一个很实用的工程点:推理开销并没有夸张到离谱。论文测了不同上下文长度下的延迟,ICWM 比基线慢一点,但依然处在可接受范围;更重要的是,作者提到可以用 KV 缓存把静态上下文预计算,进一步把成本压回接近基线的水平。换句话说,它不是“为了聪明把机器人搞到卡顿”,而是能在现实系统里落地的那种聪明。
图10:不同设置下的推理时间对比
图10:不同设置下的推理时间对比。上下文变长会增加延迟,但通过缓存可以把额外开销降下来。

“上下文”到底贡献了啥?深度剖析与实验验证

论文最值得细看的,是它不是只报一个总分,而是认真拆了上下文到底在起什么作用。作者做了几组消融:去掉动作、去掉图像、去掉整个上下文,甚至故意喂错上下文。结果很清楚:图像和动作必须成对出现,因为它们共同构成了“动作—反馈”的系统线索。
表1:交互上下文消融实验
表1:交互上下文消融实验。去掉任一组成部分都会掉点,其中去掉图像的损失最大,说明视觉反馈是系统辨识的核心证据。
这组结果有个很关键的细节:错误上下文甚至比没有上下文更糟。这说明模型不是把上下文当噪声自动忽略,而是真的会被带偏。也因此,ICWM 证明的不是“多给点上下文总会更好”,而是“上下文必须和当前系统对得上号”。这就很像人类试遥控器:如果你拿的是电视遥控器却拿来开空调,按得再认真也只会收获沉默。
作者还验证了一个容易被忽略的问题:这种能力是不是模型“顺手学会”的?结果不是。若训练时没有专门的上下文监督,只是普通的行为克隆,前面塞再多交互片段也没用,性能会几乎崩掉。这个结论挺重要,说明 ICWM 不是“语言模型天生会读上下文”的简单移植,而是需要有意识地把训练目标设计成“从上下文里恢复系统状态”。
图7:Ψ(T) 的 t-SNE 可视化
图7:Ψ(T) 的 t-SNE 可视化。不同视角的表示形成了清晰簇状结构,说明模型学到的上下文表征确实带有可分辨的系统信息。
为了进一步证明这不是“看起来像”,作者把 Ψ(T) 做了 t-SNE 可视化。结果显示,同一视角的表示聚得很紧,不同视角之间分得比较开。这个现象很像给每种系统配置都留下了自己的“指纹”,模型虽然没显式告诉你 ψ 是多少,但已经能从上下文里把它大致摸出来了。
表2:不同探测策略下的成功率
表2:不同探测策略下的成功率。随机探测、只动平面、只动高度、只动姿态都能带来收益,说明关键不是某一种神奇动作,而是“让系统暴露出足够多的反馈”。
探测策略这一块也挺有意思。作者试了随机、只动 XY 平面、只动 Z 轴、只改末端姿态等几种方式,发现都比纯基线更好,但没有哪一种在所有视角下都绝对碾压。这个结论很符合直觉:不同方向的动作会暴露不同维度的系统信息,模型只要能接收到足够丰富的反馈,就有机会把当前配置拼出来。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是机器人在新视角、新形态、新配置下容易失效的问题。作者认为根因不是任务本身太难,而是模型没先识别当前系统,所以提出先做自发探测,再用上下文恢复系统配置。

Ψ(T) 是什么意思?Ψ(T) 可以理解成“从交互上下文里抽出来的系统表示”。T 是机器人试探动作与视觉反馈组成的片段,Ψ(T) 则是模型从这些片段中推断出的当前系统动力学信息,像相机角度、机械结构偏移这些都可能被编码进去。

ICWM 和普通上下文学习有什么区别?普通上下文学习通常拿示例告诉模型“要做什么”,而 ICWM 让上下文告诉模型“系统怎么工作”。前者偏行为模仿,后者偏系统辨识;前者像看题做题,后者像先摸清题目是哪个老师出的。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把机器人适应新环境重新定义为“测试时系统辨识”,思路新,而且和上下文学习结合得很自然。

实验合理度:★★★★☆。仿真、真机、消融、探测策略、分布外泛化都安排上了,证据链比较完整。

学术研究价值:★★★★☆。它不只是做了一个技巧,而是给 VLA 的泛化问题提供了一个更本质的分析框架。

稳定性:★★★☆☆。方法比直接微调更轻,但仍依赖安全探测和上下文质量,错上下文会带偏,说明鲁棒性还不是满分。

适应性以及泛化能力:★★★★☆。对视角变化、语义扰动、形态变化都有帮助,泛化面比常规多视角训练更广。

硬件需求及成本:★★★☆☆。推理有额外上下文开销,但可缓存;真正的成本主要在部署前的自发探测步骤。

复现难度:★★★☆☆。思路清楚,但要在真实机器人上复现,还得有合适平台、相机阵列和安全控制条件。

产品化成熟度:★★★☆☆。适合需要频繁换视角、换工位的机器人场景,但要先解决探测安全、上下文缓存和异常配置处理。

可能的问题:方法很聪明,但前提是探测动作不能干扰任务现场;一旦环境更复杂,随机探测的覆盖率和安全边界都要重新设计。

参考文献


主要参考文献

Siyin Wang, Junhao Shi, Senyu Fei, Zhaoyang Fu, Li Ji, Jingjing Gong, Xipeng Qiu. In-Context World Modeling for Robotic Control. arXiv:2606.26025v1, 2026.
Brianna Zitkovich et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. CoRL 2023.
Moo Jin Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. arXiv:2406.09246, 2024.
Kevin Black et al. π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
想追前沿机器人论文、想找同好交流实战心得,来群里一起“先探一探,再稳稳拿下”🤖
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。