论文基本信息据官方论文、arXiv与项目页整理;正文不展示普通作者姓名。
龙哥导读
长任务里的机器人,不只是要记住“做过什么”,还要记住东西原来放在哪、当前做到哪一步、下一步应该出现什么画面。哈工大、南洋理工等机构提出的记忆即计划框架(MaP-WAM)没有让动作模型反复吞下整段历史,而是先把历史压成下一段语言与视觉计划,再让执行器按计划行动。它在机器人记忆操作基准九项任务上取得83.3%平均成功率,真机两项任务平均78.0%;更值得关注的是,历史越长,执行器的上下文和单次动作延迟仍基本固定。
假设桌上有三个被盖住的按钮。机器人先看见它们的颜色,随后盖子落下,人再举牌要求它按某种颜色。此时,摄像头里已经没有答案。机器人如果只看“眼前这一帧”,动作再丝滑也只能猜。
再把任务拉长一点:先记住两个数字,依次按左键和中键对应次数,最后再按确认键。机器人不仅要保留早先看到的数字,还要知道自己已经按了几次、当前是按下还是抬起、什么时候该切到下一步。这不是普通的看图出动作,而是带着历史证据持续规划。
最近机器人研究不断追求更大的视觉—语言—动作模型、更长的上下文和更强的世界模型。但这篇论文提出了一个很实在的反问:历史当然重要,可机器人真的需要在每一次抬手时,都重新阅读从任务开始到现在的全部录像吗?
论文图1。左侧语言摘要容易损失颜色和位置等细节;中间增长窗口保留更多视觉证据,但成本随历史变长;右侧MaP-WAM只在规划时读取长期记忆,并把执行器需要的信息压成固定长度计划。来源:论文。
01 机器人长任务的死结:忘了不行,全记也不行
多数机器人策略默认一个近似前提:当前观察加上很短的历史,已经足够决定下一步动作。对于拿起眼前杯子、把物体推到目标区域等短任务,这个前提经常成立。但当关键线索已经被遮挡、物体已经移动,或者动作含义依赖此前阶段时,当前画面并不完整。
现有方法大致有三种补法。第一种把历史写成语言摘要,例如“红色积木原先在左边”。它省空间,却可能把准确角度、距离、遮挡关系和颜色细节一起压没。第二种保留若干关键帧,信息更直观,但抽得太稀会漏掉运动变化,抽得太密又重新遇到上下文膨胀。
第三种最直接:把越来越长的历史图像都喂给动作模型。历史证据确实保住了,可动作生成是高频调用。机器人每执行一小段动作就要再推理一次,历史窗口越长,计算、显存和延迟就越重。论文在同一模型骨干上测得,全历史执行器到1500帧时,单个动作块延迟约为零历史时的四倍;1700帧时超过80GB显存。
MaP-WAM的核心判断是:长期历史主要用于决定“下一段做什么”,不必在“这一小步怎么动”时反复重读。就像厨师做复杂菜,前面焯水、腌制、预热的记录会影响下一道工序,但切每一刀时不需要从菜谱第一页重新看起。
根据论文方法整理:历史证据先转成下一阶段计划,执行器只围绕固定计划行动;完成阶段后,再把真实观察写回长期记忆。
02 第一步:不存整段录像,而是保存“阶段记录”
论文把一项长任务拆成若干语义连贯的阶段。每个已完成阶段 i 保存一条记录 Ci=(li,Gi):li 是这一阶段的语言指令,Gi 是从真实执行轨迹里均匀采样的稀疏视觉证据。实现中,每段保留8帧,初始观察 G0=f0 另行保存。
这里有两个容易忽略的细节。第一,记忆里保存的是机器人真正执行后看到的画面,不是世界模型凭空生成的画面。第二,视觉证据按已完成阶段组织,而不是把所有帧塞进一条越来越长的无结构序列。
为什么“按阶段记忆”有用?因为长期任务里的问题往往不是某一帧模糊,而是证据属于哪个步骤。按按钮任务中,“左键已按两次”和“右键还没确认”是不同阶段;把它们混成一团,模型需要自己从长视频里重新寻找边界。阶段记录相当于先给历史加了目录。
不过这也埋下一个重要限制:论文训练和评测使用了现有基准提供的阶段边界。也就是说,系统已经知道示范应该怎样分段。面对自然环境里没有标注、步骤可能临时改变的任务,如何自动发现阶段,论文还没有解决。
03 第二步:语言说“做什么”,视觉计划说“应该看到什么”
进入新阶段前,系统先调用语言规划器。它读取总任务指令、已经完成的阶段指令,以及一组压缩关键帧,预测下一段语言计划 l̂k。这一步回答的是语义问题,例如“打开目标颜色对应的盖子”或“继续按中间按钮”。
只靠这句话还不够。“拿红色物体”没有说明红色物体原来在哪、抓取后画面应怎样变化。于是,因果世界模型继续读取长期稀疏视觉上下文 G<k、下一段语言计划和全局指令,生成视觉计划 Ĝk。它不是给读者看的漂亮视频,而是给执行器用的未来视觉参照。
语言计划和视觉计划合在一起,形成当前阶段的多模态计划 Ĉk=(l̂k,Ĝk)。语言负责抽象目标,视觉负责保留物体身份、颜色、位置和预期变化。这就是“Memory as Plans”的含义:记忆不直接变成动作,而是先被翻译成执行当下真正需要的计划。
规划器的注意力结构也经过专门设计。已完成阶段构成因果前缀,后面的阶段可以看前面的证据,前面的隐藏状态却不依赖未来目标,因此对应的键和值只算一次就能缓存。历史越长,规划仍会增加一些计算,但不用每次从头重算全部旧阶段。
论文图2。上方是“长期记忆→语言计划→视觉计划”,下方是世界—动作—进度联合模型;右侧显示固定计划前缀在多个动作块之间复用缓存。来源:论文。
04 第三步:动作和进度一起预测,机器人才能知道何时换计划
有了计划,机器人还面临一个现实问题:一个阶段究竟需要执行多久?同样是打开盖子,有时一次抓取成功,有时需要调整姿态;若固定执行若干步再切换,很容易没做完就跳走,或者完成后还在重复动作。
论文因此提出世界—动作—进度模型。输入包括当前阶段的语言与视觉计划、当前相机观察 ft、机器人本体状态 st 和当前进度 pt;输出同时包含未来视觉动态、动作块 ât+1:t+h 和未来进度序列 p̂t+1:t+h。
训练时,某一阶段从第 i 步到第 j 步,时刻 t 的归一化进度写成 pt=(t-i)/(j-i)。这个数从0走向1,像给机器人加了一根“阶段时间轴”。画面可能很像,但处在20%和80%时,对应动作含义完全不同。
模型基于预训练视频扩散变换器扩展出动作专家和进度专家:视频、动作、进度各自保留适合自身的数据通道,又通过联合注意力交换信息。未来视觉预测主要作为训练辅助,部署时可以省略;真正反复运行的是动作和进度分支。
论文的联合目标可以写成 LE=λvLv+λaLa+λpLp。三个损失分别监督未来视觉、动作和进度,实验里三个权重都设为1。直觉上,这不是让模型只学“动作答案”,而是同时学“世界接下来怎样变化”和“这一段做到什么位置”。
执行器还把当前计划编码为静态前缀。只要阶段没有切换,这段前缀就不变,可以预填充并复用键值缓存。机器人每次只把新的观察、状态和进度接到后面,不再反复读取全部历史。长期记忆的成本被挪到低频规划,短期控制只围绕固定计划循环。
根据论文算法1整理的伪代码
输入:总任务、初始观察、阶段切换阈值
循环直到任务结束:
从已完成阶段提取关键证据
生成下一段语言计划与视觉计划
缓存当前计划前缀
当完成分数低于阈值:
用当前观察校准进度
联合预测动作块与进度
执行动作并收集真实观察
将本段真实观察稀疏采样后写回记忆
最关键的三行是“生成计划”“缓存计划”“真实观察写回”。前两行把思考和行动分开,第三行防止长期记忆被生成误差污染。计划可以是模型想象的,但更新记忆时必须回到真实执行结果。
05 进度会漂,怎样避免机器人越做越偏
进度预测有一个天然麻烦:部署时没有真实进度标签。模型只能把上一次预测值递归地喂回下一次。前面每次偏一点,长任务里就可能积成大误差,最后出现重复按键、漏掉动作或过早切换。
MaP-WAM利用视觉计划做校准。每个阶段的参考序列由阶段初始观察和8帧视觉计划组成,共9个位置,对应从0到1均匀增加的进度。每次生成动作前,系统在当前进度附近找两张参考帧,把它们和真实观察比较,再把进度向更相似的那一帧拉回。
论文采用的相似度并不复杂,只是彩色像素的平均绝对差。校准后的进度,是旧估计与最佳匹配参考进度的平均值。这个办法无需额外训练,工程上轻量;但在光照变化、视角剧烈变化、背景复杂或不同阶段画面相似时,像素差未必可靠。
随后,系统对最新动作对应的预测进度求完成分数。当分数超过阈值 τ=0.95,当前阶段结束,机器人把执行轨迹压成8帧真实视觉证据,加入情景记忆,再请求下一段计划。由此形成“记忆—计划—动作—进度—新记忆”的闭环。
论文图4与表2。没有视觉记忆时,计划会选错物体、颜色或位置;三项难任务中,完整进度机制平均96.7%,去掉校准降至73.7%,去掉进度条件降至54.0%。来源:论文。
06 83.3%到底怎么来的:九项任务,不是一个总关卡
论文在机器人记忆操作基准上评估九项依赖记忆的操作任务。其中五项只依赖一个关键历史观察,四项依赖多个历史观察。任务包括观察后拿取、恢复积木、交换物体、尝试电池位置、按历史排序摆放和按键等。
每个任务使用50条官方专家示范训练,采用全局随机种子0,并进行100次评估。MaP-WAM九项平均成功率为83.3%,最强对照灵波视觉—动作模型(LingBot-VA)为77.1%,Mem-0为42.0%;普通扩散策略、π0.5和跨本体视觉—语言—动作模型分别只有5.8%、10.4%和9.8%。
但不能只看总平均。MaP-WAM并非每项都第一:重排积木任务是66%,低于Mem-0的89%和LingBot-VA的100%;积木排序尝试任务是94%,也低于LingBot-VA的100%。它真正拉开差距的是多处依赖历史、阶段容易混淆的任务,例如电池尝试82%、遮盖积木100%、按按钮96%。
“观察后拿取”反而只有19%。虽然比最强对照的9%高一倍多,但绝对成功率仍很低。论文解释,这项任务需要在几十种物体中分辨身份,同时联合处理跨时间观察和空间关系,而每项只有50条示范。83.3%的总分很亮眼,却不能遮住最难感知任务仍有八成以上失败。
根据论文表1、图3和表2整理。83.3%是九项机器人记忆操作任务平均成功率;真机两项平均78.0%,两者评测环境与任务集合不同。
07 真机做了什么:找对被盖住的按钮,再按对次数
真机实验使用7自由度Franka Research 3机械臂,配第三人称相机和腕部深度相机。第一项“找按钮”要求机器人先观察多个按钮的颜色,按钮被盖住后,再根据白板上的颜色指令打开对应盖子。
第二项“按按钮”更考验阶段记忆。机器人先读取白板上的两个数字,按数字次数分别操作左键和中键,最后按右侧确认键。按下与松开的画面高度相似,模型若不知道当前进度,很容易多按、少按或提前确认。
每项收集50条训练轨迹,并做50次独立测试。MaP-WAM在找按钮上成功率88%,按按钮上68%,平均78.0%。对照方法在找按钮上偶尔能靠随机选择成功,但在更复杂的按按钮任务上均为零。
官方项目页提供一段31秒真机视频,页面声明演示为真实机器人执行。本文已核对项目页全部视频与媒体源路径,只有一个视频源,并完成下载、转动图、逐帧解码和尺寸检查。由于项目方未给出媒体再分发条款,正文不转载该视频,仅保留官方入口供读者查看。
官方Demo:
https://sizhezhao.github.io/projects/MaP-WAM/video/video.mp4
08 这篇论文真正硬核的工程点:固定执行上下文
长任务里,规划不是每个控制周期都发生。机器人完成一段后才重新规划;而在同一阶段内,动作模型会被调用很多次。因此,把历史成本从执行器搬到规划器,价值并不只是“省几个token”,而是把高频路径从增长复杂度改成近似固定复杂度。
论文在单张英伟达A800 80GB显卡上测量延迟,使用16位脑浮点精度、批量1和10次流匹配去噪。每个配置先预热5次,再测100次并取平均;统计的是潜空间模型推理,不包含模型加载、提示编码、数据传输和视觉编解码。
同一骨干的全历史执行器即使用键值缓存,历史达到1500帧时,单动作块延迟仍约为零历史时的四倍;到1700帧超过80GB显存。MaP-WAM把固定视觉计划作为缓存前缀,在同一范围内每个动作块约保持827毫秒。
这里也要冷静:827毫秒不等于千赫兹级实时控制,论文测量还排除了编解码和传输;系统的语言规划器、视觉规划器和执行器分别基于数十亿参数级组件,训练使用8张80GB A800。它解决的是“历史越长,执行越来越慢”,并没有把整套系统变成轻量模型。
根据论文图5和附录延迟协议整理。固定执行上下文避免历史长度直接拖慢每次动作生成,但规划器和大模型训练成本仍然存在。
09 和三条相似路线相比,它新在哪里
第一条路线是多尺度具身记忆。它把短期历史保留为较密的视觉记忆,把长期经历压成语言记忆,目的是同时覆盖局部动态和长程任务。优势是设计直观、记忆层级明确;问题是长期语言摘要仍可能丢失精确视觉细节。
第二条路线是双层循环记忆模型(ReMem-VLA)。它用帧级循环查询保存短期上下文,用动作块级循环查询积累长期上下文,并增加过去观察预测来强化视觉记忆。它的上下文长度不会随时间线性增长,记忆被持续压进隐变量;但这种记忆更隐式,不像MaP-WAM那样显式产出下一段视觉计划与进度坐标。
第三条路线是LingBot-VA。它把视频与动作交错成因果序列,让世界模型一边预测未来视觉、一边生成动作。优势是完整历史可以直接参与动作决策,视觉—动作因果链统一;代价是历史前缀随着任务增长。MaP-WAM正是把它从“历史驱动每次动作”改成“历史驱动阶段计划”。
机器人记忆操作基准则不是另一种模型,而是把问题定义清楚的评测体系。它区分依赖一个关键历史观察和依赖多个历史观察的任务,并提出包含锚点、滑动窗口、关键记忆与阶段结束分类器的Mem-0。MaP-WAM沿用了这个基准和阶段结构,同时把视觉记忆、世界模型和进度建模合成闭环。
根据多尺度具身记忆、双层循环记忆、因果世界—动作模型和本文方法整理。差别不只是“有没有记忆”,而是历史以语言、隐状态、增长帧序列还是下一段计划的形式进入控制闭环。
把这几条路线放在一起,MaP-WAM的创新可以概括成三点。第一,记忆服务于规划,而不是永久占据执行上下文。这直接回应长历史带来的部署成本。
第二,计划同时包含语言和视觉。语言告诉机器人目标,视觉保留颜色、位置、姿态和预期变化,避免把精细证据全压成一句话。
第三,进度不是旁路打分器,而是动作生成的一种输入和输出。它既帮助区分外观相似的阶段,也决定什么时候结束当前计划、写回记忆并重新规划。
10 论文还有四个不能绕开的边界
第一,阶段边界是已知的。系统依赖已有任务分段来组织记忆、定义进度和触发切换。真实家庭任务里,步骤可能因失败而插入,也可能被人临时改变;自动发现阶段仍是下一步。
第二,视觉对齐指标很朴素。彩色像素平均差在实验里有帮助,却不理解物体语义。相机轻微移动、光照变化或背景干扰,都可能让“像不像”偏离“做到哪”。
第三,仿真平均分不能代替开放世界能力。机器人记忆操作基准每项50条示范、固定任务协议和100次评估,结论适用于这组记忆任务;观察后拿取只有19%,说明跨物体泛化仍远未解决。
第四,真机规模仍小。实验只覆盖一类机械臂、两类任务、每类50次测试。它证明闭环设计能落到真实设备,不足以证明跨机器人、跨场景和数小时持续运行的可靠性。
另外,计划本身来自生成模型。虽然记忆更新坚持使用真实观察,能减少“拿想象覆盖事实”,但如果语言计划或视觉计划一开始就错了,执行器仍可能沿错误目标稳定前进。未来系统还需要计划置信度、异常检测和失败恢复,而不只是更准的正常流程。
11 龙哥点评:记忆的价值,不在存得多,而在能否改变下一步
这篇论文让我最认可的,不是83.3%本身,而是它对系统路径做了减法。很多长上下文方案的直觉是“别丢信息,全部带上”。但机器人不是离线读长文,它要持续观察、决策和行动。高频链路里每多一份历史,都会变成延迟、显存和调度压力。
MaP-WAM把记忆变成计划,本质上是在回答一个更普遍的问题:过去的信息,怎样压缩后仍能对现在负责?只压成语言,容易丢细节;只保留视频,成本会膨胀;压成“下一段要做什么、应该看到什么、当前做到哪”,则把历史转成可执行状态。
这和近期机器人泛化研究形成了一条连续主线:动作模型不仅要会生成,还要知道任务阶段、观察执行反馈并修正偏差。此前世界模型工作强调动作与未来画面是否一致,这篇工作进一步把长期记忆放进规划入口,再用真实观察校准进度。二者不是因果关系,但共同指向同一变化:机器人能力的竞争,正在从“一次生成得像不像”转向“长时间闭环能不能稳住”。
对研究团队而言,值得借鉴的是规划与执行解耦、静态前缀缓存和真实观察写回。对产品团队而言,更现实的启发是:不要先问系统能记多少小时,要先问哪些历史会改变下一步决策,以及能否把它们变成低频、可审计、可替换的计划。
但现在还不能把它当成即插即用方案。代码和权重尚未开放,训练硬件重,任务分段依赖标注,最难感知任务成功率也不高。真正值得期待的,是这套“记忆只在需要时展开、行动围绕计划闭环”的系统思想,而不是把一个基准数字外推成通用机器人已经会做长任务。
龙迷三问
一问:如果阶段需要人工标注,换到开放家庭环境怎么办?下一步需要自动分段、异常阶段插入和失败后重规划。否则一旦现实流程偏离示范目录,记忆结构本身就可能失效。
二问:视觉计划错了,进度校准会不会越校越错?会有这个风险。当前像素差只在候选计划帧里找最近者,没有独立判断“整个计划都不可信”。更稳妥的系统需要置信度门控、语义相似度和退出机制。
三问:固定上下文是否真的等于低延迟?它解决了延迟随历史增长的问题,但绝对延迟仍受大模型骨干、去噪步数、视觉编码和硬件影响。固定复杂度很重要,却不等于轻量部署已经完成。
原文与资源
论文原文:
https://arxiv.org/abs/2609.11561
arXiv网页全文:
https://arxiv.org/html/2609.11561
官方项目页:
https://sizhezhao.github.io/projects/MaP-WAM/
官方仓库:
https://github.com/aipixel/MaP-WAM
机器人记忆操作基准:
https://arxiv.org/abs/2603.01229
多尺度具身记忆:
https://arxiv.org/abs/2603.03596
ReMem-VLA:
https://arxiv.org/abs/2603.12942
LingBot-VA:
https://arxiv.org/abs/2601.21998
本文基于龙哥读论文数据库及论文检索工具进行汇总整理。
论文图表依据arXiv页面标注的知识共享署名4.0协议引用,并在相邻图注中说明来源。
本文仅代表对论文方法与实验的理解,不构成对真实机器人安全性、通用性或商业部署能力的背书。建议结合原文、后续代码与独立复现阅读。