← 返回 PaperDaily
视觉与图像
告别盲搜!中科院新记忆框架让机器人学会"推理式找物"
真实环境里,物体总被挪来挪去,机器人拿着旧地图找东西就会扑空。中科院软件所提出HitMem,用层次化时间3D记忆给记忆加“保鲜期”,再结合外部轨迹和语义常识做推理式检索,让机器人像人一样顺着线索找东西。在Dyna-THOR基准上总体成功率51.67%,远超DynaMem的35%。
龙哥读论文
发布于 2026-09-12 16:53:31
阅读 1
查看原文
原论文信息如下:
动态环境下的记忆困境:当机器人发现目标“不翼而飞”
想象这样一个场景:你让家里的机器人去厨房拿一个碗,它导航到记忆中的位置,结果碗不见了。原来有人刚刚把碗放到了水池边。你可能会说,这有什么难的,眼睛看一下,再找找就好了。但对机器人来说,这背后是一整套复杂的“认知”问题——它的内部记忆还是旧的,现实已经变了,这种矛盾被称为“记忆-观察冲突”。
现有的具身智能记忆框架,大多建立在“世界是静态的”这一假设上。机器人通过三维重建或场景图把环境存成一张“地图”,之后就一直用这张旧图。一旦物体被挪动,它们要么重新做一遍昂贵的几何重建,要么进行低效的全局盲目搜索。前者慢,后者更慢,而且很容易在搜索途中耗尽步数,任务直接失败。
人遇到类似情况会怎么做?人不会满屋子乱翻,而是会根据线索推理 :刚才有人从餐桌附近离开,手里好像拿着碗;碗大概率被放到厨房的操作台或水槽边,而不是厕所。这种“空间轨迹+语义常识”的多模态线索整合能力,正是当前机器人记忆系统最缺的东西。
中科院软件所等机构的研究者正是瞄准了这一痛点,提出了HitMem ——一个层次化时间3D记忆框架,带有“多模态上下文感知检索”机制。它让机器人不再死守旧地图,而是主动更新记忆、追踪外部智能体的轨迹,并用语义亲和度来猜测物体最可能被放在哪里。这篇论文在动态环境下的长期任务中,把总体成功率提升到了51.67%,对比DynaMem的35%有了显著进步。
这个工作的核心贡献可以概括为三点:第一,提出了一种层次化时间3D记忆表示,将语义、空间和细粒度几何信息结构性地统一起来;第二,设计了多模态上下文感知检索机制,通过融合物理空间线索(外部智能体轨迹)和语义常识(类别亲和度)来高效重定位物体;第三,构建了Dyna-THOR基准,显式模拟外部智能体与物体的交互,逼真还原真实世界的不确定性。
层次化时间记忆:如何用轻量拓扑图统一语义与空间信息
HitMem的记忆模块设计得很考究。它没有像传统方法那样去构建实例级别的稠密对应关系,也没有做昂贵的几何聚类,而是建立了一个以物体为中心的层次化记忆图 Gt = (Vt, Et)。这个图分为两层:上层是轻量级的语义拓扑结构,只编码“载体-被载物”这种类别层面的关系;下层则保留每个物体的精细3D属性,比如点云、全局坐标、物理尺寸,为后续的操作提供空间精度。
节点的初始化依赖于连续感知。机器人利用开放词汇识别和分割模型(如RAM-Grounded-SAM2)获得实例级边界框和分割掩码,抠出物体图像后通过CLIP提取视觉嵌入,同时关联深度信息得到点云和位姿。这样每个节点既“看得懂”又“摸得着”。
那么如何划分载体(比如桌子、架子)和被载物(比如杯子、苹果)?论文设计了一个语义判据:如果某个节点的视觉嵌入与“用于放置物品的家具或电器”的文本嵌入余弦相似度超过阈值θsem,就把它归为载体Cr。剩下的节点作为被载物候选,通过一个综合支撑分数来判断与哪些载体相连。
支撑分数由四个几何量加权而成:空间邻近度、水平覆盖率、垂直支撑性、高度一致性。只有当最大支撑分数超过阈值时,才建立“载体→被载物”的有向边,并把该节点归入被载物集合Cd。如果暂时找不到合适的载体,节点会先放在“未分配”集合中,随着探索不断发现新载体,再动态补边。这种设计让图的更新只需局部插入或删除节点,完全避开了全局重建的昂贵开销。
动态环境最大的敌人是“记忆过期”。为此,HitMem引入了时间衰减机制 ,为每个节点赋予一个随时间指数衰减的活跃度分数。关键点在于,衰减率不是统一的常数,而是取决于物体的结构角色。载体通常是静止的,所以衰减率为零,保证结构骨架稳定;被载物则使用一个基础衰减率,并按照环境的空间尺度进行缩放——空间越大,衰减越慢,防止在长期任务中过早遗忘。
值得一提的是,外部智能体(比如环境中走动的“人”)会被单独记录为一组节点。通过按活跃度排序,系统可以重建出外部智能体的运动轨迹。这个轨迹后续将成为重定位目标的重要线索。为了保持记忆一致性,新观测与已有节点融合时,论文采用了双向ICP匹配——前后两个方向都得分达标才认为匹配成功,避免小物体被吞并。
多模态上下文感知检索:从“盲搜”到“推理”的两阶段策略
有了记忆,还得会“用”。HitMem的检索过程分三步走,逻辑非常像人的思考方式。
第一步是层次化语义查询 。LLM把用户指令解析成结构化查询,例如⟨Pick, Apple, Table⟩。系统先定位相关的载体节点,再沿着“载体→被载物”的边,只在拓扑连接的子集里搜索,而不是全图扫描。每个候选被载物会得到一个综合检索分数,由视觉嵌入与查询文本的余弦相似度加上活跃度分数共同决定。取分数最高的至多三个节点作为优先探索目标。
第二步是主动验证与剪枝 。机器人导航到预期位置后,会主动用当前视觉观察去验证。如果目标在,皆大欢喜;如果不在,就说明发生了位移。此时机器人会把这条过期的记忆节点从图中删除,保持内部表示与物理世界一致。这个“主动剪枝”机制避免了下一次再跑到老地方扑空。
第三步,也是最精彩的部分——两阶段重定位策略 。当确认目标被移动后,机器人不再盲目乱转,而是先用外部智能体的历史轨迹来推断目标最可能的位移方向。这个推理过程很贴近人类找东西的自然行为——你看到室友端着碗走向厨房,碗大概率会出现在厨房操作台或者水槽附近,而不是卫生间。关键在于,机器人并不需要理解复杂的社交语义,它只需要抓住一条核心线索:物体不会自己长腿跑掉,一定有某个外部智能体在“搬运”它。
在具体实现上,HitMem先找出外部智能体轨迹中与目标最后已知位置在空间上最接近的节点,把它记为交互点Pclosest,然后截取交互点之后的一段局部轨迹。为了捕捉稳定的运动趋势而不是局部抖动,系统使用带权平均的方式估算位移向量D。这里的关键洞察是:轨迹节点越新鲜,活跃度越高,对位移方向估计的贡献也越大。换句话说,机器人更相信外部智能体“最近正在往哪走”,而不是很久以前的运动方向。
上图公式中,k是截取的局部轨迹段长度,c是交互点在完整轨迹中的索引,A(vc+magent)表示第c+m个外部智能体节点的活跃度分数,pos则是对应的全局坐标。位移向量D是后续所有扇形裁剪的几何基准。
有了位移向量D之后,HitMem只保留与位移方向夹角小于θR/2的载体作为候选探索集合,物理搜索空间一下子缩小了一个数量级。这就像你找钥匙时,先确定“最后一次见到钥匙的人走向了玄关”,那么你主要搜玄关就够了,不会在客厅和卧室里瞎转悠。
第二阶段:语义类别亲和度扫描。 物理空间被裁剪到扇形区域后,剩下的问题就是:在这几个候选载体里,哪个最有可能“收留”目标物体?HitMem采用了一个非常朴素的常识推理——碗被拿走之后更可能出现在水槽或洗碗机里,而不是书架上;苹果更可能出现在果盘或冰箱里,而不是鞋柜里。这种“类别亲和度”可以通过文本-视觉 embedding 的余弦相似度计算得到:把目标类别填入一个描述性文本模板,再与候选载体的视觉特征做相似度匹配,最后用softmax归一化成概率分布,指导机器人按概率从高到低依次探索。
P(vj | Catt) = exp(Aaffinity(Catt, vj)) / Σvk∈Ccand exp(Aaffinity(Catt, vk))
图3完整展示了整个检索闭环:从导航到记忆位置,到主动视觉验证发现目标丢失,再到移除过期节点、激活两阶段检索,最后按概率引导探索。整个过程环环相扣,没有一步是“碰运气”式的随机搜索。
这种设计带来的效率提升是结构性的。传统方案在目标丢失后往往退化为全局搜索,搜索空间跟环境大小成正比;HitMem先通过轨迹缩小到扇形区域,再通过类别亲和度对候选排序,搜索空间被压缩了两个数量级。更难得的是,整个推理过程不需要重新做几何聚类或全局重建,全部在轻量级记忆图上完成。
Dyna-THOR基准:模拟真实世界中的意外干扰
一个尴尬的事实是:现有具身智能基准大多建立在静态环境假设上。机器人走入一个虚拟房间,所有物体都老老实实待在原地,任务做完就算成功。这在真实世界中几乎不成立——人类活动会把厨房收拾得面目全非,同事可能会顺手拿走办公室里的文件夹,家里的小孩更可能把玩具扔得到处都是。
表1对比了现有具身智能基准的能力覆盖。R2R只做纯导航,没有可移动物体、没有长期任务、没有动态;VirtualHome虽然是第三人称视角且支持长期任务,但缺少动态干扰;ALFRED有第一人称观察和可移动物体,却不支持外部智能体产生的动态变化。Dyna-THOR是第一个同时具备第一人称视觉观察、可移动物体、长期任务和外部智能体驱动的环境动态这四个要素的基准。
Dyna-THOR基于AI2-THOR模拟器构建,包含12个交互式场景,覆盖厨房、客厅、卧室、浴室四个类别,每个场景配备5个长期任务,合计60个任务。每个任务都要求智能体解析并顺序执行多个自然语言指令,同时随时准备应对由外部智能体引发的环境动态变化。外部智能体会在执行过程中故意移动任务相关物体,而且不给机器人任何显式通知,强制制造记忆与观察之间的冲突。
图6展示了Dyna-THOR中来自专家示范的典型任务片段。任务的复杂性在于,外部智能体的动作是隐式的——机器人只能通过连续观察自己推断环境发生了变化,而不能依赖任何外部提示。
在评估指标上,论文采用三个维度:成功率(SR)衡量整体任务是否最终完成;路径加权的成功率(SPL)在成功率基础上还考虑实际行走路径与理论最短路径之比,专门惩罚“绕远路”的智能体;子目标完成率(GCR)则跟踪长期任务中每个自然语言子指令的完成一致性,避免“一锤子买卖”式的偶然成功。
之所以要特别强调外部智能体的引入,是因为它改变了问题的本质。在静态环境中,记忆只负责“存储和查询”;在动态环境中,记忆还必须负责“验证和修正”。一个无法感知物体被移动的机器人,本质上跟一个没有记忆的机器人没有区别——它同样需要从零开始重新探索。
实验结果与启示:适应性、效率与泛化能力
在Dyna-THOR上,HitMem与四个基线进行了系统对比:基于标签场景图的DELTA、静态开放词汇3D场景图ConceptGraphs、支持局部更新的动态场景图DovSG,以及专门做线上可更新时空语义点云记忆的DynaMem。所有方法使用相同的视觉感知模型、相同的初始探索轨迹、相同的LLM规划后端(GPT-4o),确保对比公平。
表2呈现了详细结果。HitMem在四个场景类别中的成功率(SR)和路径加权成功率(SPL)上全面领先。总体成功率达到了51.67%,而最强的动态基线DynaMem只有35%,DELTA更是几乎全军覆没(厨房和卧室直接为0)。SPL指标上的优势更值得注意:HitMem在保持高成功率的同时,实际行驶路径显著更短,说明它不是靠“硬闯”撞运气成功的,而是真正找到了更短的解决方案。
表3给出了组件消融的结果。可以看到,多模态上下文感知检索(尤其是两阶段重定位策略)贡献了最大的性能增益,时间衰减机制次之,层次化记忆图本身也有基础性作用。这个消融结果清晰地说明:HitMem不是简单堆模块,每个设计决策都在动态场景中承担了明确的功能。
表4进一步验证了方法对不同LLM后端和提示词描述的鲁棒性。结果显示,无论用的是GPT-4o还是其他模型,无论描述模板写得多详细或多简略,HitMem都能维持相对稳定的性能水平。这说明方法的有效性不依赖于特定LLM的“超常发挥”,而是来自记忆结构和检索机制本身的合理性。
表5专门测试了外部智能体追踪不完美时(比如感知偶尔漏检或误检)算法的鲁棒性。即使在追踪受到干扰的情况下,HitMem的成功率依然能保持在一个合理区间,说明算法对轨迹噪声具备一定容忍度,不会因为一个检测失误就全盘崩溃。
表6展示了方法的泛化性能对比。HitMem在跨场景类型、跨任务组合的迁移中表现更好,进一步佐证了层次化时间记忆框架具有较好的通用性,而不是只在某一类房间里“刷分”。
图4回答了“衰减率怎么定”这个实际工程问题。实验表明,合适的衰减率与场景规模密切相关:大场景中的物体可能需要“保鲜”更久,因为一次完整探索的周期更长;小场景中的物体则可以更快“过期”。自适应环境尺度的衰减率设计确实是动态记忆系统中不可忽视的细节。
图5展示了一次典型的动态物体重定位过程。可以看到,机器人最初按记忆导航到目标位置,发现目标消失后,先通过外部智能体轨迹锁定候选方向,再按语义亲和度依次检查载体,很快就在一个出乎意料的却符合语义的位置找到了目标。整个过程流畅、有目的性,没有任何试探性乱走。
图7的上半部分展示了一个成功案例,下半部分则分析了三种典型的失败模式:细长物体的轮廓容易被感知模块漏检,导致整个记忆节点无法建立;漏检造成的记忆编码失效会让探索变得低效;形态相近的物体(比如杯子和马克杯)之间容易产生视觉语义混淆。这些失败模式为后续工作指出了明确的改进方向——感知精度仍是具身智能系统整体性能的上限瓶颈之一。
总结来看,HitMem在动态环境中的优势主要体现在三个层面:适应性上,它通过时间衰减和主动剪枝让记忆始终跟随现实变化;效率上,它用轨迹线索和语义亲和度把搜索空间压缩了两个数量级;泛化上,它在不同房间类型、不同LLM后端、不同任务组合中都能保持稳定发挥。51.67%的绝对数字虽然看起来不算“惊艳”,但考虑到这是长期多指令任务、外加外部智能体主动捣乱的难度叠加,这个成绩已经相当有含金量。
龙迷三问
这篇论文到底在解决什么问题? 中科院软件所提出HitMem层次化时间3D记忆框架,用轻量拓扑图统一语义、空间与时间信息,配合多模态上下文感知检索,让机器人在动态环境中快速定位被挪走的物体。Dyna-THOR基准上总体成功率51.67%,远超DynaMem的35
这篇工作最值得看的点是什么? HitMem在Dyna-THOR上全面领先:SR达51.67%(远超DynaMem的35.00%),SPL达34.24%(DynaMem为16.86%),GCR达64.08%(DynaMem为47.69%);在ALFRED泛化测试中同样领先
这篇工作的边界或风险在哪里? 优点:(1) 层次化拓扑图设计巧妙,仅编码类别级载体-被载物关系,避免实例级对应推理的计算开销;(2) 时间衰减机制有效建模记忆时效性,且衰减率随场景规模自适应调整;(3) 两阶段检索策略(轨迹过滤+类别亲和度)显著缩小搜索空间,符合人类认知搜索行为。缺点:(1) 依赖预训练视觉模型的感知质量,对细长物体(如盘子)识别易失败;(2) 缺乏对LLM规划的先验验证机制,存在规划幻觉风险;(3) 基准测试场景类型有限(仅4类房间)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
层次化时间记忆与多模态上下文感知检索的组合创新度较高,尤其是“外部轨迹+语义亲和度”的两阶段重定位,在同类工作中少见。
实验合理度:★★★★☆
基线选择覆盖了静态场景图、动态场景图和动态记忆三类代表性方法,控制变量做得到位;自建基准虽然带来自证之嫌,但消融和泛化实验较全面,结论可信度较高。
学术研究价值:★★★★☆
动态环境中的记忆维护是具身智能走向实用必须跨过的坎,HitMem把“记忆的保鲜与检索”提升到了方法论的层次,对后续研究有较强的借鉴意义。
稳定性:★★★☆☆
在仿真环境中表现出较好的稳定性,对外部智能体追踪噪声也做了一定消融验证。但真实机器人部署时的传感器噪声、遮挡物和场景复杂度远超仿真,稳定性仍需实测检验。
适应性以及泛化能力:★★★☆☆
在AI2-THOR四类房间、多种任务组合中表现稳定,对不同LLM后端也有鲁棒性。但框架重度依赖开放词汇感知模型和预训练embedding的语义质量,在极端场景或低质量感知输入下的泛化能力存疑。
硬件需求及成本:★★★☆☆
感知阶段需要连续运行RAM-Grounded-SAM2和CLIP,推理阶段需要调用GPT-4o,整体计算成本偏高。虽然检索效率高,但基础感知和LLM调用的资源消耗仍限制了在低算力设备上的部署。
复现难度:★★★☆☆
方法流程描述清晰,但依赖多种外部模型(RAM、SAM2、CLIP、GPT-4o)和AI2-THOR仿真器,环境搭建和模型串联有一定门槛。Dyna-THOR基准若开源对复现会很有帮助。
产品化成熟度:★★☆☆☆
当前工作定位是研究原型。若要在服务机器人或家庭机器人上落地,还需要解决实时性能优化、感知模型轻量化、长期运行的内存维护策略等一系列工程问题。
可能的问题: Dyna-THOR为自建基准,缺少第三方独立复现;真实机器人验证缺失,感知噪声环境下的性能可能低于仿真结果;51.67%的绝对成功率仍有较大提升空间;轨迹追踪依赖的外部智能体识别在真实场景中可能不够可靠。
[1] Tang R, Zou C, Wu G, et al. HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments. arXiv:2609.00950, 2026.
[2] Kolve E, Mottaghi R, Han W, et al. AI2-THOR: An Interactive 3D Environment for Visual AI. arXiv:1712.05474, 2017.
[3] Gu Q, Kuwajerwala A, Morin S, et al. ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning. ICRA 2024.
[4] Radford A, Kim J W, Hallacy C, et al. Learning Transferable Visual Models From Natural Language Supervision. ICML 2021.
机器人找东西,最怕的不是找不到,而是“以为自己在老地方能找到”。欢迎加入龙哥读论文粉丝群,和一群搞机器人、大模型的小伙伴一起吐槽涨点。
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+上海+中科院+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!