← 返回 PaperDaily 前沿研究

CVPR 2026|AI看长视频总失忆?CLiViS给它建了一张认知地图

论文基本信息 原文标题: CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning 作者单位: 华东师范大学、阿卜杜拉国王科技大学、复旦大学 首次公开: 2025年6月21日(arXiv v1) 正式发表: CVPR 202

论文基本信息

原文标题:CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
作者单位:华东师范大学、阿卜杜拉国王科技大学、复旦大学
首次公开:2025年6月21日(arXiv v1)
正式发表:CVPR 2026,页码5134–5143
原论文链接:arXiv 2506.17629
CVPR录用页:CVF Open Access
开源代码:Teacher-Tom/CLiViS
数据集:使用OpenEQA、EgoTempo、EgoSchema公开基准

龙哥导读:
一段两分钟的第一视角视频里,人先走进厨房拿鸡蛋,再去客厅碰电脑,最后到卧室关灯。问题却只问:“冰箱里果汁左边的东西能不能放进微波炉?”普通视频模型容易把所有画面平均处理,或者先生成一份固定字幕再推理。CLiViS换了个思路:让LLM负责拆问题、派任务,让VLM按需回看视频,并把地点、物体、动作、关系和证据持续写进一张动态认知地图。它不训练新模型,却在三套具身视频基准上取得最高49.3%的平均准确率。真正值得讨论的,不只是分数,而是它把“看视频”改造成了带状态、可回查、会更新的调查过程

很多视觉问答系统看起来已经很聪明:给一段视频和一个问题,模型可以直接输出答案。但一旦视频变长、场景切换变多、问题需要组合多步关系,系统就会暴露一个尴尬事实——它可能每一帧都看见了,却没有形成一份稳定、可更新的“场景认识”。

这类任务被称为具身视觉推理。输入往往是第一视角视频,视野窄、镜头晃、物体频繁出入画面;问题却可能跨越几十秒甚至几分钟,要求模型先定位发生在哪个房间,再确认物体身份、动作顺序和空间关系。真正的难点不是识别一只杯子,而是把分散在时间里的证据拼成一条因果链。

一、旧路线为什么总在“看见”和“想明白”之间掉链子

论文把已有方法归为两类。第一类是Socratic路线:先让视觉模型把视频转成字幕,再把字幕和问题交给LLM。它的优点是充分利用语言模型的推理能力,缺点也很直接:字幕通常在看到问题之前就生成,无法知道哪些细节之后会变得关键。一次漏写,后面的LLM再强也只能在缺失证据上推理。

第二类是端到端VLM路线:视频和指令一起进入视觉语言模型,跨模态信息损失更少,开放词汇识别也更灵活。但长视频中的复杂问题常常不是一次前向计算能解决的。模型需要先判断“应该去哪一段找什么”,看到结果后再决定下一步。端到端VLM擅长感知,不一定擅长组织一串稳定、可验证的调查步骤。

图1:左上是“先生成固定字幕、再让LLM推理”,右上是端到端VLM,左下是CLiViS的LLM–VLM协同。眼睛代表感知能力,思考图标代表推理能力;这张图说明的是职责分工,不等于证明所有LLM都比VLM更会推理。

CLiViS选择第三条路:LLM不直接替代视觉模型,VLM也不独自承担完整推理。LLM像调查负责人,负责把问题拆成子任务、判断证据够不够;VLM像现场观察员,根据当前子任务回到指定视频片段,提取物体、动作、属性和关系。每轮结果都被写入结构化记忆,再决定是否继续调查。

二、第一条公式:任务不是一次回答,而是一轮轮收集证据

公式1:基础任务把视频V和指令I映射为回答R,θ表示模型参数。

这个写法很简洁,却把最困难的部分藏进了函数f:模型究竟怎样从长视频中找到与问题有关的证据?如果问题只问“画面里有没有冰箱”,单次映射也许够用;如果问题问“果汁左侧的物体是否适合微波加热”,系统至少要完成位置定位、物体识别、空间关系判断和常识推理四步。

因此CLiViS把隐藏在f里的过程显式展开。视频不再是一次性输入,而是可以被子任务反复查询的证据库;指令也不是一条固定提示,而是决定调查顺序的目标。这样做的重要变化是:模型可以承认“现有信息不够”,再生成下一条更具体的视觉查询,而不是被迫立刻猜答案。

公式2:LLM根据指令I和当前地图M产生子任务Ti;VLM在视频V上执行这些子任务,结果合并为新的M,最后LLM基于地图回答。

逐项解释这条式子:I是用户问题;Ti是第i个视觉子任务,例如“检查厨房0到30秒,找出果汁左侧的物体”;VLM(V,Ti)是视觉模型针对该任务返回的观察;并集符号表达多轮观察被汇总进地图M;最外层LLM再结合M和I生成回答。它不是数学意义上严格可微的端到端模型,更像对系统调用关系的形式化描述。

这条公式的价值在于把责任边界写清楚:LLM负责“问对问题”,VLM负责“看清局部”,认知地图负责“别忘记已经知道什么”。它的局限也写在结构里——任何一环出错都会传递:LLM拆错任务,VLM看错物体,或者地图更新覆盖了正确旧证据,最终答案都可能自信地偏离事实。

三、三阶段主流程:先建图,再追问,最后作答

图2:CLiViS完整流程。左侧初始化,中间保存认知地图与证据记忆,右侧执行LLM提出的定向视觉查询,底部整合信息并作答。

第一阶段是认知与记忆初始化。系统把长视频按固定长度切成片段,论文默认使用30秒;VLM先为每段生成粗粒度场景描述。LLM从描述中提取区域、实体、动作和关系,并根据问题标出重点对象。此时得到的是一张粗地图:它可能知道“厨房里有冰箱、锅和微波炉”,但还不知道果汁旁边具体是什么。

第二阶段是语言—视觉协同更新。LLM读取问题、当前地图和历史证据,判断缺口在哪里,然后把模糊问题改写成局部、可执行的视觉任务。VLM只查看相关时间段,补充更细的属性、动作和关系。新结果不是简单追加文本,而是更新图节点和边,同时把支持当前推理的理由存进证据记忆。

第三阶段是整合推理。当LLM认为证据足够,或达到最多10轮交互,就根据地图、证据记忆和原问题输出答案。图里的例子最终识别出果汁左侧是玉米,并结合常识判断可以微波加热。这里要注意,流程图展示的是工作机制,不代表任何开放世界问题都能通过十轮以内可靠解决。

这套流程很像经验丰富的工程师排查线上故障:先建立系统拓扑,再围绕异常缩小范围,逐项读取日志,最后形成结论。区别在于,CLiViS的“日志”来自VLM对视频的观察,而观察本身可能不稳定。因此它需要的不只是记忆容量,更需要对冲突、时间顺序和证据来源进行管理。

四、认知地图不是一张图,而是两套互补坐标

图3:左侧导航图按时间片记录房间、物体和动作;右侧关系图把人物、动作、物体及空间关系连成网络。前者回答“何时何地”,后者回答“谁与谁发生了什么关系”。

导航图Gnav把每个时间片看作节点,相邻时间片用边连接。节点里保存区域、时间范围、场景描述和出现的实体。它解决长视频最基础的定位问题:当LLM需要检查冰箱,不必重新扫完整视频,而是先找到厨房对应的时间段。

关系图Grel更细。节点可以是人物、物体或动作,边表示“在里面”“位于左侧”“拿起”“影响”等语义关系。它把自然语言描述变成可组合的结构。例如“人从冰箱拿鸡蛋并放进锅里”不再是一整句模糊文本,而是人—拿取—鸡蛋、鸡蛋—来自—冰箱、鸡蛋—进入—锅等可追踪关系。

公式3:认知地图M由导航图Gnav和关系图Grel组成;证据原子E包含理由r、时间范围τ与涉及对象集合O。

为什么还要单独保存证据记忆E?因为图结构擅长表达“对象和关系”,却不擅长保留“为什么这条关系与当前问题有关”。证据原子中的r保存VLM提取的任务相关理由,τ指向对应时间片,O列出涉及的对象、区域或动作。于是答案不仅依赖地图上的一条边,还能回到产生这条边的上下文。

这种双层记忆的工程意义很强:导航图负责缩小搜索范围,关系图负责组合事实,证据记忆负责保留推理依据。三者分开后,系统更容易定位错误究竟来自时间检索、关系抽取还是最终推理。但论文没有给出严格的置信度传播机制,错误证据一旦进入地图,后续轮次仍可能围绕它继续展开。

五、地图怎样更新:新证据优先,但不是无脑覆盖

公式4:第i轮地图由上一轮地图与VLM针对子任务Ti返回的新观察共同更新。

更新函数先从旧地图中抽取相关时间子图作为上下文,再让LLM识别VLM结果里新增的实体、关系和动作。若新观察与旧记录冲突,系统遵循时间优先原则:较新的观察可以修正或删除过时元素;添加、删除和修改作为一次完整更新处理,避免地图处于半更新状态。

直觉上,这很适合动态环境。桌上的杯子可能在一分钟后被拿走,门可能从关闭变成打开;把所有观察永久并列会制造矛盾。但“新证据优先”并不总是正确:新画面可能模糊、遮挡或被VLM误认。更稳健的系统还需要来源置信度、多次观察投票和冲突保留,而不是只依赖时间顺序。

每轮更新后,LLM根据M、E和I产生当前响应Ri。如果退出条件为真,Ri就是最终答案;否则Ri被解释为下一条子任务。这个设计把“回答”和“继续调查”统一成一个决策接口,流程简洁,但退出判断完全依赖LLM。过早退出会漏证据,过晚退出则增加调用成本和错误累积。

六、提示词不是装饰,而是系统里的控制协议

图4:论文把场景描述、实体与关系提取、子任务生成、视觉回答解析和地图更新分别写成提示模板。图中省略了完整提示词,详细版本位于附录。

CLiViS强调“training-free”,并不意味着没有系统设计。相反,它把训练成本换成了编排成本:每个阶段都需要明确输入字段、输出格式和更新规则。VLM先按时间片描述场景;LLM再抽取实体、动作和关系;后续提示要求LLM只提出当前缺失的视觉问题,并要求VLM围绕指定片段回答。

这种分阶段提示的优点是可解释、可替换。某个VLM在物体关系上表现差,可以替换感知模块;某个LLM规划成本过高,可以换更小模型或限制轮数。缺点则是提示接口会成为新的脆弱点:字段遗漏、输出格式漂移、模型版本变化,都可能让地图更新失效。

所以,“无需训练”不能被理解成“无需成本”。论文实验把长视频切成30秒片段,最多交互10轮;每轮可能包含一次LLM规划和一次VLM感知。对离线视频问答,这个成本也许可接受;对实时机器人控制,195秒级的报告延迟显然还不能直接进入闭环。

七、主结果怎么看:平均分更高,但不是每个格子都第一

表1:OpenEQA、EgoTempo与EgoSchema统一设置下的结果。蓝色区域是三种VLM骨干接入CLiViS后的表现。

论文报告的最佳组合是InternVL3加CLiViS:OpenEQA 55.4%、EgoTempo 23.0%、EgoSchema 69.4%,平均49.3%。如果看单项,VideoLLaMA3版CLiViS在OpenEQA达到57.3%,在EgoTempo达到23.4%;说明不同视觉骨干仍有各自优势,认知地图不是把底座差异全部抹平。

数据口径也要说清:OpenEQA原始集合超过1600组问答,论文只评测其中带ScanNet对应视频的1079组;开放式回答由Qwen2.5-Max按5级量表评分,达到4分才算正确。论文没有报告重复运行方差或统计显著性检验,因此这些小数点后一位的差距应理解为给定评测流程下的结果,而不是已经证明的稳定优势。

三套基准分别覆盖开放式环境问答、时间理解与长视频多项选择,从不同侧面检验跨片段证据组织能力。

与三种范式中最强基线相比,论文总结CLiViS相对Socratic路线提高20.2个百分点,相对端到端VLM提高2.9个百分点,相对视频推理方法提高14.3个百分点。这里是统一实验设置下的准确率差,不是所有数据集、所有模型上的普遍收益。

长视频结果更能支撑论文主张。以Qwen2.5-VL为例,OpenEQA短于30秒的视频提升3.5个百分点,长于等于30秒的视频提升6.5个百分点。差距随视频长度扩大,与“动态地图帮助聚合长程证据”的解释一致。但相关性仍不等于唯一因果,更多交互轮次本身也带来了额外计算和观察机会。

八、消融最有信息量:真正值钱的是多轮协同

表2–4:不同VLM骨干增益、EgoTempo组件消融,以及EgoSchema上的延迟—准确率对比。

三种VLM接入CLiViS后,平均分分别提高4.3、3.6和2.0个百分点,说明框架收益并非绑定某一个视觉模型。更关键的是消融:去掉导航图下降2.4个百分点,去掉关系图下降1.6,去掉证据记忆下降0.6。三种记忆组件都有贡献,但贡献大小并不相同。

真正剧烈的变化来自协同机制:把多轮交互压成单轮,EgoTempo从23.0%跌到12.5%,下降10.5个百分点;用VLM替代专门的LLM做高层推理,进一步降到10.6%,下降12.4个百分点。这说明CLiViS的核心不是“多存一张图”,而是让规划与感知持续闭环

延迟表也必须一起看。VideoTree用71秒得到60.0%准确率,VideoAgent用644秒得到62.0%,CLiViS用195秒得到69.4%。它在这组三者中取得更好的准确率—延迟折中,但195秒仍远非实时。对于事后检索、视频审计和离线问答可以接受;对于机器人避障、驾驶决策或工业急停则明显不够。

真正的反转:最高分来自“多轮调查”,代价也正是“多轮调用”。效果和成本必须一起读。

九、与VideoAgent、VideoTree、Video-R1放在一起看

VideoAgent更像“带记忆的视频代理”。它把长视频理解拆成工具调用和记忆检索,强调如何从大量片段中找到相关证据。CLiViS进一步把记忆结构化为导航图、关系图和证据原子,并让LLM明确管理下一步视觉任务。前者重在记忆增强,后者重在认知状态持续更新。

VideoTree更像“自适应压缩长视频”。它以树结构组织视频表示,让模型从粗到细选择信息,延迟优势明显。CLiViS不只选择片段,还把物体关系和行动依据写进地图,因此在EgoSchema上高出9.4个百分点,但耗时约为VideoTree的2.75倍。若业务更看重吞吐,VideoTree式层级检索可能更实用;若问题需要多步关系,CLiViS更有吸引力。

Video-R1选择训练出视频推理能力。它通过规则驱动的强化学习激活多模态大模型推理,而CLiViS把能力组合在推理时,不额外训练。两者代表两条路线:一条把推理习惯写进参数,一条把推理过程写进系统。前者可能获得更低的单次调用复杂度,后者更容易替换组件、审计中间状态。

PaperDaily MCP 的关键词相似检索没有返回足够高置信的同题记录,因此这里没有硬把弱相关论文凑成对比组,而是采用论文在统一实验中直接比较的三条代表路线。这个选择避免把一般VLM论文误写成具身长视频推理的直接竞品。

十、工程落地:这套方案最适合哪里

第一,适合离线长视频调查。例如第一视角作业复盘、仓储操作审计、家庭机器人记忆问答、长视频事件定位。这些任务允许几分钟推理,更在意答案能否回到具体时间片和关系证据。

第二,适合模型异构的系统。团队可以使用便宜VLM做全局粗描述,只在关键片段调用更强视觉模型;LLM也可以按问题难度分级。认知地图成为模块间的稳定协议,避免所有能力都绑在一个端到端模型上。

第三,适合需要审计的推理。导航图能说明看了哪个时间段,关系图能说明使用了哪些对象关系,证据记忆能保留关键理由。它不能彻底消除幻觉,但比只返回一个答案更容易检查和回放。

不适合的第一类,是严格实时控制。195秒延迟只是论文指定模型和基准上的测量,不应直接外推到所有硬件;但数量级已经说明,多轮云端大模型调用距离毫秒级控制还有明显差距。实时机器人需要把规划放到低频层,把运动控制留给本地快速策略。

不适合的第二类,是错误代价极高又缺乏核验的场景。地图结构会让推理过程更整齐,却不会自动让观察变真。医疗、驾驶和安全巡检若直接依赖VLM生成的关系,必须加入传感器交叉验证、置信度阈值和人工复核。

十一、论文没有解决的四个问题

其一,地图更新缺少显式概率。当前更新依赖提示词与时间优先规则,没有系统展示每条节点和边的置信度如何累积。面对遮挡、错认和相互冲突的多次观察,单一最新值可能不够稳健。

其二,推理成本与视频长度仍会增长。30秒分段减少了单次输入,但长视频带来更多初始描述,复杂问题又会触发更多回看。论文限制最多10轮,却没有证明超长视频下地图规模和调用预算可以近似恒定。

其三,基准是离线视频问答。OpenEQA、EgoTempo和EgoSchema能检验长程理解,却不能完整代表真实机器人闭环。现实系统还要面对动作改变环境、传感器噪声、执行失败和安全约束。论文结果不能直接改写成“机器人已经会自主长期规划”。

其四,可复现性仍依赖外部模型。作者公开了代码,但主实验使用Qwen2.5-Max等模型,完整复现需要相应服务、视频数据和调用预算。代码可读不等于所有结果都能低成本复现;模型更新后,提示行为和指标也可能变化。

十二、龙哥点评:智能体真正缺的,可能不是更长上下文

CLiViS最有启发的地方,不是又造了一个“记忆模块”,而是把记忆变成了会被任务驱动更新的世界状态。长上下文只是让模型有机会读到更多内容;认知地图则要求系统决定哪些事实值得保留、哪些关系需要补查、哪些冲突必须修正。容量和认知不是一回事。

它也提醒工程团队,不要把所有能力都寄托在一个更大的端到端模型上。复杂系统常常需要角色分工:感知模块负责看,规划模块负责问,状态层负责记,验证层负责判冲突。这样的系统未必更“优雅”,却更容易调试、替换和审计。

但模块化不能自动带来可靠性。若LLM、VLM和地图更新器都用自然语言连接,错误会在接口处悄悄扩散。下一步真正值得做的,不只是增加更多图节点,而是给证据加置信度、来源和失效时间,让系统能够说:“这个关系只看到一次,而且画面模糊,需要再确认。”

从更长远看,具身智能的记忆不会只是聊天记录,也不会只是向量数据库。它需要同时容纳空间、时间、对象、动作、因果、任务和不确定性。CLiViS没有走完这条路,但它把一个重要方向说清楚了:会行动的AI,必须先学会把“见过什么”组织成“现在相信什么”。

三行结论卡

收益:用动态地图连接LLM规划与VLM感知,三套基准最佳平均准确率49.3%。
代价:最多10轮模型交互,EgoSchema报告延迟195秒,准确但不实时。
适用:离线长视频问答、审计与事件调查;不适合直接承担机器人实时控制。

龙迷三问

1. CLiViS是在训练一个新的世界模型吗?
不是。它是推理时编排框架,用现成LLM和VLM构建动态认知地图,没有训练一个预测未来像素或状态转移的生成式世界模型。它更接近结构化场景记忆与任务驱动的视频检索。

2. 认知地图能彻底解决长视频遗忘吗?
不能。地图能压缩并组织关键信息,但压缩过程仍可能漏掉细节,更新也可能引入错误。它缓解“上下文太长”和“证据分散”,不保证每条记忆都正确。

3. 最值得复用的工程设计是什么?
先把视觉任务拆成“粗建图—定向查询—冲突更新—证据回读”四层,再为每层定义结构化输入输出和独立评测。即使不用论文同款模型,这套拆分也能帮助团队定位长视频智能体究竟在哪一步失效。

参考资料

CLiViS论文:arXiv 2506.17629

CVPR 2026官方录用页:CVF Open Access

官方代码:Teacher-Tom/CLiViS

本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。论文指标来自CVPR公开论文;图片为论文原图裁取,公式依据论文方法章节统一排版。官方代码仓库与论文入口已核验,但未完成依赖安装、模型调用和全量基准复现,因此不把源码检查表述为独立复现。实验结果适用于论文给定模型、提示词、数据集与推理预算,不应直接外推到实时机器人安全控制。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球