论文基本信息
拓扑评测系统(MindTopo)原文标题:MindTopo: Can Foundation Models Reason in Topological Space?
首次公开:2026年9月11日 01:54(北京时间,arXiv v1)
主要署名单位:西北大学、微软研究院、斯坦福大学
论文入口:
https://arxiv.org/abs/2609.11900
龙哥导读
大模型能看出绳子打没打结,是否就能一步步把结解开?MindTopo给出的答案很扎心:最强模型总体宏平均61.42%,人类是97.87%;训练能把静态推理大幅拉高,却很难让连续行动同步进步。它测的不是“画面像不像”,而是模型在行动过程中能不能始终守住连通、包围、顺序和打结这些不变量。
最关键的结果先说:研究者严格审计了1,560条生成轨迹,在一笔画、管道和解绳三个环境中,没有一条同时通过终点成功、逐帧静态约束与相邻帧动态约束。有些视频的最后一帧看起来已经完成任务,但中途发生了路径断裂、状态跳变或拓扑关系破坏。
最近的交互智能体、机器人和世界模型,常常把“会回答问题”包装成“会完成任务”。可真实行动不是看一张图给一次答案。它要经历观察、选择动作、环境变化、再次观察,再继续纠错。只要中间一步把状态想错,最后那张看似成功的画面也可能是“瞬移”出来的。
MindTopo正面追问这个矛盾:模型识别拓扑关系的能力,能不能迁移成保持拓扑关系的行动能力?论文把答案拆成五种基础空间关系、十三类任务和两个认知层级,结果不是简单的“模型不够强”,而是暴露出一条很具体的能力断层。
原创示意图。五类拓扑性质分别配有静态推理和闭环规划任务:一边问关系是什么,一边问怎样通过行动形成、保持或改变关系。事实来源:https://arxiv.org/html/2609.11900v1
论文署名中的Jiajun Wu,官方斯坦福主页显示其为计算机科学助理教授,并兼任心理学助理教授,研究横跨计算机视觉、机器人与计算认知科学。MindTopo把空间概念、视觉识别和智能体行动放进同一框架,与这条路线直接相关,所以标题点名其团队并非借名气贴标签。
一、拓扑到底在测什么:形状变了,关系还在
很多空间测试爱问距离、角度、方向、大小和三维位置。这些都重要,但它们容易随着视角和形状变化。把一根橡皮筋拉长、压扁、绕成弯曲形状,长度、角度和轮廓都变了;只要不剪断、不粘接,也不让一段穿过另一段,它是不是一个闭环、有没有打结,仍然没有变。
论文用一个公式概括这种“不随连续变形改变”的关系:
X ≃ X′ ⇒ Φ(X) = Φ(X′)
X和X′代表变形前后的空间结构,“≃”表示两者可以在不切断、不粘合、不相互穿越的条件下连续变形;Φ是要检查的拓扑性质。公式的计算顺序并不复杂:先判断两种结构是否属于同一种连续变形关系,再比较性质值是否保持。它的直觉是,别被表面姿态骗了,要追踪结构上的连接和约束。
这个公式也有边界。真实机器人会碰撞、遮挡、抓取失败,绳子还可能因摩擦形成局部锁死;“数学上同胚”并不等于“物理上容易操作”。MindTopo选择的是一组可程序化生成、可自动判定的任务,把复杂世界里最基础的一层单独抽出来测。
五类性质可以这样理解。连续问路径有没有断;分离问对象或区域能否成为独立部分;顺序问元素沿路径的前后排列是否保持;包围问什么在里面、什么在外面、结构有几个洞;打结问绳环是真的成结、彼此相链,还是只是投影看起来很乱。
二、十三类任务,故意把“会看”和“会做”配成两层
理解整套基准的关键,不是把十三个小游戏逐个背下来,而是看清每一种拓扑性质都有“推理题”和“规划题”。前者给渲染图和问题,模型一次作答;后者把模型放进环境,必须连续选择动作。
原创示意图。静态推理是一次输入到一次答案;闭环规划要反复观察、动作、接收环境变化。后一步必须承担当时之前全部选择的后果。事实来源:https://arxiv.org/html/2609.11900v1
连续性用迷宫判断与旋转管道配对,一个测识别连通,一个测构造连通。分离性用家具子组件和一笔画分区配对;顺序从珠串、折纸点位延伸到滑块换序。包围性用围栏绵羊、孔洞计数和围猫任务呈现;打结则从真结、相链识别走到移动端点解绳。
这种配对设计比单纯增加题量更重要。它让研究者能问:同一个模型明明知道“什么叫连通”,为什么轮到旋转管道却接不起来?明明认得绳结,为什么连续移动端点时守不住绳子的关系?能力缺口终于能被定位,而不是被一个总分掩盖。
三、数据不是人工涂答案,而是从状态里“算”出来
MindTopo共有11,030个实例,其中8,030个是推理问题,3,000个是规划回合,覆盖容易、中等、困难三个等级。项目页早期结构化信息仍写11,016,但最新arXiv v1正文、表格与人类评测覆盖都以11,030为准,本文采用论文版本。
原创示意图。场景生成、自动算真值、控制难度和导出任务构成四步管线;最终得到8,030道推理题和3,000个规划回合。事实来源:https://arxiv.org/html/2609.11900v1
图3的四个区域要逐项看:场景生成负责采样状态;拓扑标注用图搜索、几何包含测试或构造记录直接算真值;难度控制调整墙数量、网格和交叉数,并过滤一眼可猜的样本;实例导出再生成问答或带目标、动作规则的交互回合。
这条管线的优势,是规模和真值都可控。只要生成器正确,就可以持续扩充数据,不必为每张图重新雇人标注。它的代价也很明确:场景主要来自Three.js或任务模拟器,视觉干净、规则明确,和真实房间、工厂、道路、柔性物体仍有距离。程序化数据适合做“能力体检”,不能直接当成真实机器人通过证书。
四、四个公式,把静态答题和闭环行动分开
论文对推理的形式化非常简洁:
â = M(o, q)
o是模型看到的一张或多张图,q是问题,M是被测模型,â是模型预测答案;当â等于由场景状态计算出的标准答案a*,这题就算正确。它测的是从一次视觉输入到一次输出的映射。模型不需要承担自己答案造成的后果。
规划则由两条公式共同构成:
at ~ πC(· | u, ht)
st+1 ~ P(· | st, at)
第一条说,在第t步,完整配置C根据任务指令u和历史ht选择动作at。这里的历史不仅有当前画面,还可能包括之前的观察与动作。π不是单独的大模型名称,而是“模型加提示、记忆、生成器等组件”共同形成的策略。
第二条说,环境拿到当前状态st和动作at后,通过状态转移P产生下一状态st+1。模型随后只能根据新观察继续行动。整个回合要在步数上限H之内,让目标条件g成立。静态题错一次丢一分;规划题错一次,可能把后面所有观察都带进错误分支。
这也是公式的局限:它把环境转移写得很干净,但现实世界的P包含噪声、遮挡、执行延迟、物体形变和不可逆错误。MindTopo的规划已经比单轮问答难很多,却仍是受控模拟环境。因此,它证明的是基础能力尚未过关,而不是完整测完了现实空间智能。
五、主结果:最强模型仍与人类差36.45个百分点
论文评测了14个多模态大模型,包括5个闭源模型和9个开放权重模型。按十三类任务做宏平均,表现最好的模型是61.42%,人类是97.87%,相差36.45个百分点。宏平均让每类任务权重相同,避免样本多的任务把总分“冲高”。
据论文表1与第3.2节整理。总体宏平均61.42%对人类97.87%;最佳模型的静态推理均值66.83%,规划均值52.75%;最佳开放权重模型的规划均值仅5.27%。
更重要的是,论文观察到所有模型的推理表现都高于规划表现。这不是某一家模型偶然翻车,而是跨模型一致的结构性现象。模型可以在一张图里找到连通路径、数出孔洞、判断绳环关系,却很难把这种判断转成合法、连续、可纠错的动作序列。
开放权重模型的断层尤其大。参评的最大开放权重模型之一参数规模不小,但五个规划环境的均值只有5.27%。这提醒团队:把模型做大、把静态视觉问答做强,并不会自动长出闭环控制能力。状态记忆、动作约束、环境模型和错误恢复,都可能成为新的瓶颈。
人类结果也不是凭想象设定的“满分上限”。论文让标注者面对与模型相同的视觉输入和任务说明;推理覆盖11,008个实例,规划在相同网页环境里交互。人类并非每题都对,但总体接近98%,说明这些任务对人不是不可理解的数学谜题。
六、微调为什么救了推理,却没救活规划
研究团队又在一款20亿参数的通义千问视觉语言模型上比较基础模型、监督微调、强化学习、留一任务迁移,以及“监督微调后再强化学习”。结果最好的组合确实有效,但收益严重偏科。
据论文表2整理。监督微调加组相对策略优化后,五个推理任务均值从14.24%升至51.53%,提高37.29个百分点;四个规划任务均值从0.20%升至6.33%,只提高6.13个百分点。
为什么会这样?静态推理的反馈短而直接:给图、给问题、给标准答案,模型更容易学会输出格式、视觉线索和任务规则。规划的信用分配却很长:某一步看似合理,三步后才暴露为死路;某一步动作合法,也可能破坏以后必须维持的连通或包围关系。
规划不是“每一步都答对一道独立题”。历史会持续积累,模型必须记住刚做了什么、环境怎样变化、下一步是否合法。一次遗漏就会产生状态漂移;若训练主要奖励终点,模型很容易碰运气或追逐局部线索。
留一任务训练也没有展现稳定迁移。某种拓扑性质上学到的经验,并不均匀地转移到另一个未见任务。这意味着模型可能学会了“题型”,还没有抽象出足够通用的拓扑操作。分数上涨不等于概念已经内化,跨任务迁移才更接近真正的能力证据。
七、错误从哪里来:推理先看错,规划先走错
论文建立七类错误,从指令遵循、感知定位、拓扑推理,一直排到动作规划和环境动态违规,并按照因果优先级给错误归类。这样做的好处,是一个案例不会因为后面还错了,就把最早的根因重复计算。
原创数据图。静态推理错误主要集中在感知定位;闭环规划错误更多落在动作规划与动态违规。数据来源:https://arxiv.org/html/2609.11900v1
静态推理里,58.1%的错误被归到感知定位:不是完全不懂拓扑,而是没有可靠地读出画面中的墙、点、边界、绳段和连接关系。也就是说,抽象推理之前的“把图看准”仍然是最大门槛。
规划错误则向后移动。43.3%来自动作规划,24.5%属于动态违规。模型可能知道目标,却选错下一步;也可能生成一个看似漂亮的中间状态,但它不可能由上一状态通过合法动作得到。前者是“路线不会排”,后者更像“脑内物理引擎偷偷改规则”。
这对产品团队很现实。机器人失败时,不能只问视觉准不准;要拆开检查状态抽取、动作合法性、执行回读、历史更新和失败重规划。MindTopo把这些层次从一个模糊成功率里剥离出来。
八、最狠的一刀:终点看着成功,过程可能全是假的
论文还测试了图像和视频生成模型能不能帮助规划。直觉上,模型如果能“想象下一帧”,就可能先在脑中预演,再决定动作。这也是世界模型最吸引人的叙事之一。但MindTopo没有只看生成结果像不像,而是检查相邻帧之间是否遵守任务动态。
原创数据图。严格标准同时要求终点成功、每一帧满足静态约束、每次状态变化满足动态约束;1,560条轨迹中无一过程有效。数据来源:https://arxiv.org/html/2609.11900v1
这1,560条轨迹覆盖一笔画、管道和解绳三个规划环境。严格标准把终点成功、单帧静态检查和相邻帧动态检查做合取:任何一项失败,整条轨迹就不能算“过程有效”。
这个0并不表示每段视频都毫无信息。有些生成结果保留了局部线索,也能画出看似合理的终点。例如一款模型在管道任务上有35.2%的终点被解析为成功,另一款也有19.0%;可它们没有一条轨迹同时通过全部静态和动态约束。
解绳任务同样反直觉。某些模型在“拓扑读数不闪烁”这项局部检查上可以达到六七成,最终画面也偶尔像是解开了;但端点跟踪、绳体完整、跨帧关系只要有一个环节断掉,所谓成功就可能来自绳子突然消失、穿越或换位。
这项实验真正否定的,是“终点像答案,所以模型理解了过程”这条捷径。在视频生成、机器人规划、自动驾驶预测里,最后一帧漂亮远远不够。过程必须可追踪,状态转移必须守规则,关键不变量必须从头到尾成立。
九、和三篇相似工作相比,MindTopo补上了哪一环
第一篇是拓扑基准系统(TopoBench)。它用六类、900个符号网格拓扑题测试大语言模型,困难题上前沿模型不到四分之一,并通过错误标注和干预指出约束提取、过早承诺、约束遗忘等问题。它把“全局约束为什么难”拆得很细,但主要仍是静态、符号化解题。
TopoBench原文:
https://arxiv.org/abs/2603.12133v1
第二篇是曲线评测系统(CurveBench)。它用756张互不相交的Jordan曲线图,要求模型恢复完整的嵌套包含树。最强模型在简单集达到71.1%,困难集只有19.1%。这说明即使画面只剩干净曲线,“里面套着什么”依然不容易。MindTopo把包围从一种关系扩展到五类性质,并加入行动层。
CurveBench原文:
https://arxiv.org/abs/2605.14068v2
第三篇是绳结智能体(KnotGym)。它把绳结操控做成交互环境,从纯图像观察出发,按交叉数量控制复杂度,比较基于模型的强化学习、模型预测控制和链式推理。它已经跨过“只看图答题”,但任务集中在绳结。MindTopo保留了解绳,又加入连续、分离、顺序与包围,并把每类性质的静态推理和动态规划成对比较。
KnotGym原文:
https://arxiv.org/abs/2505.18028v3
把三条路线放在一起看,演进很清楚:先证明符号约束题难,再证明干净视觉中的包含关系难,再把绳结送进交互环境。MindTopo的新增价值,是建立统一坐标系,直接比较同一种拓扑概念从识别到行动到底损失多少,并把生成式世界模型的“过程真实性”一起纳入审计。
十、对做智能体、机器人和世界模型的人有什么用
第一,验收拆成“看懂、计划、执行、回读”。静态高分不能直接升级成“可用于操作”。状态抽取、合法动作率、过程约束、终点成功和失败恢复应分别统计。
第二,世界模型要审计轨迹,不只审美视频。生成视频看起来连贯,只能说明像素和局部语义有一定连续性。若绳子能穿过去、管道颜色凭空改变、路径忽然断裂,它就不能作为可靠的规划模拟器。面向控制的生成模型,需要显式检查状态守恒、动作可达性和任务不变量。
第三,训练信号要覆盖中间步骤。只奖励最终成功,容易让策略学会偶然到达终点。更可行的路线,是给合法动作、状态一致性、拓扑不变量、可逆性和重规划质量分别提供反馈;同时把环境状态与视觉观察对齐,减少模型在历史里“自说自话”。
第四,小模型适合做快速诊断,程序化环境适合做持续回归。团队可以先定位数据和奖励问题,再扩到昂贵的大模型;每次模型、提示或策略更新后,也能重生成不同难度任务,检查能力进步与退化。
十一、代码、数据与复现:入口有了,完整复现仍不轻
论文与项目页给出了代码和数据集入口。公开仓库说明包含静态视觉问答、交互规划、图像生成介入和缓存视频评测等路径;交互任务需要安装浏览器运行时并构建前端,远程模型评测还需要相应服务密钥。没有密钥的本地oracle和random基线可以作为环境通路检查。
不过,当前公开快照的说明文档标题仍写TopoBench,项目页按钮也保留“soon”字样,且仓库根目录没有取得明确的许可证文件。因而更稳妥的表述是:官方已提供代码与数据入口,但不能仅凭链接存在就宣称论文全套结果已经一键可复现。复现者应先核对仓库版本、数据清单、环境前端和评测配置。
资源使用时,建议长按复制完整网址到浏览器打开:
官方超文本技术(HTML)全文
https://arxiv.org/html/2609.11900v1
官方便携文档技术(PDF)版本
https://arxiv.org/pdf/2609.11900v1
官方项目页
https://mind-topo.github.io/
代码入口
https://github.com/mll-lab-nu/MindTopo
数据集入口
https://huggingface.co/datasets/MLL-Lab/MindTOPO
十二、局限:这个0分很重要,但别把它扩大成“世界模型都不行”
第一,场景是程序化渲染。干净背景和规则化物体带来可靠真值,也削弱了真实世界中的纹理、遮挡、光照和传感噪声。真实任务会更难,但也可能提供更多语义先验,不能直接按同一比例外推。
第二,视频策略只覆盖论文选择的三类生成模型与三个规划环境。1,560条轨迹足以揭示严重问题,却不足以证明所有视频生成路线必然失败。未来模型若加入显式状态、动作条件、物理约束或外部校验器,结果可能明显不同。
第三,过程检查依赖视觉解析器。论文用180条视频做人审,抽样中的视频级指标判断全部一致,但严格条件几乎总失败,因此“有效轨迹会不会被误杀”仍缺少足够阳性样本。论文也明确指出,终点可解析门控的人审一致率是77.8%,没有拿它单独给生成器排名。
第四,五种性质并不穷尽拓扑空间。方向、组合变换下的连续形变、更高亏格曲面等都没有覆盖。MindTopo是基础体检表,不是拓扑学全集,更不是具身智能的最终考试。
十三、龙哥点评:真正稀缺的不是想象力,而是受约束的连续性
这篇论文最打动龙哥的,不是又多了一个排行榜,而是它把一个长期被演示视频遮住的问题摆到台面上:模型已经很会生成“像成功”的画面,却不一定会生成“从现实状态合法走到成功”的过程。
从工程角度看,智能体最难的部分往往不是第一步有多聪明,而是第二十步还记得第一步改变了什么。拓扑关系恰好适合做这类压力测试,因为它不容易被局部纹理和漂亮构图糊弄。绳子是否穿越、区域是否封闭、路径是否连续,都可以沿轨迹追责。
因此,MindTopo对“世界模型路线”不是泼冷水,而是提出更高的验收标准。想象未来有价值,但想象必须服从状态转移;视频能辅助规划,但视频必须保留动作造成的真实后果。下一阶段的突破,可能不是让模型画得更像,而是让它每一步都不能作弊。
对学生和研究者,这套基准也提供了一张清晰选题地图:感知定位可以研究结构化视觉抽取;动作规划可以研究约束搜索和滚动重规划;动态违规可以引入符号检查器、物理引擎或可验证状态;迁移不足则需要跨任务共享的拓扑表示,而不是继续背题型。
龙迷三问
一问:如果把每一步合法动作直接列给模型,规划分会不会大涨?
大概率会减少格式和非法动作错误,但仍不能自动解决长程死路、状态漂移与拓扑不变量保持。它能区分“动作空间没说明白”和“模型真的不会规划”。
二问:加一个符号求解器,是不是就不需要大模型了?
受控环境里,符号工具可能非常强;现实任务仍需要从图像中抽取正确状态,把自然语言目标翻译成约束,并处理噪声和变化。更可能的路线是大模型负责理解与协调,确定性工具负责验证与搜索。
三问:生成视频的过程有效率为0,还值得继续做视频世界模型吗?
值得,但不能再只用视觉质量和终点相似度自我安慰。应把动作条件、状态追踪、守恒约束和过程验证放进训练与评测,否则“会做梦”与“会预测世界”仍是两件事。
总结
MindTopo用11,030个实例、十三类程序化任务,把连续、分离、顺序、包围和打结五种拓扑性质放进统一评测;再用静态推理和闭环规划两层设计,测出基础模型“认得关系”与“按关系行动”之间的断层。
最强模型61.42%对人类97.87%,监督微调加强化学习能把2B模型的推理提高37.29个百分点,却只让规划增加6.13个百分点。更关键的是,1,560条生成轨迹里没有一条同时通过终点、静态和动态拓扑检查。
这篇论文给出的结论很朴素:真正的空间智能,不只是看懂一张图,而是在连续行动中始终知道什么可以变、什么绝不能变。如果你在做智能体、机器人、视频预测或世界模型,这套“过程不能作弊”的评测思想,比某一个榜单名次更值得带回项目。
本文依据论文官方版本、项目页、作者机构主页及公开代码与数据入口整理。
正文技术图与数据图均为依据论文公开事实独立绘制的原创示意,不复制论文原图或版式。
本文仅代表对论文公开版本的理解与工程判断,不替代同行评议。涉及指标、代码与数据使用,请以原论文及官方仓库最新说明为准。