LandmarkLens在混合现实街景环境中高亮导航相关地标。彩色圆圈标记预测的地标;方向箭头引导用户关注视野之外的高亮物体。要让人工智能学会“教人认路”,第一步得搞清楚:认路高手和路痴在路上看东西的方式到底有什么本质区别。这个问题听起来简单,但过去的研究大多停留在问卷调查和口头报告层面——让人回忆“你刚才看到什么了”,结果往往掺杂了大量事后加工和记忆偏差。LandmarkLens的作者做了一个更狠的实验设计:在虚拟现实里让参与者真实走一遍东京街头,同时用眼动仪记录他们每一帧在看哪里,全程录音捕捉他们嘴里说出了什么。实验招募了20名参与者,按照圣塔芭芭拉方向感量表(Santa Barbara Sense-of-Direction Scale,简称SBSOD,一个被广泛使用的自我报告式导航能力评估工具,满分7分)分成两组:10名方向感好的人(平均6.0分)和10名方向感差的人(平均2.9分)。他们在定制的VR街景导航系统中走完8条路线,覆盖东京四个典型街区——根津的下町风情、高圆寺的本地生活气息、银座的办公楼丛林、锦丝町的商业喧嚣。系统跑在三星Galaxy XR头显上,每只眼睛3552×3840分辨率,内置四颗眼动追踪摄像头,以72Hz的采样率记录注视点、头部位姿和操作事件,语音则通过外接麦克风全程录制。用于地标注意力研究的定制VR街景导航系统。方向箭头指示可用的移动选项,交叉口处会出现转弯通知。数据分析的结果相当有说服力。研究者从约165万条注视样本中提取出四个维度的眼动指标:注视分布广度、注视频率、注视时长、头部转动幅度。方向感好的组在总体注视广度上显著大于方向感差的组,这个差异主要由水平方向的注视广度贡献,垂直方向则没有显著区别。更有意思的是头部转动的差异:方向感好的人头部偏航角的标准差达到36.0度,方向感差的人只有28.2度——高手们不只是眼睛更“贪心”,整个头都在主动转动,去扫视更宽阔的街景。而注视频率和注视时长两组没有显著差异,说明差异不在于“看得多仔细”,而在于“看得多开阔”。图3:各组不同的注视模式示例。方向感好的导航者关注(A)指路标志和(B)永久性商店标识。方向感差的导航者注视(C)菜单和临时标牌。(D)方向感好的导航者转头注视作为全局地标的东京晴空塔;方向感差的导航者则没有。如果说眼动数据揭示了“看哪里”,那么口述数据则揭示了“记什么”。研究者对参与者的口头描述进行了混合演绎-归纳式编码,总共标注了1009条来自方向感好组的地标提及和1170条来自方向感差组的提及。两组人最常提到的都是非住宅建筑,但关键差异出现在其他类别上:方向感好的人明显更多提及指路标志(占比5.8%对比1.8%)和永久性商店标识,而方向感差的人则更频繁提到装饰性元素(3.5%对比0.5%)、建筑物局部(2.5%对比0.6%)、行人(1.9%对比0.1%)、停放的单车(0.9%对比0.3%)以及不包含任何位置信息的通用标牌(2.6%对比0.7%)。最令人印象深刻的发现来自银座的一个场景:两组人注视着同一张竞选海报,反应却截然相反。方向感好的A01参与者直接说:“我不需要提它,这海报以后会被撤掉。”而方向感差的A19参与者却说:“希望他们下次我来的时候别换掉这个活动。”两人都看到了海报,但一个人主动把它从空间记忆里过滤掉了,另一个人却把它编码了进去。这说明路痴和认路高手的差距不全在视觉感知层面,更在于一个评估过滤机制——高手会本能地判断哪些东西是“永久可用的导航线索”,哪些只是“路过即忘的临时噪音”。图4:注视分布概况。(A)等距柱状投影全景图上的2D热力图。(B)方位角分布及用于VLM裁剪范围的百分位边界。图5:各组注视、注视点和头部运动情况。方向感好的导航者的总体注视广度、水平注视广度和头部偏航变化显著更大。注视模式在各组间无显著差异。
从眼动数据到VLM提示词:地标预测流水线的四步设计
实验做完了,差异找到了,但怎么把这些发现变成能大规模落地的系统?总不能每次用导航都先拉20个人来做眼动实验吧。LandmarkLens的关键贡献之一,就是把上述实证研究发现翻译成了一条可自动运行的地标预测流水线。整个过程分四步:基于注视信息的图像裁剪、基于VLM的地标检测、基于嵌入向量的去重、以及二次验证。第一步是图像裁剪。原始的全景图片覆盖360度×180度的完整视野,但导航者实际把注意力集中在前进方向的一个子集上。如果整张图丢给检测模型,天、地面和身后的大片无关区域会稀释检测效果。研究者采用了一个聪明的做法:直接用方向感好的人的注视分布百分位边界来定义裁剪范围。具体来说,每张全景图先旋转到以行走方向为中心;在交叉口处,额外做半圈旋转,让裁剪区域同时覆盖接近方向和转弯方向的角平分线。基于90分位数的方位角区间,非交叉口裁剪到180度,交叉口放宽到270度。裁剪区域内部还有一个更窄的引导区域——基于75分位数区间,非交叉口90度、交叉口120度——用于在提示词中标记“优先检测区”。垂直高度则统一用95分位数的仰角区间。第二步是VLM检测。这里有个值得注意的设计决策:研究者一开始尝试过用DeepGaze模型在方向感好的人的注视热力图上做微调,希望用它预测“哪里显眼”。结果效果很糟糕,在锦丝町共同路线上的KL散度高达1.62,模型经常把路面和空墙高亮出来。根本原因在于,眼动实验已经证明了:真正区分高手和路痴的不是“看向哪里”,而是“觉得什么值得记”。这是一个语义层面的判断,像素级的显著性模型天然无法表达。于是研究者转向了视觉语言模型,使用Google Gemini 3.1 Pro Preview进行检测。提示词的设计直接来自实验中方向感好的人的口头描述策略——要求模型识别优先类别的导航地标,强调“在场景中的相对独特性”,比如一台自动贩卖机在安静的住宅街是强锚点,但在热闹的商业街上就不值一提。非交叉口图片每5张一组批量处理,每张最多检测2个地标;交叉口图片单独成组,允许每张最多3个地标。每次检测输出结构化JSON,包含边界框、描述、类别标签和导航上下文。图6:地标预测流水线:(1)基于注视信息的裁剪,(2)利用方向感好的导航者的语言策略进行VLM检测,(3)通过DINOv3进行基于嵌入向量的去重,(4)二次验证。第三步是去重。逐批次的提示词去重能减少一部分重复,但相邻批次之间仍然可能检测到同一个地标。研究者的方案是用DINOv3视觉编码器提取每个检测框的图像嵌入特征,在相邻5帧的窗口内通过余弦相似度比较CLS token嵌入向量。相似度超过0.70的检测对被用并查集算法关联成组,每组只保留最早出现的那一次检测。每个路线段独立处理完毕后再跨段边界做一次额外的匹配,确保同一个地标在整条路线上只出现一次。第四步是二次验证。每个剩余检测的边界框区域会被裁剪出来,加上1.5倍缓冲区,并覆盖一个半透明矩形标记原始检测区域,然后单独发送给Gemini。验证提示词要求模型确认四件事:描述的对象确实在裁剪区域中可见、类别和边界框指的是同一个真实物体、该物体是永久性的而非临时性的、其视觉独特性足以作为地标。提示词里还包含了明确的排除清单——路灯、交通标志、护栏、电线杆这类通用市政设施,以及横幅、旗帜这类临时特征,通通不要。图7:VLM检测结果示例。在(A)和(B)中,VLM检测与注视热点紧密重叠。在(C)和(D)中,未匹配的注视热点对应商店内部、停放车辆和人行道等物体——这些特征吸引了视觉注意,但从未出现在参与者的口头地标描述中。整个流水线的成本控制也值得一提。平均每张全景图处理时间约8秒,例如评估路线B包含67张全景图,总共耗时9.2分钟,成本仅1.77美元。这个量级对于离线预处理一条导航路线来说完全在可接受范围内。研究者还与真实数据进行了一次对比评估,验证流水线的输出是否真的对应方向感好的人会关注的地标。表1:VLM流水线相对于真实数据的评估结果。
[1] Li C, Sechayk Y, Froehlich J E, et al. LandmarkLens: Predicting and Presenting Effective Landmarks for Mixed-Reality Urban Exploration. arXiv:2608.30142v1, 2026.[2] Siegel A W, White S H. The development of spatial representations of large-scale environments. Advances in Child Development and Behavior, 1975.[3] Hegarty M, Richardson A E, Montello D R, et al. Development of a self-report measure of environmental spatial ability. Intelligence, 2002.[4] Wen W, Ishikawa T, Sato T. Working memory in spatial knowledge acquisition: A study of individual differences in learning from virtual environments. Computers & Education, 2013.[5] Ishikawa T, Nakamura T. Landmark selection in the environment: Relationships with object characteristics and sense of direction. Spatial Cognition & Computation, 2012.[6] LandmarkLens开源代码与数据集: https://github.com/makeabilitylab/landmarklens