← 返回 PaperDaily 视觉与图像

SpatialUAV来了:低空无人机空间智能,GPT-5也没跑多远

低空无人机不是“拍得清”就算懂空间,真正难的是跨视角、几何关系和运动理解。SpatialUAV把这件事拆成14类任务,结果很直接:主流模型离人类还差得不小。

SpatialUAV来了:低空无人机空间智能,GPT-5也没跑多远
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
低空无人机不是“拍得清”就算懂空间,真正难的是跨视角、几何关系和运动理解。SpatialUAV把这件事拆成14类任务,结果很直接:主流模型离人类还差得不小。


原论文信息如下:
论文标题:
SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.27876v1.pdf
开源代码链接:
https://github.com/Hyu-Zhang/SpatialUAV
项目链接:
https://github.com/Hyu-Zhang/SpatialUAV

低空无人机空间智能为何如此困难?

无人机看起来像“飞在天上的摄像头”,但真要让它理解空间关系,事情就立刻变味了。地面模型擅长识别“这是什么”,低空无人机更难的是回答“它在哪、离谁更近、从哪个角度看、下一步该往哪飞”。这不是多认几个物体的问题,而是要把视觉、几何、视角变化和运动意图一起算进去。
低空场景比普通图像更“刁钻”。一方面,俯视或斜视会带来明显的透视压缩,目标大小和距离不再直观;另一方面,地面与空中视角经常不一致,同一地点在两种视角下长得像两位亲戚,能认出来都算本事。再加上遮挡、尺度变化、视频中的视角转动和无人机自身运动,很多模型一到这里就开始“脑子打结”。
图1:无人机视频中的运动理解示例
图1:无人机视频中的运动理解示例。任务不只是“看见了什么”,还要描述无人机如何移动、相机角度如何变化、主体如何在画面中迁移,最后视线落到哪里。
这篇论文的核心判断很直接:现有无人机基准大多还停留在图像识别、单视角问答,或者少量局部任务上,真正能系统测出三维空间推理、多视角协作、场景动态理解的评估还不够。于是,SpatialUAV 被做出来了,目标不是再给模型刷一张“看图说话”的试卷,而是把低空无人机空间智能拆成一套更像实战的体检单。
表1:SpatialUAV与代表性基准的对比
表1:SpatialUAV与代表性基准的对比。它的区别不只是样本更多,而是任务类型更细、输入配置更多、答案格式更杂,专门针对低空无人机的真实难点来设计。

SpatialUAV基准:填补无人机评估空白

SpatialUAV 不是简单收集了一批无人机图片,而是把真实低空无人机场景整理成一个统一的视觉输入—问题—答案框架。论文把每个样本表示为 $(\mathcal{V},\tau,q,y^*)$:$\mathcal{V}$ 是按顺序排列的视觉输入,$\tau$ 是 14 类任务之一,$q$ 是问题或指令,$y^*$ 是标准答案。说人话就是:不管是单图、双图、候选视角列表,还是视频帧,最后都要统一进一套评测协议里,避免模型“换个答题格式就装傻”。
图2:SpatialUAV整体构建流程
图2:SpatialUAV整体构建流程。数据先从真实低空无人机资源中收集,再按任务类型合成问答样本,随后做标准化、盲过滤和多轮验证,最后形成可评测的基准。
这个基准最值得说的地方,不是“有多少样本”,而是“怎么保证样本真在测空间智能”。论文的数据管线用了几层保险。第一层是检测器辅助区域标注和深度监督;第二层是结合元数据规则生成答案,比如视角对应关系、相机轨迹、区域映射;第三层是大量人工标注和盲过滤,连只看文本都能猜对的样本都要剔除,防止模型靠语言捷径混过去。这里的盲过滤还用了 DeepSeek-V4-Pro 和 Qwen3.6-27B:如果模型不看图就能答对,说明题目太“送分”,直接删掉。
图3:SpatialUAV任务分布图
图3:SpatialUAV任务分布图。内圈是主要推理组,外圈是细粒度任务类型,覆盖语义判别、空间关系、空中—空中协作、空中—地面协作和运动理解五大方向。
图4:SpatialUAV答案格式分布图
图4:SpatialUAV答案格式分布图。它不是只有选择题,还包括区域编号、区域对、边界框、几何值、方向标签和自由文本描述等九种答案格式,专门卡住模型的“格式适应能力”。
从样本构成看,SpatialUAV 一共 4,331 个实例,包含 1,315 个单图样本、1,231 个空中—空中样本、785 个空中—地面样本和 1,000 个视频运动样本。规模不算那种“吓人”的大基准,但胜在诊断维度够细,测的不是单一能力,而是低空无人机空间智能的一整套短板。
表2:SpatialUAV的任务设计摘要
表2:SpatialUAV的任务设计摘要。不同任务对应不同输入形式、问题构造方式和答案来源,确保每类能力都能被单独测出来。

14种任务全面检测VLMs的空间能力

SpatialUAV 的任务设计很像一场“空间能力大考”。它不是把所有问题混成一锅粥,而是分成四个大方向、14 个细任务,让模型暴露出到底是看不懂、连不起来、算不准,还是讲不清
第一类是语义判别,包括区域识别和异常检测。前者要求模型从检测到的区域中找出目标对应的区域编号,后者要识别异常或安全风险区域。别看这两项像基础题,实际上它们是后面所有空间推理的地基:连“哪个区域是哪个”都搞不清,后面的方向、距离、协作就全是空中楼阁。
第二类是空间关系,包括方向识别和距离比较。方向识别要求给定无人机朝向,判断目标在“几点钟方向”;距离比较则要结合深度估计判断哪个区域更近。这里论文还引入了 Metric3D 的深度估计结果来构造距离标签,Metric3D 的作用可以理解为“给二维图像补一点三维感”。
图5:方向识别示例
图5:方向识别示例。给定无人机前向方向后,模型要判断目标在几时方向,这类题对空间方位感要求很高,纯识别模型很容易翻车。
第三类是空中—空中协作,重点看多视角之间能不能对上号。这里包括协作视角识别、共享关联、目标匹配、相机变换、遮挡去除。简单说,就是两张空中图像是不是同一片地方,不同视角里同一目标怎么对应,某个点被挡住了该找谁来补信息。这个组最能体现无人机的现实难题:单视角看到的永远只是局部,多视角协同才是正经活儿。
图6:空中—地面共享关联示例
图6:空中—地面共享关联示例。要从空中图和地面图里找出同一片区域,考验的是跨视角对齐能力,而不是单纯的物体识别。
第四类是空中—地面协作和运动理解,包括视角翻译、路径规划、全球运动理解。前两者一个要把地面位置映射到空中视角,一个要决定从地面位置该往哪走才能到目标区域;最后一个则直接看视频,描述无人机怎么飞、相机怎么转、主体怎么变化。这里的 Global Motion 不是“看视频讲故事”,而是要按时间顺序描述运动过程,英文全称就是 Global Motion,中文可理解为全局运动理解
图7:空中—空中协作中的共享区域对齐示例
图7:空中—空中协作中的共享区域对齐示例。两个无人机视角都在看同一地区,但角度、尺度和遮挡都不同,模型必须先“认亲”再“对齐”。
图8:空中—空中视角翻译示例
图8:空中—空中视角翻译示例。任务不仅要找共享区域,还要推断两个视角之间的朝向偏移和相对位置变化。
图9:目标匹配示例
图9:目标匹配示例。模型要在不同视角里找到对应区域,考验的是跨图一致性而不是局部纹理记忆。
图10:遮挡去除示例
图10:遮挡去除示例。一个视角里看不见的目标,要靠另一视角中的遮挡体去反推,属于典型的“看不全还得猜对”的任务。
图11:相机变换示例
图11:相机变换示例。这里要输出对齐后的朝向偏移角和相对平移距离,已经不是“看图猜词”,而是往几何推理靠了。
图12:路径规划示例
图12:路径规划示例。任务要求根据空中图和地面起点,判断应该往哪个方向移动才能到达目标区域,已经开始接近“导航决策”了。
图13:全球运动理解示例
图13:全球运动理解示例。视频里要按时间顺序描述无人机如何移动、相机如何转动、主体如何变化,最后关注点落到哪里,属于典型的时序空间理解。
公式1:SpatialUAV的统一评分形式
公式1:SpatialUAV的统一评分形式。这里的 $N$ 表示样本数,$s_i$ 表示第 $i$ 个样本的得分,最后用 $100\times N^{-1}\sum_i s_i$ 统一换算成百分制,便于不同任务横向比较。
公式2:准确率型任务的打分方式
公式2:准确率型任务的打分方式。若预测答案 $\hat{y}$ 与真值 $y$ 一致,则 $s_i=1$,否则为 0,适合区域识别、方向识别等离散答案任务。
公式3:区域匹配任务的F1评分
公式3:区域匹配任务的 F1 评分。这里 $P$ 是精确率,$R$ 是召回率,$m$ 是正确匹配数量,$|\hat{\mathcal{P}}|$ 和 $|\mathcal{P}|$ 分别表示预测集合和真值集合的大小,适合共享关联这类多目标输出。
公式4:自由文本运动描述的相似度评分
公式4:自由文本运动描述的相似度评分。$s_i=\mathrm{LLM\_Sim}(\hat{t},t)$ 表示用大模型相似度来衡量预测文本 $\hat{t}$ 与参考文本 $t$ 的一致性,适合 Global Motion 这类开放式描述任务。

实验结果:当前模型与人类的巨大差距

实验部分的结论并不绕弯子:当前主流视觉语言模型在 SpatialUAV 上离人类水平还有明显差距。论文评测了 18 个代表性模型,覆盖闭源模型、空间专用模型和开源模型,结果显示,模型在基础识别任务上还能凑合,但一碰到跨视角关联、结构化定位、几何推理和时序运动理解,就开始明显掉链子。
表3:代表性模型在SpatialUAV上的总体表现
表3:代表性模型在 SpatialUAV 上的总体表现。该表按任务维度汇总了不同模型的成绩,也给出了人类参考上限和随机基线。
从总体排名看,闭源模型仍然处在第一梯队,但也没有出现“碾压式”优势。开源大模型里,Qwen3.6-27B 的表现相对更稳,说明通用视觉语言能力确实有帮助;但一旦进入无人机专属空间任务,很多专用模型并没有因为名字里带“Spatial”就自动变强,甚至有些任务上还不如通用模型。这个结果挺现实:领域适配不是改个名字就能成,真功夫还是得看跨视角和几何推理
更值得注意的是,很多模型在单图语义任务上分数还行,一到多图协作就掉得比较厉害。也就是说,它们不是完全看不懂图,而是不会把两张图当成同一个空间世界来理解。这正是低空无人机最常见的真实需求:单张图像只能看到局部,实际任务却往往要求跨视角拼图、定位、对齐和决策。
图14:各推理组宏平均性能对比
图14:各推理组宏平均性能对比。识别类任务相对更容易,跨视角关联、几何变换和运动理解明显更难,是当前模型的主要瓶颈。
论文还做了一个很有意思的实验:把部分任务改成多选题后,模型分数会明显变化。这个现象说明,模型的真实能力和“答题格式”高度相关。换句话说,有些模型不是不会,只是在结构化输出上更容易暴露短板;而有些任务一旦改成选择题,模型就像突然找到了台阶,分数能往上抬一点。但这并不代表能力真的提升了,只是输出门槛变低了。
图15:答案格式消融实验
图15:答案格式消融实验。原始结构化答案与多选题重构之间的差异,说明评测格式本身会显著影响模型得分,不能只看“答对没答对”。

瓶颈分析:跨视角关联与几何推理成关键

论文最后给出的诊断很清楚:低空无人机空间智能的主要瓶颈,不在“认物体”,而在跨视角关联、结构化定位、几何推理和时间维度理解。这几个环节一旦断掉,模型就会出现一种很典型的症状:单张图能说两句,双图就开始乱配对,视频就只能看热闹。
为什么会这样?因为低空无人机任务本质上不是“图像分类题”,而是“空间推理题”。模型需要先知道不同视角是否在同一个空间里,再把区域、物体、相机位姿和运动轨迹联系起来,最后才能做判断。这个过程很像在脑子里搭一个临时三维地图,但现有模型往往只会背局部特征,不太会搭地图。
表4:高分辨率输入消融实验
表4:高分辨率输入消融实验。放大图像 token 预算后,方向识别和空中—地面共享关联会有一定变化,但提升并不总是线性的,说明问题不只是“分辨率不够”,更是推理机制不够。
高分辨率输入实验也很有启发。单纯把图像放大,并不会把空间智能自动补齐。部分任务会受益,但收益有限,甚至不稳定。这说明低空无人机评测里真正的难点,不只是细节看不看得清,而是模型能不能把视觉细节转成几何关系、跨图对应和运动逻辑。简单说,分辨率能补像素,补不了脑子
表5:不同答案格式上的诊断性能
表5:不同答案格式上的诊断性能。模型在选择题和离散标签上通常更稳,但一到边界框、区域列表、自由文本描述,就更容易暴露结构化输出和语义对齐问题。
这篇工作真正有价值的地方,是它没有把问题说成“无人机模型还不够大”,而是很明确地指出:当前模型缺的是面向低空场景的空间建模能力。SpatialUAV 的意义,就在于把这个缺口变成了可测、可比、可复现的 benchmark。以后谁要说自己“懂无人机空间智能”,先过这 14 关再说,别只会在演示视频里挑最好看的那一帧。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它不是在做一个新的无人机模型,而是在做一个更难、更真实的评测基准。SpatialUAV 主要解决的是“现有无人机 benchmark 测不出空间智能真本事”的问题,尤其是跨视角协作、几何推理和运动理解这些关键能力。

文中的 7 种输入配置和 9 种答案格式是什么意思?7 种输入配置指单图、双图、候选视角、视频等不同视觉输入形态;9 种答案格式则包括选项、区域编号、区域对、边界框、几何数值、方向标签和自由文本等。它们的作用是让评测更贴近真实任务,而不是只测一种“标准答案模板”。

为什么模型在这套基准上会掉得这么明显?因为 SpatialUAV 测的是跨视角关联、结构化定位和时序运动理解,这些能力很难靠单张图的局部特征蒙混过关。模型如果没有真正的空间建模机制,就会在多视角对齐和几何关系上暴露短板。

如果还有想进一步了解的地方,欢迎在评论区继续讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇工作新意不在模型结构,而在评测范式。把低空无人机空间智能拆成 14 类任务、7 种输入、9 种输出,确实比老一套“看图问答”更像回事。

实验合理度:★★★★☆ 盲过滤、人工复核、模型反查都做了,评测也覆盖了多种模型和任务类型,整体比较扎实。唯一的代价是基准越细,解释成本越高,但这是必要代价。

学术研究价值:★★★★☆ 对低空无人机空间智能研究很有价值,尤其适合作为后续模型改进和对比实验的统一尺子。它把“无人机到底难在哪”这件事讲清楚了。

稳定性:★★★☆☆ 作为 benchmark 本身比较稳定,但它依赖标注质量、视角配对和任务设计,后续扩展到更多场景时仍要防止数据偏差。

适应性以及泛化能力:★★★★☆ 任务覆盖面不错,能诊断不同类型空间能力,但场景仍集中在真实低空无人机数据,跨城市、跨天气、跨传感器的泛化还需要进一步验证。

硬件需求及成本:★★★★☆ 作为基准评测,推理成本不算离谱,主要开销在多图、多帧和高分辨率输入上。相比训练大模型,这类成本更适合普通研究团队承受。

复现难度:★★★★☆ 代码和数据都开源了,复现门槛不算高;但任务类型多、答案格式杂,做完整复现还是需要认真读规则,不然很容易把评测跑歪。

产品化成熟度:★★★☆☆ 作为评测基准已经比较成熟,但它本身不是直接上产品的算法。对无人机感知、协同和导航系统有明确参考价值,离端到端落地还差模型能力补齐。

可能的问题:基准做得细,但也意味着任务设计和标注成本高;此外,当前结论更多是在“模型不行”的层面,后续还需要更系统地回答“什么架构真正能把这些能力补上”。


主要参考文献

[1] Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie. SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion. arXiv:2606.27876v1, 2026.
[2] SpatialUAV 项目主页与代码:https://github.com/Hyu-Zhang/SpatialUAV

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
低空无人机、空间推理、视觉语言模型,想少走弯路就来群里一起拆。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。