← 返回 PaperDaily 视觉与图像

ROBOVIS 2025新作:单帧预测人类多目标,CVAE还能生成多种走向

这篇工作最实用的地方,不是“猜一个目标”,而是直接给出 多个可能走向 。对机器人导航、人机协作和自动驾驶来说,这种“别把人想死板”的预测,才更像真实世界。

ROBOVIS 2025新作:单帧预测人类多目标,CVAE还能生成多种走向
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇工作最实用的地方,不是“猜一个目标”,而是直接给出多个可能走向。对机器人导航、人机协作和自动驾驶来说,这种“别把人想死板”的预测,才更像真实世界。


原论文信息如下:
论文标题:
Scene-aware Prediction of Diverse Human Movement Goals
发表日期:
2026年06月
发表单位:
COSY @ Home-Lab, Faculty of Technology, Bielefeld University; Institute for Information Technology and Communications (IIKT), Otto von Guericke University Magdeburg
原文链接:
https://arxiv.org/pdf/2606.29942v1.pdf
开源代码链接:
https://github.com/Q-Y-Yang/DiverseGoalsPrediction
项目链接:
https://github.com/Q-Y-Yang/DiverseGoalsPrediction

预测人类运动目标,从单帧图像和姿态开始

人类走路这件事,看起来简单,实际上很“飘”。今天往左拐,明天往右走;看见椅子想坐,看到门又想出去。对机器人来说,这种不稳定不是小事,而是大事:预测错一步,后面的规划就可能跟着翻车。这篇论文盯住的就是这个痛点——不是只猜一个终点,而是从当前单帧场景图像人体姿态出发,直接预测未来可能出现的多个运动目标
封面
图2:方法整体框架示意。编码器把场景图像和人体关节点热图压成潜变量,解码器再根据这个潜变量生成未来目标热图;推理阶段通过温度缩放采样,得到多个可能目标区域。
这事为什么重要?因为真实世界里,人类意图本来就不是单选题。机器人导航、家庭服务、商场导览、自动驾驶,最怕的不是“没看见人”,而是“把人看得太死板”。如果系统只给一个终点,往往会把不确定性硬压成确定性;而这篇工作更像是在说:别急着下注一个答案,先把可能性都摆上桌。
论文这里的关键点也很朴素:它不依赖“过去一长串轨迹”来猜未来,而是把当前场景当前人体姿态当作主要线索。换句话说,它不是问“这个人刚才怎么走的”,而是问“这个人现在站在这个房间里,下一步最可能被哪些目标吸引”。这种思路更贴近真实交互:人会看环境、会看物体、会犹豫,也会临时改主意。
图1
图1:未来可能的运动区域示意。人物可能直走到门口,也可能右转进入门附近,或者进入走廊,甚至向左侧走进走廊。单一轨迹预测在这里就很容易“猜偏”,多目标预测才更像真实人类。

CVAE框架:从场景理解到多样化目标生成

这篇论文真正的“主菜”,是一个条件变分自编码器。这里先把术语讲人话:变分自编码器,英文是 Variational Autoencoder, VAE,中文通常叫“变分自编码器”;加上“条件”以后,就变成 Conditional Variational Autoencoder, CVAE,中文是“条件变分自编码器”。它和普通自编码器最大的不同,不是只学一个压缩表示,而是学一个带随机性的潜空间,这样同一个输入就能采样出不同输出。
论文的输入很直接:一张当前 RGB 场景图像 S0,再加上当前人体关节点热图 HJ,0。输出则不是一个点,而是未来时刻的目标热图 ĤG,T,再进一步提取成多个候选目标区域和置信度。这里的 T 在文中设为 2 秒后,等于直接盯住“短视频里下一秒会去哪儿”这种对机器人更有用的时间尺度。
公式1
公式1:模型整体输出形式。意思很简单:给定当前场景和人体姿态,模型一次性预测未来多个运动目标 GTF,并给出对应置信度 CTF。这里的 F 表示要输出多少个候选目标。
图2
图2:CVAE方法流程。训练时,编码器把场景和人体姿态压到潜变量 z,解码器重建未来目标热图;推理时通过温度缩放从潜空间采样,生成多个不同但合理的目标区域。
这套设计的聪明之处在于,它预测的不是“坐标点本身”,而是“目标区域的热图”。为什么要这么绕一圈?因为人类目标常常不是一个像素点,而是一块区域:门框附近、椅子前方、桌子旁边、走廊入口。直接回归一个坐标,模型很容易被标注误差和场景变化搞得头大;而热图更像“概率地图”,能把“哪里更像目标”这件事表达得更自然。
编码器部分学习的是后验分布,解码器则在条件 HJ,0 下生成未来目标热图。论文把潜变量维度设为 200,这不是随手拍脑袋,而是为了让潜空间有足够容量装下“场景复杂性”和“行为不确定性”。维度太小,模型装不下多种可能;维度太大,又容易把随机性变成噪声仓库。
公式2
公式2:编码器与解码器的关系。编码器把当前场景和人体姿态映射到潜变量 z,解码器再在人体姿态条件下生成未来目标热图。这里的 z 服从高斯分布,方便训练时做随机采样。

温度缩放控制多样性:训练与推理的分离设计

这篇论文最有意思的地方,不只是“能生成多个答案”,而是它把训练推理分得很清楚。训练阶段负责学会“什么样的目标在这个场景里合理”,推理阶段再通过温度缩放把潜空间采样打开,生成多个候选目标。
这里的“温度”不是厨房里的火候,而是生成模型里控制随机性的旋钮。温度越高,采样越发散,结果越多样;温度越低,输出越保守,更接近单点预测。论文用的重参数技巧可以写成:
公式2重复不放
重参数化的核心含义是:先学出均值和方差,再往里面加一点噪声去采样。这样既保留生成能力,又能反向传播训练。论文里还提到,温度 τ 越高,候选目标越多样,但“坏样本”也会变多;这就像开车时把方向盘打得更灵,路线会更丰富,但偏航风险也会跟着上来。
生成热图之后,论文还做了一步后处理:先从热图里找多个局部极大值,再用 非极大值抑制,英文是 Non-Maximum Suppression, NMS,中文通常叫“非极大值抑制”。这个步骤在检测任务里很常见,作用是把重复、重叠的候选框压掉,只保留更靠谱的几个。这里它被拿来处理目标热图,思路很顺:热图里本来就可能有多个峰,直接取一个最大值太武断了,先把峰都找出来再筛一遍,更符合“多目标”的定义。
公式3
公式3:推理后处理流程。先从每个生成热图里取多个局部峰值,再经过 NMS 合并,最后输出多个目标点和置信度。它的目标很明确:不是只找一个“最可能”,而是把“多个都可能”变成可用结果。
训练损失也比较干净:一个是 KL 散度,让潜变量分布别乱跑;另一个是 均方误差,英文是 Mean Squared Error, MSE,中文叫“均方误差”,用来约束预测热图和真实热图尽量接近。论文没有直接回归坐标,而是对热图做 MSE,这样模型更容易学到“目标区域长什么样”,而不是死记一个点的位置。
这一点挺关键。因为现实里的门、椅子、桌子、走廊入口,本来就不是像素级精确到一个点的东西。用热图学习“区域特征”,比用单点监督更抗噪,也更容易跨场景泛化。论文甚至明确说了,目标热图是以躯干位置为中心生成的高斯区域,不需要人工标多个目标标签,这对数据标注成本很友好。

实验验证:超越基线,泛化至未知场景

实验部分的看点不在于“跑了很多表”,而在于它确实验证了三件事:第一,单帧场景 + 姿态就能做目标预测;第二,生成式采样能给出多个合理目标;第三,模型对没见过的场景也没有完全崩掉。这三件事里,第三件尤其重要,因为室内场景最怕的就是“换个房间就失灵”。
数据集用了两个:GTA-IMPROX。前者是合成室内运动数据,场景和行为更丰富;后者是真实世界数据,环境更拥挤、更杂乱,泛化难度更高。评价指标则是 最终位移误差,英文是 Final Displacement Error, FDE。简单说,就是预测终点和真实终点之间差了多远,越小越好。
公式4
公式4:平均最终位移误差 FDEavg。它统计每个样本上多个预测的平均误差,再对整个测试集求平均,更像是在看“整体预测质量稳不稳”。
公式5
公式5:最小最终位移误差 FDEmin。它会在多个预测里挑最接近真值的那个,更像是在看“至少有没有一个候选是靠谱的”。多模态预测常常会同时看这两个指标,一个看平均质量,一个看上限能力。
表1
表1:与基线方法相比的最终位移误差结果。可以看到,无论是在 GTA-IM 还是 PROX 上,这个方法在确定性预测和概率预测下都明显优于基线;而且随着采样次数增加,FDEmin 还会继续下降,说明多样化采样确实能捞到更准的目标。
更有意思的是,论文还测了平均推理时间,结果大约是 43.8 毫秒,比基线还快一点。这个数字不算惊天动地,但对机器人在线部署来说很关键:预测再准,慢成 PPT 也没用。这个速度至少说明,它不是那种只会在离线实验里“演得很好”的模型。
图8
图8:PROX 中未见场景的泛化效果。即使训练时没见过这些房间布局,模型仍然能给出比较合理的目标区域,比如走向门口、坐到椅子上,或者去床边。这说明它不是死记住某个房间模板,而是真的学到了一些场景语义。
消融实验也很诚实地说明了方法为什么能 work。潜空间维度太小,效果会掉;只看历史轨迹,概率预测就不行,因为模型会过拟合到最后一个轨迹点;只给躯干热图而不看完整人体信息,确定性还能凑合,概率多样性却出不来;把多峰处理去掉,误差也会明显变大。换句话说,这不是某一个模块单打独斗,而是场景、姿态、潜空间采样、多峰后处理一起配合,才把多目标预测这件事做顺了。
表3
表3:消融实验结果。去掉条件、去掉多峰、缩小潜空间,性能都会变差,尤其概率预测直接“没法生成”,这说明多样性不是靠嘴说出来的,是靠结构设计逼出来的。
表4
表4:温度参数对生成效果的影响。温度越高,多样性更强,但平均误差也会变大;最小误差相对稳定,说明模型仍能在一堆候选里保住几个好样本。这个结果很像现实中的“多想几个方案”,总会比只押一个答案更安全。
不过这篇工作也没有装作自己无敌。论文明确承认,随机采样还没有完全控制到只落在真实分布里,坏样本依然会出现;另外,最终目标的选择还可以进一步结合历史轨迹做更稳的决策。这个态度比较像靠谱工程师:先把能跑的做出来,再承认哪里还差一口气。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“人下一步可能走向哪里”的多目标预测问题。和只输出一个终点不同,它根据当前场景图像和人体姿态,预测多个合理目标区域,更适合机器人导航和人机协作。

文中的 CVAE、温度缩放、NMS 分别是什么意思?CVAE 是条件变分自编码器,用来从潜空间生成多种未来目标;温度缩放是控制采样随机性的旋钮,温度越高越多样;NMS 是非极大值抑制,用来把热图里重复的候选峰值合并筛掉,留下更可靠的目标。

为什么它不用历史轨迹也能预测?因为它把重点放在“当前场景里哪些位置像目标”上,而不是只盯着过去怎么走。历史轨迹当然有用,但在很多真实场景里,场景语义和人体姿态已经足够提供强线索;这篇方法的优势就在于更灵活,也更不依赖固定长度历史。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“单目标预测”改成“场景感知的多目标生成”,思路不算玄学,但落点很实在,尤其是热图式目标建模和推理时多样化采样的组合,挺顺。

实验合理度:★★★★☆。数据集、指标、消融都比较完整,而且还补了推理速度;不过基线数量不多,主要围绕 GoalNet 展开,横向对比的广度还可以再加一点。

学术研究价值:★★★★☆。它对人类意图预测、人机协作和场景理解都有启发,尤其适合后续继续往机器人规划和社会导航里接。

稳定性:★★★☆☆。确定性预测还算稳,但概率生成受温度和采样影响明显,坏样本仍然存在,不适合直接无脑上产品。

适应性以及泛化能力:★★★★☆。对未见场景和未见互动目标有一定泛化,说明学到的不是死板模板,但离“到哪都稳”还差一步。

硬件需求及成本:★★★★☆。训练用的是 GTX 1060,推理时间也只有 43.8ms,成本不高,比较像能落到边缘设备上的方案。

复现难度:★★★★☆。代码公开,数据集和流程也交代得清楚,复现门槛不算高;真正麻烦的还是数据预处理和场景对齐。

产品化成熟度:★★★☆☆。适合做机器人导航或辅助规划模块的研究原型,离稳定商用还需要更强的采样控制、失败检测和在线校准。

可能的问题:多样性是有了,但样本筛选还不够聪明;如果场景极复杂或人体姿态检测不稳,预测质量会明显受影响。


主要参考文献

1. Qiaoyue Yang, Amadeus Weber, Magnus Jung, Ayoub AI-Hamadi, Sven Wachsmuth. Scene-aware Prediction of Diverse Human Movement Goals. arXiv:2606.29942v1, 2026.
2. 代码开源地址:https://github.com/Q-Y-Yang/DiverseGoalsPrediction
3. 原文链接:https://arxiv.org/pdf/2606.29942v1.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。