← 返回 PaperDaily
视觉与图像
ROBOVIS 2025新作:单帧预测人类多目标,CVAE还能生成多种走向
这篇工作最实用的地方,不是“猜一个目标”,而是直接给出 多个可能走向 。对机器人导航、人机协作和自动驾驶来说,这种“别把人想死板”的预测,才更像真实世界。
龙哥读论文
发布于 2026-08-23 00:20:06
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 这篇工作最实用的地方,不是“猜一个目标”,而是直接给出多个可能走向 。对机器人导航、人机协作和自动驾驶来说,这种“别把人想死板”的预测,才更像真实世界。
原论文信息如下:
预测人类运动目标,从单帧图像和姿态开始
人类走路这件事,看起来简单,实际上很“飘”。今天往左拐,明天往右走;看见椅子想坐,看到门又想出去。对机器人来说,这种不稳定不是小事,而是大事:预测错一步,后面的规划就可能跟着翻车。这篇论文盯住的就是这个痛点——不是只猜一个终点,而是从当前单帧场景图像 和人体姿态 出发,直接预测未来可能出现的多个运动目标 。
这事为什么重要?因为真实世界里,人类意图本来就不是单选题。机器人导航、家庭服务、商场导览、自动驾驶,最怕的不是“没看见人”,而是“把人看得太死板”。如果系统只给一个终点,往往会把不确定性硬压成确定性;而这篇工作更像是在说:别急着下注一个答案,先把可能性都摆上桌。
论文这里的关键点也很朴素:它不依赖“过去一长串轨迹”来猜未来,而是把当前场景 和当前人体姿态 当作主要线索。换句话说,它不是问“这个人刚才怎么走的”,而是问“这个人现在站在这个房间里,下一步最可能被哪些目标吸引”。这种思路更贴近真实交互:人会看环境、会看物体、会犹豫,也会临时改主意。
CVAE框架:从场景理解到多样化目标生成
这篇论文真正的“主菜”,是一个条件变分自编码器 。这里先把术语讲人话:变分自编码器 ,英文是 Variational Autoencoder, VAE ,中文通常叫“变分自编码器”;加上“条件”以后,就变成 Conditional Variational Autoencoder, CVAE ,中文是“条件变分自编码器”。它和普通自编码器最大的不同,不是只学一个压缩表示,而是学一个带随机性的潜空间 ,这样同一个输入就能采样出不同输出。
论文的输入很直接:一张当前 RGB 场景图像 S0 ,再加上当前人体关节点热图 HJ,0 。输出则不是一个点,而是未来时刻的目标热图 ĤG,T ,再进一步提取成多个候选目标区域和置信度。这里的 T 在文中设为 2 秒后,等于直接盯住“短视频里下一秒会去哪儿”这种对机器人更有用的时间尺度。
这套设计的聪明之处在于,它预测的不是“坐标点本身”,而是“目标区域的热图”。为什么要这么绕一圈?因为人类目标常常不是一个像素点,而是一块区域:门框附近、椅子前方、桌子旁边、走廊入口。直接回归一个坐标,模型很容易被标注误差和场景变化搞得头大;而热图更像“概率地图”,能把“哪里更像目标”这件事表达得更自然。
编码器部分学习的是后验分布,解码器则在条件 HJ,0 下生成未来目标热图。论文把潜变量维度设为 200 ,这不是随手拍脑袋,而是为了让潜空间有足够容量装下“场景复杂性”和“行为不确定性”。维度太小,模型装不下多种可能;维度太大,又容易把随机性变成噪声仓库。
温度缩放控制多样性:训练与推理的分离设计
这篇论文最有意思的地方,不只是“能生成多个答案”,而是它把训练 和推理 分得很清楚。训练阶段负责学会“什么样的目标在这个场景里合理”,推理阶段再通过温度缩放 把潜空间采样打开,生成多个候选目标。
这里的“温度”不是厨房里的火候,而是生成模型里控制随机性的旋钮。温度越高,采样越发散,结果越多样;温度越低,输出越保守,更接近单点预测。论文用的重参数技巧可以写成:
生成热图之后,论文还做了一步后处理:先从热图里找多个局部极大值,再用 非极大值抑制 ,英文是 Non-Maximum Suppression, NMS ,中文通常叫“非极大值抑制”。这个步骤在检测任务里很常见,作用是把重复、重叠的候选框压掉,只保留更靠谱的几个。这里它被拿来处理目标热图,思路很顺:热图里本来就可能有多个峰,直接取一个最大值太武断了,先把峰都找出来再筛一遍,更符合“多目标”的定义。
训练损失也比较干净:一个是 KL 散度 ,让潜变量分布别乱跑;另一个是 均方误差 ,英文是 Mean Squared Error, MSE ,中文叫“均方误差”,用来约束预测热图和真实热图尽量接近。论文没有直接回归坐标,而是对热图做 MSE,这样模型更容易学到“目标区域长什么样”,而不是死记一个点的位置。
这一点挺关键。因为现实里的门、椅子、桌子、走廊入口,本来就不是像素级精确到一个点的东西。用热图学习“区域特征”,比用单点监督更抗噪,也更容易跨场景泛化。论文甚至明确说了,目标热图是以躯干位置为中心生成的高斯区域,不需要人工标多个目标标签,这对数据标注成本很友好。
实验验证:超越基线,泛化至未知场景
实验部分的看点不在于“跑了很多表”,而在于它确实验证了三件事:第一,单帧场景 + 姿态就能做目标预测;第二,生成式采样能给出多个合理目标;第三,模型对没见过的场景也没有完全崩掉。这三件事里,第三件尤其重要,因为室内场景最怕的就是“换个房间就失灵”。
数据集用了两个:GTA-IM 和 PROX 。前者是合成室内运动数据,场景和行为更丰富;后者是真实世界数据,环境更拥挤、更杂乱,泛化难度更高。评价指标则是 最终位移误差 ,英文是 Final Displacement Error, FDE 。简单说,就是预测终点和真实终点之间差了多远,越小越好。
更有意思的是,论文还测了平均推理时间,结果大约是 43.8 毫秒 ,比基线还快一点。这个数字不算惊天动地,但对机器人在线部署来说很关键:预测再准,慢成 PPT 也没用。这个速度至少说明,它不是那种只会在离线实验里“演得很好”的模型。
消融实验也很诚实地说明了方法为什么能 work。潜空间维度太小,效果会掉;只看历史轨迹,概率预测就不行,因为模型会过拟合到最后一个轨迹点;只给躯干热图而不看完整人体信息,确定性还能凑合,概率多样性却出不来;把多峰处理去掉,误差也会明显变大。换句话说,这不是某一个模块单打独斗,而是场景、姿态、潜空间采样、多峰后处理 一起配合,才把多目标预测这件事做顺了。
不过这篇工作也没有装作自己无敌。论文明确承认,随机采样还没有完全控制到只落在真实分布里,坏样本依然会出现;另外,最终目标的选择还可以进一步结合历史轨迹做更稳的决策。这个态度比较像靠谱工程师:先把能跑的做出来,再承认哪里还差一口气。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“人下一步可能走向哪里”的多目标预测问题。和只输出一个终点不同,它根据当前场景图像和人体姿态,预测多个合理目标区域,更适合机器人导航和人机协作。
文中的 CVAE、温度缩放、NMS 分别是什么意思? CVAE 是条件变分自编码器,用来从潜空间生成多种未来目标;温度缩放是控制采样随机性的旋钮,温度越高越多样;NMS 是非极大值抑制,用来把热图里重复的候选峰值合并筛掉,留下更可靠的目标。
为什么它不用历史轨迹也能预测? 因为它把重点放在“当前场景里哪些位置像目标”上,而不是只盯着过去怎么走。历史轨迹当然有用,但在很多真实场景里,场景语义和人体姿态已经足够提供强线索;这篇方法的优势就在于更灵活,也更不依赖固定长度历史。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把“单目标预测”改成“场景感知的多目标生成”,思路不算玄学,但落点很实在,尤其是热图式目标建模和推理时多样化采样的组合,挺顺。
实验合理度: ★★★★☆。数据集、指标、消融都比较完整,而且还补了推理速度;不过基线数量不多,主要围绕 GoalNet 展开,横向对比的广度还可以再加一点。
学术研究价值: ★★★★☆。它对人类意图预测、人机协作和场景理解都有启发,尤其适合后续继续往机器人规划和社会导航里接。
稳定性: ★★★☆☆。确定性预测还算稳,但概率生成受温度和采样影响明显,坏样本仍然存在,不适合直接无脑上产品。
适应性以及泛化能力: ★★★★☆。对未见场景和未见互动目标有一定泛化,说明学到的不是死板模板,但离“到哪都稳”还差一步。
硬件需求及成本: ★★★★☆。训练用的是 GTX 1060,推理时间也只有 43.8ms,成本不高,比较像能落到边缘设备上的方案。
复现难度: ★★★★☆。代码公开,数据集和流程也交代得清楚,复现门槛不算高;真正麻烦的还是数据预处理和场景对齐。
产品化成熟度: ★★★☆☆。适合做机器人导航或辅助规划模块的研究原型,离稳定商用还需要更强的采样控制、失败检测和在线校准。
可能的问题: 多样性是有了,但样本筛选还不够聪明;如果场景极复杂或人体姿态检测不稳,预测质量会明显受影响。
主要参考文献
1. Qiaoyue Yang, Amadeus Weber, Magnus Jung, Ayoub AI-Hamadi, Sven Wachsmuth. Scene-aware Prediction of Diverse Human Movement Goals. arXiv:2606.29942v1, 2026.
2. 代码开源地址:https://github.com/Q-Y-Yang/DiverseGoalsPrediction
3. 原文链接:https://arxiv.org/pdf/2606.29942v1.pdf
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。