← 返回 PaperDaily 视觉与图像

真实商店实测:非语言动作让机器人多接住15.3%对话

这篇论文最有意思的地方,不是把机器人“说得更像人”,而是先承认一件很现实的事:顾客很多时候根本没开口,机器人却已经该接话了。15.3%的回应由无声动作触发,这个数字很扎眼,也很适合拿来反思纯语音对话系统的盲区。

真实商店实测:非语言动作让机器人多接住15.3%对话
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是把机器人“说得更像人”,而是先承认一件很现实的事:顾客很多时候根本没开口,机器人却已经该接话了。15.3%的回应由无声动作触发,这个数字很扎眼,也很适合拿来反思纯语音对话系统的盲区。


原论文信息如下:
论文标题:
Breaking the $15\%$ Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues
发表日期: 2026年07月
发表单位: 大阪大学
原文链接: https://arxiv.org/pdf/2607.11633v1.pdf

打破15%沉默:从真实商店数据看人机交互的新切口

服务机器人最容易被忽视的一个事实是:顾客并不总是先开口,很多时候是先走近、挥手、指点、展示商品,机器人如果只盯着语音,就会错过一半以上的“接话时机”。这篇论文最有意思的地方,不是把机器人说得更像人,而是先把一个很现实的问题摆上桌面:纯语音对话系统,天然看不见用户的无声动作
封面:真实商店中的远程控制机器人、非语言行为分析与主动对话系统
封面:真实商店中的远程控制机器人、非语言行为分析与主动对话系统
龙哥导读:这项工作真正值钱的地方,不在“机器人会不会聊天”,而在“机器人能不能在顾客还没开口时,就猜到对方想干什么”。15.3%这个数字很扎眼,说明商店里的对话并不是纯文本流水线,而是被动作、距离、目光和手势不断打断、触发、修正的。

3小时隐藏数据:15.3%的机器人对话竟由“无声”动作触发

论文先做了一件很朴素、也很关键的事:把机器人放进真实商店里跑了6天,总计32小时,其中1小时42分钟的互动被逐条标注。结果发现,在2178句机器人发言里,有334句不是由顾客说话触发的,而是由顾客的非语言行为触发的,占比15.3%。这个比例不算夸张,但足够说明问题:如果系统只看语音,就会漏掉一批本该主动接上的对话。
图2:商店中的数据采集设置,操作者通过后置摄像头观察并控制机器人的语音、手势和视线行为
图2:商店中的数据采集设置,操作者通过后置摄像头观察并控制机器人的语音、手势和视线行为
这类数据的价值在于“真实”。实验室里大家都知道该怎么走流程,但商店里顾客会边走边看、边看边问、边问边掏东西,甚至会先站远一点观察,等机器人主动搭话再决定要不要继续。论文把这些行为统称为可观察的非语言线索,包括接近、离开、挥手、点头、指向、展示商品、看向机器人、与同伴交互、触碰随身物品等。说白了,顾客不是在演戏,而是在用身体写提示词。
表1:按非语言行为类别统计的计数与占比
表1:按非语言行为类别统计的计数与占比
从统计上看,最常见的触发动作是接近远处观察挥手。这很符合直觉:顾客往往先靠近,再决定是否互动;而机器人如果等到“您好,请问……”才开始反应,很多机会早就跑了。更值得注意的是,论文没有把所有能想到的行为都塞进系统,而是从21种行为里挑出9种最重要、最适合实时识别的类别,为后续工程实现收敛了范围。
表2:非语言触发发言的意图类别统计
表2:非语言触发发言的意图类别统计
这些被触发的发言,又被整理成四类核心意图:社交与问候任务信息与指令用户状态评论与共情互动邀请。其中社交问候最多,说明很多时候机器人主动开口并不是因为“任务到了”,而是因为“气氛到了”。这类分类看起来简单,实际上很重要:只有先知道机器人在什么场景下说了什么,后面才有可能把动作和语言真正对上号。

从21种行为中精选9种关键线索,打造实时多标签识别引擎

真正的难点不是“看见动作”,而是“在多人场景里,快速判断每个人正在做什么”。论文把这个问题定义成一个多标签、多人、实时的识别任务:输入是一段视频和每个人的边界框序列,输出是每个人对应的多个非语言行为标签。这个定义很贴近商店现场,因为顾客可能同时做出多个动作,比如一边靠近、一边挥手,或者一边看机器人、一边和同伴商量。
图3:用户非语言行为识别的整体架构
图3:用户非语言行为识别的整体架构
公式:视频经过特征提取得到全局视觉表示
公式:视频经过特征提取得到全局视觉表示。这里的 f = φ(X) 表示把输入视频片段 X 送进预训练视觉编码器 φ,得到 N 个 token、每个 token 维度为 D 的特征。说人话就是:先把整段视频压成一组“场景摘要”。
公式:每个人的边界框序列按帧拼接
公式:每个人的边界框序列按帧拼接。b̃i 是第 i 个人在 T 帧中的位置序列,形状是 T×4,四个数分别表示位置和尺寸。这里先把框坐标按图像大小归一化,避免不同分辨率把模型搞晕。
公式:位置序列经过MLP得到时序位置特征
公式:位置序列经过 MLP 得到时序位置特征。pi = ψ(b̃i) 表示把第 i 个人的轨迹喂给一个共享的多层感知机,提取出位置相关的表示。这里的关键不是“识别人体姿态”那种重模型,而是先把“人在哪儿、怎么移动”编码出来。
接下来,论文用一个很聪明但不花哨的操作把“场景特征”和“位置特征”合起来:用逐元素乘法做门控。这样做的意思很直白——同样一帧画面,机器人只需要关心和某个顾客相关的那部分信息,而不是把全场都看成一锅粥。
公式:场景特征与位置特征逐元素融合
公式:场景特征与位置特征逐元素融合。hi = f ⊙ pi 的作用是把通用视觉表示“掰”到第 i 个人身上。这个设计很实用,因为商店里多个人同时出现时,模型必须知道“谁在做动作”,而不是只知道“画面里发生了动作”。
再往后,模型用一个可学习查询向量和 cross-attention 做汇聚,最后输出每个行为的多标签概率。它的好处是,不用为每个动作硬写一套规则,而是让模型自己从视频里学“哪些线索更像挥手,哪些线索更像展示商品”。损失函数也很朴素:二元交叉熵加上类别权重,原因也很现实——数据极不均衡,像“展示商品”“触碰随身物品”这类行为很少,不加权就容易被模型当空气。
公式:通过CrossAttn得到每个人的表示
公式:通过 CrossAttn 得到每个人的表示。zi = CrossAttn(q, hi) 表示用查询 q 去从融合特征里“捞”出和第 i 个人最相关的信息。这个步骤相当于让模型先问一句:现在该盯谁?
公式:分类器输出每个行为的多标签概率
公式:分类器输出每个行为的多标签概率。si = g(zi) 再经过 sigmoid,就得到每个动作的独立概率。因为一个人可以同时“接近+挥手”,所以这里不能用单标签分类那套老办法。
公式:带类别权重的二元交叉熵损失
公式:带类别权重的二元交叉熵损失。这里用 wc = 1 / nc 给少数类更高权重,避免模型只会认“接近”“挥手”这种大户,结果把真正有价值的稀有动作全漏掉。
表4:非语言线索识别结果
表4:非语言线索识别结果
结果上,模型的微平均 F1 达到0.80,多数类别都能稳定识别;像“接近”“展示商品”这种动作幅度更明显、语义更清晰的类别表现更好,而“与同伴交互”这类更依赖上下文的行为就难一些。这个结论并不意外,但很说明问题:不是所有非语言行为都适合直接上系统,先挑那些高频、可见、服务相关的动作,才是能落地的路线。

让大模型“看懂”动作:用[挥手][指点]等令牌引导LLM生成上下文相关回应

识别出来只是第一步,真正难的是把这些动作变成机器人能说出口的话。论文没有走“每个动作写一条死规则”的老路,而是把识别到的非语言行为编码成提示令牌,比如[waved][pointed][showed_items],再把这些令牌连同对话历史一起喂给大语言模型,让它根据上下文生成回应。这个思路的好处是,系统既保留了大模型的语言灵活性,又把“看见了什么动作”这件事显式告诉了模型。
图4:由所提系统生成的理想交互流程
图4:由所提系统生成的理想交互流程
系统主干仍然是经典的级联式对话管线:先语音识别,再交给大模型生成回复,再语音合成。不同的是,非语言识别模块在旁边并行运行,一旦发现九类目标动作中的某一类,就把对应标签加进上下文。换句话说,LLM不再只听“人说了什么”,还会被提醒“人刚刚做了什么”。这一步看似只是多塞了几个 token,实际意义却很大,因为它把原本藏在视频里的行为信号,变成了语言模型可消费的文本上下文。
图5:意图分类结果,展示了生成内容与人工标注意图的对应关系
图5:意图分类结果,展示了生成内容与人工标注意图的对应关系
离线实验里,论文用真实数据中的334个非语言触发场景来测试生成效果。评价方式也很务实:不追求逐字复现操作者说了什么,而是看生成结果的意图是否和人工标签一致。这个设置比“比谁句子更像原文”更合理,因为服务机器人真正需要的是“说对事”,不是“抄作业”。结果显示,系统在高频社交线索上能较好匹配人工意图,尤其是接近、挥手、离开这类行为对应的问候和互动邀请,说明动作令牌确实起到了引导作用。
不过,论文也没有把话说满。对于更偏任务指令的稀有场景,比如顾客展示商品、触碰随身物品后希望机器人给出具体建议,系统还不够稳。这其实很正常:社交类回应有比较宽松的语言空间,而任务类回应对上下文和商品知识的依赖更强,单靠一个非语言令牌远远不够。换言之,这套方法更像是给大模型装上了“看动作的眼睛”,但还没把“懂商品、懂场景、懂任务流程”的脑子一次性补齐。

实时原型亮相:机器人如何识别你的动作并主动搭话?

这篇工作最可贵的地方,不只是提出了一个模型,而是给出了一个可在线运行的原型。识别器使用最近8帧形成滑动窗口,在不包含人检测和跟踪的情况下,推理速度约为8 FPS,已经满足论文定义的实时要求(至少1 FPS)。这意味着它不是只能离线跑分的“论文玩具”,而是确实朝着商店部署迈了一步。
更重要的是,论文还拿 Gemini 3.5 Flash 和 Gemini 3.5 Flash Lite 做了一个现实对照:把一段2秒视频描述出来,平均耗时分别是6.63秒和2.54秒,均超过1秒的响应预算。这个对比很说明问题:大模型能看视频,不代表适合实时服务。在服务机器人场景里,慢半拍往往就等于没反应,用户体验会直接掉线。
所以,这个原型的思路其实很清晰:用轻量识别器负责“快看动作”,用大模型负责“说人话”,必要时再用视觉语言模型补充“看见了什么商品”。这种分工很像商店里的真实协作方式——前台先判断顾客有没有在招呼,后面再决定该寒暄、该解释、还是该推荐。工程上不花哨,但很讲道理。

迈向下一代服务机器人:告别纯语音,拥抱多模态感官融合

这篇论文真正给行业的提醒是:服务机器人不该只听人说话,还得看人怎么说。在真实商店里,非语言行为不是装饰品,而是对话的起点、转折点和结束信号。把这些信号纳入系统后,机器人才有机会从“等人开口的机器”变成“会主动搭话的服务员”。
当然,这条路也不是没有坑。首先,当前识别只挑了9类行为,覆盖的是最常见、最容易检测的动作,离完整的人类行为理解还很远。其次,任务类回应仍然偏弱,说明“识别动作”和“生成合适回复”之间还有知识鸿沟。最后,真实部署还要面对摄像头视角变化、多人遮挡、门店布局变化和隐私合规等现实问题。论文已经把第一块砖铺得很稳,但离真正大规模落地,还得继续补系统工程。
如果把这项工作放到更大的趋势里看,它其实很像一个方向信号:未来的服务机器人不会只靠语音、也不会只靠大模型,而是会把视觉、动作、距离、商品状态和语言一起纳入决策。谁先把这些信号做成低成本、低延迟、可部署的系统,谁就更接近真正能在商店里干活的机器人,而不是实验室里会说漂亮话的展示机。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“服务机器人只听语音、听不见动作”的问题。论文先用真实商店数据证明,15.3%的机器人发言其实是由非语言行为触发的,再把这些动作做成可实时识别、可驱动回复的系统。

文中的[挥手][指点]这些令牌是什么意思?它们是把识别到的非语言行为转成文本提示的方式。比如检测到挥手,就把“[waved]”加到对话历史里,让大模型知道当前不是普通闲聊,而是有人在主动招呼。

这套方法为什么能work?因为它把“看动作”与“说话”拆成两个擅长的模块:轻量识别器负责实时感知,LLM负责生成自然语言。这样既保住了响应速度,又让回复能跟用户动作对上节奏,不至于像纯语音系统那样错过时机。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 不是凭空造一个新任务,而是把真实商店里的“无声触发”问题系统化了。创新点更偏工程整合与问题定义,胜在扎实。

实验合理度:★★★★☆ 先做真实场景统计,再做识别,再做生成,链路是顺的。尤其用真实商店数据和在线速度约束,比较符合部署逻辑。

学术研究价值:★★★★☆ 对服务机器人、HRI 和多模态对话都有启发。它提醒大家:行为识别不是为了好看,而是为了真正改变对话策略。

稳定性:★★★☆☆ 原型已经能实时跑,但任务类与稀有行为还不够稳。能做 demo,不等于能直接扛商店全天候部署。

适应性以及泛化能力:★★★☆☆ 方法思路可迁移,但行为集合和商店场景强相关。换个场地、换个机器人、换个文化环境,标签体系大概率要重调。

硬件需求及成本:★★★☆☆ 识别器本身不算重,但要有摄像头、跟踪、在线推理和对话系统协同。比纯语音贵一点,但比大模型直接看视频实时输出便宜得多。

复现难度:★★★☆☆ 数据是自采的真实商店互动,复现门槛不低。好在方法结构清楚,工程实现路径明确,适合做二次开发,不算玄学。

产品化成熟度:★★★☆☆ 在商店导购、迎宾、简单问询等场景有潜力,但还需要更稳的跟踪、更强的任务理解和更严格的隐私设计。

可能的问题:数据规模偏小、行为标签偏场景化,任务类生成还不够强。论文把“看动作”做对了,但“看懂动作后说对话”这一步还只是半成品。


主要参考文献

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira. Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues. arXiv:2607.11633v1, 2026.
原文链接:https://arxiv.org/pdf/2607.11633v1.pdf
项目与演示:暂无公开链接。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。