← 返回 PaperDaily 视觉与图像

扫地机为啥老让你猜谜?最新研究教你机器人“说人话”

LED灯闪和机器人又扭头又说话,你更信哪个?这篇论文竟然在德国博物馆实地“抓”观众来做实验!结果既在意料之外,又在情理之中——视频里看着很清晰的信号,一到真实世界,效果直接打对折。下次家里扫地机对你狂闪红灯,你可要仔细琢磨一下它到底想干嘛了!

扫地机为啥老让你猜谜?最新研究教你机器人“说人话”
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
LED灯闪和机器人又扭头又说话,你更信哪个?这篇论文竟然在德国博物馆实地“抓”观众来做实验!结果既在意料之外,又在情理之中——视频里看着很清晰的信号,一到真实世界,效果直接打对折。下次家里扫地机对你狂闪红灯,你可要仔细琢磨一下它到底想干嘛了!


原论文信息如下:
论文标题:
Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies
发表日期:
2026年06月
发表单位:
Orebro University, Aalto University, Robert Bosch GmbH
原文链接:
https://arxiv.org/pdf/2606.24445v1.pdf

虚拟与现实的鸿沟:机器人如何“说人话”?

想象一下,你家那个圆滚滚的扫地机器人,突然在客厅中间停下来,对你狂闪红灯。你第一反应是什么?是“这哥们没电了”?还是“它是不是卡在电线上了”?又或者是“它想向我表白”?
这个看似搞笑的场景,其实暴露了一个非常严肃的行业问题:机器人到底该怎么跟人类“说人话”?
别笑,这可是个大问题。现在的工业标准(比如ISO 10218和ANSI/ITSDF B56.5-2019)基本都是“哑巴”标准——光告诉你机器人怎么动,没告诉你怎么跟人交流。这就导致了一个尴尬局面:机器人用的那些指示灯、闪烁的LED,全靠人类自己猜。
Fig. 1: 真实世界实验中,博物馆参观者正在观看机器人传达不同消息。
图1: 真实世界实验中,博物馆参观者正在观看机器人传达不同消息。
来自瑞典厄勒布鲁大学(Orebro University)、芬兰阿尔托大学(Aalto University)以及德国罗伯特·博世有限公司(Robert Bosch GmbH)的研究团队,干了一件相当硬核的事:他们不仅系统地比较了两种完全不同的机器人沟通方式,还亲自跑到慕尼黑的德意志博物馆(Deutsches Museum)里,拉了一百多号观众来做真人实验。
结果令人警醒:你在视频里看得明明白白的信号,一到真实世界,效果直接对折,甚至更低。 这中间的鸿沟,就是机器人与人沟通中最容易被忽视,也最致命的问题。

LED vs. 多方暗示:两种策略的“表达能力”对决

为了搞清楚这个问题,研究团队搭建了两套“表达能力”截然相反的沟通体系。这里要先解释一个概念:表达能力带宽 (Expressive Bandwidth, EB)。简单说,就是机器人用来“说话”的通道有多丰富。一条窄马路和一条八车道高速,能传递的信息量肯定不一样。
策略一:慢速(Slow) —— 简单粗暴的“灯语”
这套系统非常纯粹,完全依靠机器人底盘上的LED灯带进行单通道(unimodal)沟通。绿色常亮代表“正常”,黄色扫射代表“我要转弯”,红色闪烁代表“出错了”。成本低、皮实耐用,在工业环境里很常见。但问题在于,它的语义非常抽象,全靠人类去猜——比如红灯一亮,你到底是想让我别过来,还是自己出故障了?
策略二:高速(Shigh) —— 声情并茂的“多模态”表达
这套系统就“戏精”多了。它在机器人底盘上加了一个ARMoD模块(其实就是个NAO机器人脑袋和上半身),可以综合利用机器人凝视(gaze)、手势(gestures)和语音(speech) 三种通道进行多模态(multimodal)沟通。比如要向左转,它会先扭头看向左边,然后用手指着左边,嘴里还说一句“向左转”。
以下是两种策略针对同一消息的具体表现,大家可以直观感受一下差距:
图2(a): 闲逛状态。左侧:NAO采用节能坐姿(空闲模式)右侧:LED灯带显示稳定的绿色脉冲
图2(a): 闲逛状态。左侧:NAO采用节能坐姿(空闲模式)右侧:LED灯带显示稳定的绿色脉冲
图2(b): 注意请求。左侧:NAO挥动手臂并伴有语音右侧:LED灯带发出白色脉冲光
图2(b): 注意请求。左侧:NAO挥动手臂并伴有语音右侧:LED灯带发出白色脉冲光
图2(c): 转弯指示。左侧:NAO用凝视、语音和手势指明方向右侧:LED灯带发出黄色扫射光
图2(c): 转弯指示。左侧:NAO用凝视、语音和手势指明方向右侧:LED灯带发出黄色扫射光
图2(d): 错误状态。左侧:NAO摇头、使用手势并伴有语音右侧:LED灯带发出红色脉冲光
图2(d): 错误状态。左侧:NAO摇头、使用手势并伴有语音右侧:LED灯带发出红色脉冲光
图2(e): 障碍物。左侧:NAO使用指向手势和语音右侧:LED灯带发出常亮红色光指向障碍物
图2(e): 障碍物。左侧:NAO使用指向手势和语音右侧:LED灯带发出常亮红色光指向障碍物
从画面上看,高带宽策略Shigh简直就是个戏精,而低带宽策略Slow就像一个三棍子打不出个屁来的闷葫芦。但问题是,哪种方式在实际场景中更有效?别急,实验会给我们答案。

五大消息的“表达困境”:从“闲逛”到“求救”

研究团队没有只挑好玩的信号来测,而是选取了服务机器人在公共空间中最常见的五种消息。这五种消息涵盖了从“我很好”到“救命”的全部状态:

1. 闲逛状态机器人无事可做,或者在规划下一步。这属于最基础的消息,告知人类“我没问题,我在呆着”。

2. 注意请求机器人需要人类帮忙,或者是想引起人的注意,比如“嘿,能帮我一下吗?”。这是一个需要打扰人类的主动信号。

3. 转弯指示机器人要告诉人类它接下来要去哪。比如“我要左转了,请让一让”。这个信号比较复杂,因为它涉及到空间和方向的判断。

4. 错误状态机器人内部出了严重故障,需要立刻让人知道。比如“我死机了,快来救我”。

5. 障碍物(求救)机器人被障碍物挡住了,需要人类帮它清除。比如“有东西挡着我了,麻烦帮我搬走”。

可以看到,这些消息的复杂程度有高有低。而如何用可读性(Legibility,指观察者能正确推断机器人意图的程度)直观性(Intuitiveness,指无需事先说明就能理解消息的容易程度)这两个维度来衡量,就是本研究的关键。

实验揭秘:为什么真实世界比视频更“难懂”?

研究团队的实验设计堪称严谨。他们先做了一轮线上调查(N=100),在受控环境下录制好所有信号的视频,让参与者通过屏幕来解读。然后,他们在德国慕尼黑的德意志博物馆进行了一场实地复制实验(N=139),邀请了真实的博物馆游客,在充满噪音、视觉干扰和分心因素的条件下,零距离观看机器人表演。
图3: 实验设置。蓝色箭头表示参观者的流动方向。几何形状表示机器人的起始位置:□用于错误和注意请求,□用于转弯指示,用于障碍物行为。
图3: 实验设置。蓝色箭头表示参观者的流动方向。几何形状表示机器人的起始位置:用于错误和注意请求,用于转弯指示,用于障碍物行为。
实验采用了Wizard-of-Oz(即“幕后遥控”)的设计,研究者躲在幕后用遥控器控制机器人的行为,确保每个信号都能精确、及时地触发。参与者则通过二维码在手机上填写问卷,回答两个核心问题:
1. “你觉得机器人想传达什么?”(解码正确率 → 可读性分数)
2. “理解这个信息有多难?”(1-5分打分 → 直观性分数)
结果相当炸裂。H1.1假设被完美证实:从线上到线下,可读性大幅下降。 线上调查的总体平均可读性分数是0.65(满分1.0),而到了真实博物馆,这个数字直接腰斩到0.35。其中的罪魁祸首就是LED灯语策略。
插图
H2假设同样被完美证实:高带宽的Shigh策略在几乎所有消息上都吊打低带宽的Slow策略。 尤其是面对“转弯指示”这种需要精确空间信息的复杂消息时,Shigh的准确率高达77%,而Slow只有可怜的33%。这就好比一个外国人在问路,你光用手势指一下(Slow),和你说“前面的路口右转”(Shigh),效果天差地别。
但有个有趣的例外:对于“错误状态”这种安全关键信息,两种策略的表现都很不错。 因为红色闪烁灯光(Slow)作为一种根深蒂固的文化约定,其语义非常明确,这个约定存在于全世界的交通信号和消费电子产品中。
下面这张图直观地展示了所有实验结果的对比:
图4: 两个实验中参与者给出的回答。上半部分:参与者认为解读消息的困难程度(直观性),范围从1-非常困难到5-非常容易。下半部分:可读性,即参与者正确解读“机器人传达了什么”的程度。
图4: 两个实验中参与者给出的回答。上半部分:参与者认为解读消息的困难程度(直观性),范围从1-非常困难到5-非常容易。下半部分:可读性,即参与者正确解读“机器人传达了什么”的程度。

设计启示:给机器人一张“会说会表情”的脸

这个实验的意义不仅在于验证了一个常识(有声有色的机器人更容易懂),更在于它提供了一个量化的、可操作的指导方针
研究团队最后提出了一个混合设计范式(hybrid design paradigm),即:
- 对于系统状态信息(如正常、错误、没电),可以使用简单、鲁棒的LED灯语。
- 对于意图表达信息(如我要干嘛、我需要你做什么),则需要动用多模态组合(手势+语音+凝视),提供高表达能力带宽。
简单说就是:该亮灯时亮灯,该说话时说话,别让人类去猜你的内心戏。
这个建议虽然听起来简单,但却戳中了很多商业机器人产品的痛点。你见过多少次清洁机器人在角落里疯狂转圈,然后狂闪红灯,你只能在旁边干瞪眼?又有多少次,你希望那个送餐机器人能直接告诉你“餐到了,请取餐”而不是发出令人困惑的电子音?
此外,该研究还揭示了一个重要的研究方法问题:我们不能依赖线上视频来做人机交互研究。 就像你永远无法通过抖音视频来真正体验一个景点的感觉一样,你也没办法通过屏幕来真正理解一个物理机器人在你面前用各种方式“骚扰”你是什么感受。未来,任何严肃的机器人“说人话”研究,都应该把“真实世界验证”作为标配。

总结与未来展望

总而言之,这篇论文用一个精心设计的对比实验,清晰地指出了一个事实:机器人的沟通设计不能想当然,不能把问题丢给用户去猜。未来,随着机器人越来越多地走进公共场所,那些能够用更自然、更明确、更具有人类常识的方式进行交流的机器人,才能真正赢得人类的信任,真正成为我们的伙伴,而不是一个会动的“谜语人”。
研究团队也指出了未来的工作方向。他们计划在后续研究中,对多模态信号中的单个因素(比如独立分析语音的作用)进行更精细的解耦分析。探索性的数据分析也表明,单独移除语音,会让可读性和直观性出现明显下降,这进一步说明了语音在复杂沟通中的重要性。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?这篇论文要解决的是移动服务机器人在与人共享空间时,如何“说人话”的问题。具体来说,他们比较了两种极端的方式:一种是用LED灯带这种很抽象的“灯语”,另一种是会用脑袋、手和嘴说人话的“多模态”方式。他们最核心的发现是:不能光在网上做视频测试,真实世界里的噪音和干扰会让机器人的沟通效果大打折扣,尤其是那个靠一闪一闪亮晶晶的LED灯!

文中的“可读性”和“直观性”具体是什么意思?“可读性”就是指你能不能猜对机器人到底想说啥。比如一个机器人狂闪红灯,你猜它是“出错了”并选了这个答案,那你的“可读性”就对了。“直观性”则是指你猜这个信息的时候费不费劲。如果你看完机器人的表演后觉得“这根本不用想就知道它在干嘛”,那“直观性”就高。如果还要拿着说明书对着一串闪烁灯猜半天,那“直观性”就低了。简单说,一个是“猜没猜对”,一个是“好不好猜”。

为什么要在博物馆做实验?有什么好处?因为真实场景太“脏”了。网上看视频,你安安静静坐在家里,整个画面上只有那一个孤零零的机器人在动,你100%的注意力都在它身上。但在博物馆里,周围有熊孩子跑来跑去,有大人叽叽喳喳聊天,有展品吸引你注意。你的注意力是被分割的,这是最真实的人机交互环境。所以博物馆实验能真正检验出,在设计稿上看着很棒的沟通方式,到了这种“野生”环境里还管不管用。事实证明,很多“花架子”一进野地就露馅了。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

研究设计巧妙,通过严谨的线上线下对比揭示了人机交互中的“虚拟-现实鸿沟”,但方法本身并不新颖,属于应用验证性研究。

实验合理度:★★★★★

实验设计堪称教科书级别。在真实世界场所(博物馆)进行重复实验,且样本量(N=100在线,N=139实地)非常充足,统计方法严谨(ANOVA、卡方检验、Bonferroni校正),结论可信度高。

学术研究价值:★★★★✰

为HRI领域的理论与实践研究提供了坚实的数据支撑和可复现的实验范式,特别是“在线VS实地”对比的研究模式非常值得借鉴。

稳定性:★★★✰✰

多模态策略Shigh在噪声环境下表现比LED更鲁棒,但远未达到理想的产品级稳定性,受环境光线、观众距离等影响较大。

适应性以及泛化能力:★★★✰✰

研究仅针对服务机器人场景和五种预设消息,未涉及更复杂或动态的任务。结论有启发,但直接迁移到了叉车、工业机器人等其他形态上需谨慎。

硬件需求及成本:★★★✰✰

高带宽Shigh策略需要在硬件上增加一个NAO机器人头,增加了成本和系统复杂度。低带宽Slow策略成本极低但效果也差,这是个两难选择。

复现难度:★★★✰✰

实验流程和问卷细节论文中描述很详细,但硬件(ARMoD模块和NAO)是特定平台,完全复现可能需要购买特定机器人。

产品化成熟度:★★✰✰✰

提供了设计原则,但离成熟产品还有距离。需要在具体产品的软件栈中实现类似的多模态沟通逻辑,并做大量工程化打磨。

可能的问题:论文验证了“多模态更好”这个结论,但并未探讨“好到什么地步才够用”。在成本敏感或极端环境下,也许80%正确的LED灯语已经足够,增加复杂性带来的边际收益需要权衡。


主要参考文献

[1] Schreiter, T., Ruppel, J., Rudenko, A., Magnusson, M., & Lilienthal, A. J. (2026). Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies. arXiv preprint arXiv:2606.24445.
[2] Dragan, A. D., Lee, K. C. T., & Srinivasa, S. S. (2013). Legibility and predictability of robot motion. In 2013 8th ACM/IEEE International Conference on Human-Robot Interaction (HRI).
[3] Kunold, L., & Onnasch, L. (2023). It can not not communicate: A framework for intentional design of human-robot communication. ACM Transactions on Human-Robot Interaction, 12(4).

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人“光说话”还是“有表情”?龙哥都给你拆解清楚啦!觉得不过瘾,想第一时间抓住更多人机交互、自动驾驶、机器人前沿论文的精髓?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+奥迪+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。