← 返回 PaperDaily 大模型与智能体

CHI 2026新作:ExpressionCueLens拆解AI伴侣拟人化,跨文化差异一眼看懂

这篇论文最有意思的地方,不是又造了一个“拟人化”词典,而是把AI伴侣的社交媒体讨论拆成了能落地分析的十类表达。Reddit和小红书的差异也很直接:一个更像叙事复盘,一个更像情绪直播,文化和平台习惯真的会把“AI像不像人”这件事带偏。

CHI 2026新作:ExpressionCueLens拆解AI伴侣拟人化,跨文化差异一眼看懂
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又造了一个“拟人化”词典,而是把AI伴侣的社交媒体讨论拆成了能落地分析的十类表达。Reddit和小红书的差异也很直接:一个更像叙事复盘,一个更像情绪直播,文化和平台习惯真的会把“AI像不像人”这件事带偏。


原论文信息如下:
论文标题:
ExpressionCueLens: A Cross-Cultural Analysis of Human-AI Companion Conversations on Social Media
发表日期:
2026年07月
发表单位:
Carnegie Mellon University, Nanyang Technological University, The University of Tokyo
原文链接:
https://arxiv.org/pdf/2607.13924v1.pdf

AI伴侣不只是工具?社交媒体言论暴露新趋势

AI伴侣这几年最耐人寻味的变化,不是“能不能聊天”,而是“人们到底把它当成什么”。有的人把它当搜索框,有的人把它当树洞,还有人直接当成了会吃醋、会记得、会设边界的关系对象。ExpressionCueLens这篇论文做的事很有意思:它没有停留在“拟人化很重要”这种空话上,而是直接去社交媒体里抓真实讨论,看看人类到底是怎么把AI伴侣“说成人”的。
这类问题之所以值得盯紧,是因为它已经不再只是产品体验问题,而是人机关系如何被文化塑形的问题。Reddit上更像“事后复盘”,小红书上更像“现场直播”;一个偏叙事,一个偏情绪。表面看只是平台风格不同,往深处看,其实是文化、语言和社区规范共同决定了AI伴侣被赋予什么角色。
封面
图1:Reddit与小红书中的AI伴侣拟人化表达分布。论文一上来就把“文化差异”摆在台面上,不靠猜,直接看数据。

从Reddit到小红书:跨文化视角下的拟人化表达

这篇论文的样本来自两个典型平台:Reddit小红书。前者是英文论坛型社区,后者是中文社交平台,而且大量内容本身就是聊天截图。这个设计很聪明,因为它比较的不是“同一批人换个语言怎么说”,而是两种平台文化下,人们如何叙述和展示AI伴侣
这里有个很现实的工程细节:小红书里不少帖子是截图,得先做OCR(Optical Character Recognition,光学字符识别)才能进入分析流程。论文用的是Tesseract引擎,并且还让双语人工校验。别小看这一步,社交媒体文本里表情、口语、省略、错别字都不少,OCR一旦翻车,后面的统计就会像拿漏勺舀水,忙活半天全是空的。
论文最终处理的不是简单的“帖子数”,而是更细粒度的“消息/话轮”。这件事很关键,因为AI伴侣的拟人化往往不是在整篇长文里平均出现,而是藏在某一句“别难过了”“我记得上次你说过”“我现在不方便继续聊”这种局部表达里。抓住这些碎片,才算真的摸到门道。
图S1:标注工具界面
图S1:标注工具界面。左边用于迭代构建框架,右边用于验证大模型批量标注效果。论文的细活,不是“扔给模型就完事”,而是先把规则磨出来,再让模型放大。

三大研究问题:何时、多强、如何不同

这篇论文不是泛泛而谈“AI会不会像人”,而是拆成了三个更能落地的问题。RQ1问的是拟人化何时出现;RQ2问的是拟人化有多强;RQ3问的是不同平台、不同文化下,它们的表达方式有什么差异。这个拆法很务实,避免了“拟人化”这个大词一喊就虚的问题。
这里还要先解释一个基础概念:拟人化,指的是把非人对象赋予人的特征、意图、情感或边界感。放到AI伴侣语境里,用户说“它记得我”“它在安慰我”“它有点累了”,本质上都是在给系统贴上“像人”的标签。问题是,这些标签不是单一维度,而是能拆成不同表达信号的。
论文提出的核心判断是:拟人化不是一个“有/没有”的开关,而是一个由多种线索叠加出来的强度问题。有的句子只是“它很聪明”,这比较弱;有的句子同时出现情绪、记忆、承诺、身体动作,那就已经不是“像不像人”了,而是“像一个有关系、有责任感的对象”。

ExpressionCueLens框架:十种表达的“解码器”

这部分是论文最值钱的地方。ExpressionCueLens不是简单分类,而是把拟人化表达拆成了“表达类别”和“线索类型”两层。前者回答“在说什么”,后者回答“是怎么说出来的”。
论文把原先更散的类别收拢成10类:自我概念与身份、社交人格与互动、目标导向智能、规则型行为、脆弱性与边界、伪装与真实性、情绪、时间性、具身性、刻意语言操控。这里的“缩减”不是偷懒,而是把边界模糊、重复度高的类别合并,避免标注时今天像这个、明天像那个,最后大家都在猜拳。
表S3:ExpressionCueLens与旧分类的映射
表S3:ExpressionCueLens与DeVrio等人(2025)表达类型的映射。论文不是凭空造轮子,而是在已有拟人化税onomies上做了合并与重构,让分类更适合社交媒体场景。
更关键的是,论文把线索分成了四种:语言线索认知线索行为线索感知线索。人话版就是:它说了什么、它怎么想的、它做了什么、以及界面上看起来像什么。这个分法很适合分析聊天截图,因为很多“像人”的感觉,并不只来自文字内容,还来自头像、表情、括号动作、语气和承诺。
比如“我明天提醒你”既有时间性,也有承诺;“我不能继续这个话题”既是规则,也带边界感;“(点点头)”则把一个纯文本系统硬生生拉进了具身空间。论文真正厉害的地方,是把这些平时看着很散的信号,整理成了可以统计、可以比较、可以跨平台迁移的框架。
表S2:ExpressionCueLens codebook
表S2:ExpressionCueLens codebook。这里完整列出了十类表达及其对应线索,是整篇论文后续分析的“字典本体”。

实验结果:东西方AI伴侣对话的“文化映射”

先说结论:小红书更偏脆弱、情绪和非感知线索,Reddit则更偏时间、具身和感知线索。这不是简单的“谁更爱AI”,而是两边把AI伴侣放进了不同的叙事框架:一个更像情绪关系,一个更像连续互动的伙伴。
图1:不同平台上的表达分布
图1:不同平台上的表达分布。Reddit的表达更分散,小红书则在脆弱性与情绪上更集中,说明平台文化会把拟人化“推”向不同方向。
论文里一个很耐看的结果是:社交人格与互动情绪是最常见的两类表达,但小红书在脆弱性与边界上的占比明显更高。换句话说,用户不只是说“这个AI很会聊天”,而是在说“它懂我、能安慰我、也会让我受伤”。这已经非常接近关系叙述,而不是功能评价。
Reddit则更常出现时间性表达,比如“上次聊到哪”“下次再继续”“我会记得”。这种表达会把AI伴侣放进一个跨时段连续存在的框架里。它不只是此刻回答问题,而是会延续关系、承担记忆、执行承诺。这个差异非常重要,因为它说明拟人化不是单纯靠模型能力堆出来的,而是被用户的使用方式和平台语境共同塑造出来的。
图2:不同表达类别对应的线索分布
图2:不同表达类别对应的线索分布。可以看到,语言线索最普遍,认知和行为线索紧随其后,感知线索最少,说明“像人”更多是靠语义和推理感撑起来的,而不是靠界面花活。
论文还做了一个更有意思的强度分析:如果一个消息里只出现一种线索,拟人化偏弱;两种是中等;三种以上就明显增强;四种全上则是“很强”。结果显示,两个平台里强拟人化都占大头,但小红书的强度更高。原因并不神秘:当情绪、边界、承诺、回忆这些线索叠在一起时,读者很难再把它当成单纯工具。
论文还用LIWC-2022做了语言学侧验证。LIWC(Linguistic Inquiry and Word Count,语言分析与词频统计)本质上是一个心理语言学词典工具,用来检查这些表达是否真的和某些心理维度共现。结果并不花哨,但很有说服力:目标导向表达更像“驱动”和“权力”词汇,时间性表达更像过去/现在/未来焦点,真实性表达更像洞察和确定性,情绪表达则和情感词明显相关。也就是说,这个框架不是拍脑袋分出来的,而是能和成熟心理语言学指标对上。
表S4:表达到LIWC维度的收敛效度
表S4:表达到LIWC-22维度的收敛效度。这个结果的意义在于:ExpressionCueLens不是孤立自嗨,它和已有心理语言学工具能够互相印证。
还有一个值得注意的点:论文用GPT-4o做了辅助标注,但不是直接“全自动信任”。先是少量人工迭代建立代码本,再拿大模型批量跑,最后再用人类一致性验证。这个流程很像先造尺子,再拿尺子量大样本。相比那种“模型一键出结论”的写法,这种方法更稳,也更容易复现。

伦理与未来:设计更具文化敏感性的AI伴侣

这篇论文最后给出的启发其实很实用:AI伴侣设计不能只盯着“更会说话”,还得看“在什么文化里说、用什么方式说、说到什么程度算越界”。同一句“我会一直陪着你”,在不同平台、不同文化里,可能被读成温暖,也可能被读成过度承诺。
从产品角度看,这类研究的价值不在于帮模型“更像人”,而在于帮系统更懂边界。如果一个AI伴侣在某些文化中会被自然地当作亲密对象,那么它就不能只会输出情绪安慰,还得知道什么时候要克制、什么时候要提醒风险、什么时候不要把关系感无限放大。否则,体验越“真”,翻车也可能越真。
当然,这篇论文也有边界。它分析的是社交媒体上的公开文本,天然带有“愿意发出来的人更愿意表达”的偏差;而且跨平台比较时,文本形态本身就不一样,Reddit是叙事复述,小红书是截图展示,二者并不完全同构。所以它更适合被看作文化与表达方式的观察窗,而不是对所有AI伴侣用户的普适结论。
如果把这项工作往前推一步,后续很值得继续看两个方向:一是更多平台和语言,二是把“用户叙述”与“实际对话日志”结合起来。前者能验证文化差异是不是更普遍,后者能区分“人们怎么讲AI伴侣”和“AI伴侣实际怎么回应”之间的落差。这个落差,往往才是产品设计里最容易踩坑的地方。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的不是“AI会不会像人”这种大而空的问题,而是把社交媒体里关于AI伴侣的拟人化表达拆成可分析的结构:什么时候出现、强度多高、不同平台和文化下有什么差异。

ExpressionCueLens里的“线索”是什么意思?这里的线索不是线索片段那么简单,而是拟人化是通过什么信号被读出来的:语言、认知、行为、感知四类。比如“我记得”“我不能”“(点点头)”分别对应不同类型的线索。

为什么小红书和Reddit会不一样?因为平台表达习惯和文化预期不一样。小红书更容易出现情绪、脆弱和边界感表达,Reddit更容易出现时间性、叙事性和具身化表达,所以同样是AI伴侣,讲法会完全不同。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把“拟人化”从抽象概念拆成表达类别和线索类型,思路是扎实的,尤其适合社交媒体语料;但它更偏框架整理与经验验证,原创性不是那种一眼炸裂的类型。

实验合理度:★★★★☆

人工迭代标注、LLM辅助批量标注、LIWC收敛验证、跨平台对照,链条比较完整。唯一要注意的是跨平台文本形态不同,比较时天然有语体偏差。

学术研究价值:★★★★☆

对人机交互、社会计算、跨文化研究都很有启发,尤其适合后续继续做更大规模的平台比较和文化建模。

稳定性:★★★☆☆

框架本身稳定,但依赖社交媒体公开文本和OCR质量,到了更复杂的多模态聊天或私域对话里,还需要重新校准。

适应性以及泛化能力:★★★☆☆

对文本社交平台很适配,但对语音、视频、实时交互等场景的泛化还没被证明;更像一个可迁移的分析框架,不是通吃一切的万能尺。

硬件需求及成本:★★★★☆

主要成本在标注和OCR,不在训练大模型;如果已有GPT-4o类工具和双语标注能力,落地成本不算高。

复现难度:★★★☆☆

方法逻辑清晰,但数据来自社交媒体抓取,平台变化和OCR误差会影响复现;代码和标注细节若不完全开放,复现仍有门槛。

产品化成熟度:★★★☆☆

适合做舆情分析、社区洞察和伴侣型AI的文化适配研究,但离直接嵌入产品闭环还有距离,尤其需要更多在线行为数据验证。

可能的问题:框架扎实,但跨平台语体差异会混入文本形态偏差;如果后续只看公开帖子,可能高估极端情绪和强拟人化表达。


主要参考文献

Ng, L. H. X., Xiao, Y., Wang, L. Z., Xuan, W., & Diab, M. ExpressionCueLens: A Cross-Cultural Analysis of Human-AI Companion Conversations on Social Media. arXiv 2026.
DeVrio et al. 2025; Xiao et al. 2025; Tausczik & Pennebaker 2010.
原文链接:https://arxiv.org/pdf/2607.13924v1.pdf

AI伴侣不只会聊天,还会被人“当成伙伴”来讨论。想继续看这类跨文化、社交媒体、LLM人机互动的拆解,欢迎进群一起围观前沿论文,少踩坑,多看门道~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。