论文标题:
ExpressionCueLens: A Cross-Cultural Analysis of Human-AI Companion Conversations on Social Media
发表日期:
2026年07月
发表单位:
Carnegie Mellon University, Nanyang Technological University, The University of Tokyo
原文链接:
https://arxiv.org/pdf/2607.13924v1.pdf
这篇论文的样本来自两个典型平台:Reddit和小红书。前者是英文论坛型社区,后者是中文社交平台,而且大量内容本身就是聊天截图。这个设计很聪明,因为它比较的不是“同一批人换个语言怎么说”,而是两种平台文化下,人们如何叙述和展示AI伴侣。这里有个很现实的工程细节:小红书里不少帖子是截图,得先做OCR(Optical Character Recognition,光学字符识别)才能进入分析流程。论文用的是Tesseract引擎,并且还让双语人工校验。别小看这一步,社交媒体文本里表情、口语、省略、错别字都不少,OCR一旦翻车,后面的统计就会像拿漏勺舀水,忙活半天全是空的。论文最终处理的不是简单的“帖子数”,而是更细粒度的“消息/话轮”。这件事很关键,因为AI伴侣的拟人化往往不是在整篇长文里平均出现,而是藏在某一句“别难过了”“我记得上次你说过”“我现在不方便继续聊”这种局部表达里。抓住这些碎片,才算真的摸到门道。图S1:标注工具界面。左边用于迭代构建框架,右边用于验证大模型批量标注效果。论文的细活,不是“扔给模型就完事”,而是先把规则磨出来,再让模型放大。
先说结论:小红书更偏脆弱、情绪和非感知线索,Reddit则更偏时间、具身和感知线索。这不是简单的“谁更爱AI”,而是两边把AI伴侣放进了不同的叙事框架:一个更像情绪关系,一个更像连续互动的伙伴。图1:不同平台上的表达分布。Reddit的表达更分散,小红书则在脆弱性与情绪上更集中,说明平台文化会把拟人化“推”向不同方向。论文里一个很耐看的结果是:社交人格与互动和情绪是最常见的两类表达,但小红书在脆弱性与边界上的占比明显更高。换句话说,用户不只是说“这个AI很会聊天”,而是在说“它懂我、能安慰我、也会让我受伤”。这已经非常接近关系叙述,而不是功能评价。Reddit则更常出现时间性表达,比如“上次聊到哪”“下次再继续”“我会记得”。这种表达会把AI伴侣放进一个跨时段连续存在的框架里。它不只是此刻回答问题,而是会延续关系、承担记忆、执行承诺。这个差异非常重要,因为它说明拟人化不是单纯靠模型能力堆出来的,而是被用户的使用方式和平台语境共同塑造出来的。图2:不同表达类别对应的线索分布。可以看到,语言线索最普遍,认知和行为线索紧随其后,感知线索最少,说明“像人”更多是靠语义和推理感撑起来的,而不是靠界面花活。论文还做了一个更有意思的强度分析:如果一个消息里只出现一种线索,拟人化偏弱;两种是中等;三种以上就明显增强;四种全上则是“很强”。结果显示,两个平台里强拟人化都占大头,但小红书的强度更高。原因并不神秘:当情绪、边界、承诺、回忆这些线索叠在一起时,读者很难再把它当成单纯工具。论文还用LIWC-2022做了语言学侧验证。LIWC(Linguistic Inquiry and Word Count,语言分析与词频统计)本质上是一个心理语言学词典工具,用来检查这些表达是否真的和某些心理维度共现。结果并不花哨,但很有说服力:目标导向表达更像“驱动”和“权力”词汇,时间性表达更像过去/现在/未来焦点,真实性表达更像洞察和确定性,情绪表达则和情感词明显相关。也就是说,这个框架不是拍脑袋分出来的,而是能和成熟心理语言学指标对上。表S4:表达到LIWC-22维度的收敛效度。这个结果的意义在于:ExpressionCueLens不是孤立自嗨,它和已有心理语言学工具能够互相印证。还有一个值得注意的点:论文用GPT-4o做了辅助标注,但不是直接“全自动信任”。先是少量人工迭代建立代码本,再拿大模型批量跑,最后再用人类一致性验证。这个流程很像先造尺子,再拿尺子量大样本。相比那种“模型一键出结论”的写法,这种方法更稳,也更容易复现。
Ng, L. H. X., Xiao, Y., Wang, L. Z., Xuan, W., & Diab, M. ExpressionCueLens: A Cross-Cultural Analysis of Human-AI Companion Conversations on Social Media. arXiv 2026.DeVrio et al. 2025; Xiao et al. 2025; Tausczik & Pennebaker 2010.原文链接:https://arxiv.org/pdf/2607.13924v1.pdf