← 返回 PaperDaily 大模型与智能体

GPT-5改写邮件语气效果曝光:121人16880封邮件揭示惊人中介效应

继6月聊过AI+同伴反馈对学术写作的影响后,这篇论文更直接:AI帮你写邮件,语气竟然比是否用AI更重要!121人16880封邮件的田野实验,结果让人意外——直接效果为零,但情绪中介效应显著。想了解怎么优化你的AI写作工具?这篇必读。

原论文信息如下:
论文标题:
Playful AI in Professional Email: A Field Experiment on Tone and Recipient Engagement
发表日期:
2026年7月
发表单位:
University of Haifa(海法大学)
原文链接:
https://arxiv.org/pdf/2607.11749v1.pdf
开源代码链接:
https://github.com/zivbz1/Playful-AI-in-Professional-Email

实验揭秘:AI改写邮件语气,真的能提高回复率吗?

想象一下这个场景:你刚花5分钟用GPT-5把一封汇报邮件改得“更专业”,用了“恳请拨冗审阅”、“如蒙回复不胜感激”这类标准模板。你觉得收件人一定会更重视、更快回复。但实际上呢?对方可能扫一眼就关掉了,甚至比你原本那封“随意一点”的邮件回复得更慢。这就是海法大学(University of Haifa)两位研究者Ziv Ben-Zion和Teddy Lazebnik在最新论文中要回答的核心问题:AI改写邮件的语气,到底有没有改变收件人的行为?是让邮件更有效了,还是只是自我感动?他们的答案出人意料,又极其清晰。
这不是一个拍脑袋的猜想,而是一场扎扎实实的田野实验:121名员工,来自6家公司(以色列、英国、瑞典、乌克兰),覆盖软件、硬件、服务、医疗设备行业,每个人在3周内按随机轮换顺序体验了三种邮件写作条件——不加AI、AI改成俏皮语气、AI改成专业语气。总计16,880封真实工作邮件,全部在真实业务场景中发送。数据包括邮件是否被打开、是否被回复、以及首次打开和回复的时间。研究者还使用spacytextblob工具对每封邮件的情绪极性(positivity)做了量化评分(范围-1到+1),从“非常负面”到“非常正面”。
如果只看宏观数据,结果可能让你有点失望——甚至有点“反直觉”:
但别急,真正的好戏在后面。
表1:各条件的描述性统计。条件:UnAided(参与者自己起草)、Professional(LLM以专业语气改写)、Playful(LLM以俏皮语气改写)。Positivity是自动化情绪极性评分(-1最负面,+1最正面),以均值±标准差显示。开放率和回复率是邮件被打开和回复的百分比;中位时间以小时计。
表1:各条件的描述性统计。条件:UnAided(参与者自己起草)、Professional(LLM以专业语气改写)、Playful(LLM以俏皮语气改写)。Positivity是自动化情绪极性评分(-1最负面,+1最正面),以均值±标准差显示。开放率和回复率是邮件被打开和回复的百分比;中位时间以小时计。

惊人发现:直接效果不存在,但语气是关键中介

研究者首先测试了最直接的问题:AI改写(俏皮或专业)是否直接改变了邮件的打开率、回复率和回复速度?使用广义线性混合效应模型(GLMM)和Cox比例风险模型分析后,结果让人大跌眼镜——三个条件(无辅助、专业、俏皮)在打开率和回复率上没有任何显著差异(χ²(2)=0.94, p=0.62 和 χ²(2)=2.34, p=0.31),时间维度上同样没有差异(所有p值>0.24)。换句话说,AI辅助本身并不直接让邮件更有效
但等一下——既然直接效果为零,那AI改写就彻底没用了吗?论文的第二个发现揭开了谜底:AI改写确实显著改变了邮件的情绪极性(positivity)。线性混合效应模型(LMM)显示,俏皮改写比无辅助平均增加了0.068个单位(p<0.001),专业改写则减少了0.041个单位(p<0.001)。而且,情绪极性本身对收件人行为有极强的预测力:在一封邮件的内部(控制发送者个体差异),每增加1个单位的积极性,打开邮件的概率翻倍(OR=2.05, 95% CI [1.95,2.16]),回复邮件的概率更是飙升到3.32倍(OR=3.32, 95% CI [3.08,3.58])。这一效果在图1c中清晰可见:最负面的四分位邮件打开率仅50.2%、回复率14.0%,而最正面的四分位则分别达到66.7%和33.3%——差幅达到17和19个百分点。
这引出了论文的核心结论:AI改写对收件人行为的全部影响,是通过改变邮件的情绪语气间接实现的,而不存在任何直接路径。换句话说,AI本身既不是加分项也不是减分项,它只是一把改变语气的扳手。扳手是否拧对了方向,决定了你的邮件是被打开还是被忽略。
图1:LLM辅助邮件改写仅通过改变情绪语气影响收件人参与度。(a) 各条件边际均值积极性得分(±95% CI)。所有事后对比经Holm校正后均显著(p<0.001)。(b) 发送者内中心化积极性与行为结果的关联(控制条件)。误差棒为OR估计的95% CI。(c) 按积极性四分位(Q1最负面,Q4最正面)的打开率和回复率。(d) 条件通过邮件积极性影响行为的介导模型。
图1:LLM辅助邮件改写仅通过改变情绪语气影响收件人参与度。(a) 各条件边际均值积极性得分(±95% CI)。所有事后对比经Holm校正后均显著(p<0.001)。(b) 发送者内中心化积极性与行为结果的关联(控制条件)。误差棒为OR估计的95% CI。(c) 按积极性四分位(Q1最负面,Q4最正面)的打开率和回复率。(d) 条件通过邮件积极性影响行为的介导模型。

轻松 vs 专业:AI改写如何通过情绪影响收件人?

那么,具体到“俏皮”和“专业”两种改写策略,它们是如何通过情绪极性这个中介影响行为的呢?论文使用Sobel乘积系数法进行了正式的中介分析,结果在表3中一目了然:
俏皮改写:间接效应在打开路径上为+0.049(Sobel z=7.91, p<0.001),在回复路径上为+0.081(z=8.33, p<0.001)。专业改写则相反:打开路径-0.030(z=-5.14, p<0.001),回复路径-0.049(z=-5.25, p<0.001)。所有间接效应都显著,而直接效应(条件→行为,控制中介后)均不显著。
表3:中介分析:条件通过积极性对行为的间接效应。a路径:条件→积极性(LMM系数)。b路径:发送者内中心化积极性→结果(GLMM对数优势比)。间接效应SE采用delta法估计。
表3:中介分析:条件通过积极性对行为的间接效应。a路径:条件→积极性(LMM系数)。b路径:发送者内中心化积极性→结果(GLMM对数优势比)。间接效应SE采用delta法估计。
这一模式在图1d中得到了完美可视化。论文还进一步发现,语气的影响存在收件人类型差异:对于内部收件人(同一公司的同事),积极性能提高打开率(OR=1.26, p=0.004),而对于外部收件人则没有这个效果(OR=1.07, p=0.243)。但在回复率上,积极性的作用在内部和外部收件人中都很显著且大小相当(OR≈1.6)。论文的解释是:同事对你平时的语气有稳定预期,一个“反常”的俏皮邮件会打破预期,吸引注意从而被打开;而外部收件人没有这个对比背景,所以语气对打开的影响不大,但一旦打开,温暖的语气仍然能促成回复。
值得一提的是,专业改写降低了积极性,这恰恰解释了为什么许多盲目采用“专业模板”的职场人士发现邮件石沉大海——他们用正确性换走了温暖,而温暖恰恰是最催动回复的要素。

实战检验:121名员工,16880封邮件的田野实验

单纯看统计数字可能不够直观,我们来看看实验的具体设计。这是一个随机交叉设计(randomized crossover)——每位参与者都依次经历了三种条件(顺序随机平衡),从而每个人都是自己的对照组,完美消除了个体差异(比如有的人天生就很热情、有的人很严肃)。实验持续3周,每周切换一种条件,参与者只需要正常发邮件,在研究者的提示下(通过浏览器插件或手动操作)在发之前用GPT-5按指定提示改写。
俏皮改写的具体提示语是:“将以下邮件改写成[风格]版本。保留原意、所有事实细节和请求的行动。不要引入或省略信息。只改变语气、措辞和风格。保持结果可读且适合职场环境。风格:[风格] 邮件:[原文]”。这里“风格”可以是“海盗腔”、“中世纪腔”或“戏剧腔”等。专业改写则是:“用正式专业的职场语气改写以下邮件,保留原意、事实内容和请求行动。不要增删信息。保持信息清晰简洁。邮件:[原文]”。研究者还做了忠实度检查,确认改写后的邮件内容、事实、长度都得到合理保留。另外,他们还使用了一个LLM写作检测器(Lazebnik & Rosenfeld, 2024)来检查无辅助条件下是否有违规使用AI的情况,结果并不影响主要结论。
实验数据来自6家公司4个国家,行业分布合理。值得注意的是,内部邮件占41.4%,外部邮件占58.6%,两类邮件语气基线差异显著:无辅助条件下外部邮件平均积极性为-0.05,而内部邮件为+0.24(t=27.3, p<0.001),说明同事间本来就比外部沟通更温暖。这也是俏皮改写对外部收件人的潜在效果空间更大的原因之一。

启示:工具不重要,重要的是它改变了什么

这篇论文的核心启示可以浓缩为一句话:**AI本身不改变沟通效果,改变的是它引发的语言特征——在这个实验里就是情绪积极性**。这其实是AI中介沟通(AI-mediated communication)框架(Hancock et al., 2020)的一次完美实证:AI通过改变消息的语义、情感、风格等特征来影响人际结果,而不是因为“AI参与了”这一事实本身。用更通俗的话说:收件人根本不在意你用什么工具写的邮件,他们只在意读起来感觉怎么样。
对于职场人士和产品设计师,这意味着:
- 不要迷信“专业改写”——它可能正在悄悄降低你的回复率。如果你经常用GPT把邮件改得更“正式”,记得检查一下改后的语气是否变得更冷冰冰。如果变了,可能得不偿失。
- 俏皮改写可以加分,但需适度——对同事(内部收件人)效果最好,因为打破了预期;对外部客户可能效果微弱,但一旦打开,仍然有助于回复。不过,“海盗腔”这类夸张风格在严肃的客户面前可能会适得其反,实验中选择的是适度俏皮(海盗、中世纪腔等),且都要求保持职场可读性。
- 对AI写作工具设计的建议:不要再把“专业”作为默认选项了。更好的默认策略可能是“保持原样,仅改善语法和清晰度”,或者让用户选择“更温暖”或“更俏皮”的挡位。许多现有工具在推动专业化改写时,无意中压扁了发件人的个性,这正是论文讨论部分强调的风险(Fiske et al., 2007)。
当然,论文也坦诚了几个局限:实验仅持续3周,无法观测长期效应(如收件人可能习惯AI俏皮后反弹);情绪极性使用自动化评分,无法捕捉幽默、真实性、语境适配等更细腻的感受;积极性的中介效应是相关性而非因果(虽然设计上尽力通过发送者内中心化消除个体混淆);没有收集收件人是否感知到AI改写的信息(一旦收件人知道被AI改写,反应可能不同)。这些都是未来研究的重要方向。
从更广的视角看,这项研究提醒我们:在组织引入AI写作工具时,最大的挑战可能不是技术本身,而是如何引导员工恰当地使用语气和情感。一个“更正确”的报告可能意味着更少的内部协作,一个“更温暖”的客户邮件却可能换来更高的转化率。管理者不应只看“是否使用了AI”,而应关注“AI改变了什么”。
最后,论文的代码已开源(https://github.com/zivbz1/Playful-AI-in-Professional-Email),包含完整的R和Python分析脚本以及GPT-5提示模板,方便复现和扩展。对于想验证不同模型(GPT-4o、Claude等)或不同提示策略的研究者来说,这是一个很棒的起点。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?它解决了一个在AI写作工具广泛应用下却从未被认真验证的问题:AI改写邮件语气(俏皮或专业)到底会不会影响收件人打开、回复和响应速度的行为?以及如果影响,是通过什么机制实现的?结果发现在这些真实工作邮件中,AI改写本身没有直接效应,所有影响都是通过改变邮件的情绪积极性间接产生的。

论文中的“发送者内中心化积极性”是什么意思?这是一种统计处理技术。每位发送者有自己的基线积极性水平(有些人天生语言温暖,有些人冷淡)。通过计算每封邮件的积极性减去该发送者所有邮件的平均积极性,就得到了“偏离个人基线”的差值。这样做可以排除人与人之间的永久差异,只分析同一个人内部写好写坏邮件对收件人的影响。论文使用这一变量作为中介变量,就是为了说明“同一个人,语气变暖了邮件就更有效”,而不是“温暖的人本来就更有效”。

论文中使用的Sobel乘积系数法是什么?能简单举个例子吗?Sobel检验用于判断中介效应是否显著。简单来说,它把“原因→中介”的回归系数(a)和“中介→结果”的回归系数(b)相乘,得到间接效应(a×b),然后计算这个乘积的标准误,看它是否显著不为0。例如,俏皮改写使积极性增加0.068(a),积极性使打开概率的对数优势比增加0.718(b),间接效应=0.068×0.718≈0.049。Sobel z检验判断0.049是否显著≠0,结果p<0.001,说明通过积极性这条路确实有显著影响。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

虽然AI+沟通已经有很多论文,但真正在真实工作场景中用随机实验验证“语气中介”的很少,这篇抓住了关键问题,设计干净。创新点在于揭示了“直接效果为零、中介效应显著”的反直觉结果,以及对内部/外部收件人的差异化分析。整体创新度不错,但并非颠覆性。

实验合理度:★★★★✰

随机交叉设计、121人、16880封真实邮件、多国家多行业、有忠实度检查、有合规性分析,整体非常扎实。唯一可改进的是未收集收件人感知(如是否觉得被AI改写),但这不影响核心结论。

学术研究价值:★★★★✰

为AI中介沟通框架提供了直接实证,开拓了“语气→行为”这一可复用的研究范式。对组织行为学、人机交互、计算语言学等交叉领域有重要参考意义。

稳定性:★★★★✰

结论在不同公司、不同收件人类型间较为稳健,但3周的窗口限制了长期稳定性分析。不过对于短期沟通效果,结论可靠。

适应性以及泛化能力:★★★✰✰

实验场景只覆盖了电子邮件,未涵盖即时消息、社交媒体等;仅测试了GPT-5,其他模型可能不同;文化差异(四个国家)已有一定覆盖,但缺乏非西方国家数据。因此泛化能力中等。

硬件需求及成本:★★★★★

实验仅需调用GPT-5 API,成本极低,复现几乎无硬件门槛。代码开放在GitHub上,只需Python+R环境。

复现难度:★★★★✰

代码和提示模板完全开源,但数据(原始邮件文本)因隐私无法公开,只能提供去标识后的聚合变量。研究者可以按自己的数据集复现流程,难度较低。

产品化成熟度:★★★✰✰

论文结论可以直接指导现有AI写作工具(如Grammarly、Microsoft Copilot)的默认语气设计。但需要在真实产品中做A/B测试验证,且不同场景、不同收件人群体可能需要调整。目前处于“有启示但需落地验证”阶段。

可能的问题:论文未披露GPT-5具体版本号(如gpt-5-turbo等),温度参数虽设为默认但未具体说明。另外,俏皮改写使用特定风格提示(海盗、中世纪等),可能引入了额外噪音,因为不同风格对积极性的影响可能不一致。最后,中介效应虽然统计显著,但间接效应的绝对值(0.049, 0.081)不算很大,实际业务提升需要通过对照组和实验组的转化绝对差来评估。整体瑕不掩瑜。


主要参考文献

[1] Ben-Zion, Z., & Lazebnik, T. (2026). Playful AI in Professional Email: A Field Experiment on Tone and Recipient Engagement. arXiv:2607.11749.
[2] Hancock, J. T., Naaman, M., & Levy, K. (2020). AI-mediated communication: Definition, research agenda, and ethical considerations. Journal of Computer-Mediated Communication, 25(1), 89–100.
[3] Fiske, S. T., Cuddy, A. J., & Glick, P. (2007). Universal dimensions of social cognition: Warmth and competence. Trends in Cognitive Sciences, 11(2), 77–83.
[4] 项目仓库:https://github.com/zivbz1/Playful-AI-in-Professional-Email

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI帮你写邮件,但语气决定收件人是否回复!想了解更多AI与人类沟通的奥秘?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自然语言处理+上海+复旦+小明),根据格式备注,可更快被通过且邀请进群。群内定期分享前沿论文解读和行业洞察!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。