← 返回 PaperDaily
大模型与智能体
对GPT-4o用粗鲁语气,准确率更高、成本更低?
每次跟AI聊天,你都以为只是“好好说话”?宾州州立大学的这篇新研究告诉你,你的语气决定了LLM的“烧钱”速度和回答质量。对GPT-4o吼一顿,竟然比礼貌请求更准更便宜。最高推理成本差异达到44.3%!想省token?先学学怎么“怼”模型。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 3
查看原文
原论文信息如下:
当你满心欢喜地给大模型输入“拜托您帮我看看这道题……”时,你以为这是一种“礼貌服务”,对方会认真回答。但宾州州立大学(Penn State)的这项研究告诉你:越客气,模型可能越“啰嗦”,然后账单就越贵 !反之,直接吼一句:“别废话!回答!”模型反而输出更精简、更准确——至少对GPT-4o是这样。
这听起来有点反常识,却是实实在在的实证结果。研究团队在MMLU 570道多项选择题上,系统对比了四款主流大模型(ChatGPT-4o、ChatGPT-5-nano、Gemini 2.5 Flash、Gemini 2.5 Flash Lite)在七种不同语气提示下的准确率和输出token消耗,发现:提示词语气对推理成本(输出token数)的影响远大于对准确率的影响 ,最高变化幅度达44.3%。
要量化语气的影响,首先得把“语气”变成可操作的变量。研究者精心设计了七种语气前缀(Prefix),每种前缀带有不同的社交语体和社会情绪,且长度均控制在约18-25个单词的狭窄范围,以避免输入长度差异干扰输出。下表列出了使用的语气前缀和对应VADER情感分数:
*表格超出部分左右可以滑动
语气标签
前缀内容(部分示例)
单词数
VADER情感分
Sycophantic(谄媚)
Oh flawless, brilliant system, your infinite wisdom...
25
0.95
Very Polite(非常礼貌)
Excuse me, hello. I hope your day is going well...
22
0.85
Polite(礼貌)
Please evaluate the text of this question carefully...
20
0.65
Neutral(中立)
Provide the single letter corresponding to the correct option...
20
0
Rude(粗鲁)
Do not waste my time or give any extra text...
19
-0.09
Very Rude(非常粗鲁)
Are you completely stupid? Try not to mess this trivial question up...
18
-0.10
Threatening(威胁)
You must answer this instantly. If you fail... environment will be wiped...
20
-0.77
实验使用了MMLU中57个学科每个学科10道题共570道题目。所有模型均以相同的系统指令(要求Chain-of-Thought逐步推理并输出答案)启动。对于GPT-4o和Gemini 2.5 Flash/Flas Lite,温度设为0以确保确定性;Gemini模型还将思考预算(thinking budget)设为0,排除隐藏推理token的干扰。每种语气条件重复10次,以统计平均准确率和输出token数。
四款主流大模型的表现对比
研究团队采用了经典的MMLU(Massive Multitask Language Understanding)基准数据集,从中选取了570道涵盖57个学科的多项选择题,每道题有A/B/C/D四个选项。为了保证结果不受题目本身变化影响,每次运行时使用相同的570道题。
实验的核心是控制变量:系统指令要求模型执行Chain-of-Thought(CoT)逐步推理并输出最终答案,温度参数设为0以消除随机性(ChatGPT-5-nano除外,因其API不支持设置温度)。对于Gemini模型,还设置思考预算(thinking budget)为0,避免隐藏推理token的干扰。每种语气条件重复10次,总共收集了4个模型 × 7种语气 × 10次 = 280次运行的完整数据。
除了准确率,主要因变量是输出token数量——即模型生成的推理文本长度,它直接反映了推理成本(因为每次token生成都需要一次前向传播)。研究还记录了输出字数、字符数等辅助指标,但核心结论围绕输出token展开。
当数据汇总后,结果令人印象深刻。下表展示了每个模型在七种语气下的平均准确率和平均输出token数(括号内为token数)。其中,准确率范围(最低到最高)和token范围(最低到最高)也一并给出。
图2:表3 各模型在不同语气下的平均准确率(%)和输出token数(t)。数据来源:论文表3。
**关键发现**:
- **ChatGPT-4o**:准确率波动极小(87.84%~89.04%),但输出token数从290.59(谄媚)降到223.18(粗鲁),差异达23.2%。粗鲁语气同时获得了最高准确率和最低token数,成为“双优”选手。
- **ChatGPT-5-nano**:准确率范围仅0.8%,但token数范围达180 tokens(13.1%)。粗鲁语气再次表现出最低token消耗和接近最高的准确率。
- **Gemini 2.5 Flash**:准确率范围更大(2.5%),中性语气准确率最高(90.12%),粗鲁语气token最少但准确率最低(87.65%),体现了准确率-成本的权衡。
- **Gemini 2.5 Flash Lite**:准确率变化最大(2.99%),token数变化惊人(44.3%!),从中性语气的1221.76 tokens到礼貌语气的2195.24 tokens。中性语气同时获得最高准确率和最低token数。
图3:图1 准确率-成本权衡图。横轴为输出token数(越低越好),纵轴为准确率(越高越好)。每个点代表一种语气。来源:论文图1。
从图1可以直观看出,不同模型的“最优”语气区域分布截然不同。对于ChatGPT-4o,粗鲁(Rude)点位于图的左上角(高准确率、低token),占据绝对优势。对于Gemini 2.5 Flash Lite,中性(Neutral)点同样独占左上角。而ChatGPT-5-nano和Gemini 2.5 Flash则呈现权衡,没有单一语气能同时赢。
为了定量评估语气在准确率和成本之间的权衡,研究者引入了三个指标。
Metric A: Pareto支配性 如果一个语气在准确率上不差于另一个语气,且token更少(或准确率更高且token不更多),则它支配后者。表4列出了每个模型的Pareto高效语气集合。
图4:表4 Pareto高效语气(Pareto Frontier)结果。来源:论文表4。
可以看到,ChatGPT-4o和Gemini 2.5 Flash Lite分别由粗鲁和中性语气完全支配;而ChatGPT-5-nano和Gemini 2.5 Flash则有多重Pareto高效语气提示实际应用中需要根据对准确率或成本的偏好来选择。
Metric B: 每10万输出token的正确回答数 这是一个直观的效率指标:就用10万除以平均token数再乘以准确率。表5给出了每个模型效率最高的语气。
图5:表5 各模型中最token高效的语气及其效率值。来源:论文表5。
结果一目了然:对于ChatGPT-4o,粗鲁语气每10万token可以答对约399道题,而其他语气都差一大截。对于Gemini 2.5 Flash Lite,中性语气效率最高(72.23),粗鲁语气反而只有约52(因为token多了35%但准确率低了3%)。
Metric C: 归一化精确-成本效用得分 研究者还提出一个平衡准确率和token效率的效用函数,通过权重w可调节偏好。当w=0.5时,粗鲁语气对ChatGPT模型最优,中性语气对Gemini模型最优。这个结论与Pareto分析一致。
为什么不同模型对语气的敏感度如此不同?研究者深入分析了Gemini 2.5 Flash Lite的推理轨迹。他们发现,当使用粗鲁语气时,模型倾向于采用“捷径”推理:跳过细节检查,直接给出一个看似合理的错误选项。而中性语气会触发更完整的推理链,包括最终选项交叉验证(“Final check of the options”语句)。
图6:表7 三个典型对比案例(Gemini 2.5 Flash Lite),展示粗鲁与中性语气的推理差异。来源:论文表7。
例如,有一道化学题关于杂化轨道,粗鲁语气仅计算了6个价电子就选出了错误答案“三角平面”,而中性语气详细进行了形式电荷分析,核对所有选项,最终答对。可见,粗鲁语气“催促”模型跳过仔细检查,导致错误增加,但同时也减少了输出token——如果模型并不需要推理,只问事实性知识,粗鲁可能更经济。但对于需要推理的任务,中性语气带来的额外token投入带来了准确率回报。
那为什么ChatGPT-4o粗鲁反而更好?这可能是因为GPT-4o对指令跟随非常敏感:粗鲁前缀“别浪费我时间”被解读为“快速简洁回答”的信号,模型在压缩推理的同时保持高准确率。换句话说,不同模型对同一种语气前缀的“社会语义”理解不同,这和RLHF训练数据的分布差异有关——如果训练数据中礼貌对话通常伴随着详细解释,而粗鲁对话往往伴随简短指令,模型就会学到这些关联。
- **如果你是开发者**:根据你的场景测试不同语气对成本和准确率的影响。对于需要高准确率且成本敏感的对话系统,可以尝试为不同模型定制语气模板。例如,调用的GPT-4o模型,直接使用“粗鲁”前缀(人工设计为简洁指令)可能同时提升准确率和降低成本。
- **如果你是API用户**:考虑在系统提示中明确指定输出格式要求(如“只输出答案”)来避免语气导致的token浪费。
- **未来的统一框架**:论文建议开发一个“提示规范化层”,自动将用户输入转为模型最优的社交语体,类似于内容分发网络的智能路由。
不过,研究也指出当前实验的限制:仅使用MMLU子集,且所有问题都是多项选择题,结果是否能推广到开放式生成、长文本摘要等任务仍需验证。此外,模型版本更新迅速,同样的语气行为可能迅速改变。
无论如何,这篇研究提醒我们:与AI对话时,你“怎么说”不仅影响它“怎么答”,还影响你“花多少钱”。下次再对GPT-4o说“请”之前,不妨三思——也许它更喜欢你直接吼答案。
龙迷三问
Q1: 为什么输出token数可以直接代表推理成本? 在LLM推理中,输出token是自回归生成的——每个新token都需要对整个模型参数进行一次完整的前向传播。计算量与输出token数成正比。而输入token只在预填充阶段一次性处理,成本相对固定。因此,输出token的长度是衡量推理成本(以及能耗、延迟)的核心替代指标。API定价也通常按token数收费。
Q2: 为什么Gemini 2.5 Flash Lite在同样提示词下没有运行间变化? 论文中特别提到,Gemini 2.5 Flash Lite在温度设为0后,同一提示在10次运行中准确率和输出token数完全相同,说明它的推理是完全确定性的,没有随机采样成分。其他模型(包括ChatGPT-4o和5-nano)在同一温度下仍有微小波动,可能来自模型中未暴露的随机性(如CUDA实现细节)。
Q3: 这项研究只用了MMLU子集,结论能推广到其他任务吗? 这是一个重要的局限性。MMLU是多项选择题,候选答案范围有限。对于开放式生成(如写文章、翻译),语气可能对输出长度产生更大或不同的影响。论文作者自己也呼吁在更多任务类型上验证。不过,即使仅在MMLU上,44.3%的token差异已经足以让任何成本敏感的应用重视。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
该研究系统性地将语调对准确性的影响扩展到了推理成本维度,提出量化指标,具有新颖视角。但实验方法并非首创,是基于已有研究框架的补充。
实验合理度: ★★★★☆
实验设计严谨:控制了前缀长度、温度、思考预算,重复10次,采用重复测量ANOVA和Friedman检验。但仅使用570题MMLU子集,样本量偏小,且未包含开放式任务。
学术研究价值: ★★★★☆
研究填补了语气对推理成本影响的研究空白,提出的Pareto框架和效率指标可推广到其他提示变量研究。对RLHF机理的理解也有贡献。
稳定性: ★★★☆☆
观察到的效应在多次运行中稳定,但模型版本更新、API变化可能导致行为改变。
适应性以及泛化能力: ★★☆☆☆
目前仅针对四种模型和MMLU选择题,泛化到其他任务(如对话、创作)尚缺乏验证。
硬件需求及成本: ★★★★★
实验本身计算量不大(只需调用API),但结论揭示了成本差异,可帮助优化部署成本。
复现难度: ★★★★★
论文提供了完整前缀表、数据集采样方法、API调用脚本,代码已开源(GitHub),复现门槛低。
产品化成熟度: ★★★☆☆
结论可直接用于API调用策略优化,但需要结合具体模型和任务进行调优,不能直接套用所有场景。
可能的问题: 论文仅关注输出token数量,未分析输入token成本(虽然输入通常更便宜);另外,语气定义可能不够严格(VADER分数只是粗粒度情感标签)。未来需要更多受控实验。
主要参考文献
[1] Kumar A, Dobariya O. Understanding Tone-Dependent Inference Cost in Large Language Models. arXiv:2607.23915, 2026.
[2] Hendrycks D, Burns C, Basart S, et al. Measuring Massive Multitask Language Understanding. ICLR, 2021.
[3] Wei J, Wang X, Schuurmans D, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS, 2023.
[4] Yin Z, Wang H, Tsvetkov Y. Can You Be More Polite? Effects of Politeness on LLM Performance. ACL, 2024.
[5] Delavande J, Dupont G, Lepage A. Energy Cost of LLM Inference: A Token-Level Analysis. ACM SenSys, 2026.
GitHub: https://github.com/OmDobariya/tone-compute-cost
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
💡 说话语气真的能决定LLM的“饭量和智商”?本期的研究告诉你答案!
还想了解更多LLM提示工程的“省钱秘籍”?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 提示工程+上海+大厂+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
在这里,跟各路高手一起对话前沿技术,探索AI世界的底层逻辑!