← 返回 PaperDaily 大模型与智能体

剑桥实测6大模型:GPT最像人,Claude最“刻板”

你是不是经常让ChatGPT帮你评个点子的好坏?但你知道它的评判标准和你一样吗?剑桥学者刚刚揭开了谜底:LLM只认“新不新”,根本不关心“火不火”!这篇论文系统比较了六大主流模型的创造力评估标准,并验证了对实际评分的影响,值得所有用AI做决策的人一看。

原论文信息如下:
论文标题:
Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
发表日期:
2026年7月
发表单位:
剑桥大学、曼彻斯特大学、昆士兰大学
原文链接:
https://arxiv.org/pdf/2607.22218v1.pdf
开源数据链接:
https://osf.io/q4xa9/overview?view_only=0e22435638ce41468c1f8303f4bab0a9
嘿,朋友们,龙哥来了。

你有没有这样的经历:辛辛苦苦做了一份方案,自己觉得创意满满,拿去给ChatGPT评个分,结果它说“嗯,挺新颖的,但……”。你心里嘀咕:这评判标准到底跟人一不一样啊?

以后不用猜了。剑桥大学、曼彻斯特大学和昆士兰大学的学者们联手,把这个问题给“实锤”了。他们系统地研究了六大主流大语言模型(LLMs)在评判创意时的标准,结果发现:LLM们基本只认“新不新”,根本不关心“火不火”,比如品牌、市场、社会认可这些背景信息,在它们眼里几乎不存在。

虽然模型很强大,但如果你随手拿个LLM来当创意评审,结果很可能跟人类评审大相径庭,选出来的“好创意”可能只是因为它够新奇,完全忽略了它在现实中的可行性和市场反响。

咱们今天就掰扯掰扯,这篇重量级研究到底说了什么。
图1:研究概览——通过三个逐步递进的研究,揭示了LLM创造力评估标准的全貌与影响。

AI当评委:LLM与人类在创造力评估上究竟有多像?

要搞清楚这个问题,首先得知道人类评估创造力时,心里到底装着多少把“尺子”。

已有研究找出了人类评估创意的26个具体标准,它们被分成了7个维度,涵盖了从点子本身到它所处社会和市场环境的方方面面。比如,点子够不够新颖(novelty)、有没有用(usefulness)、好不好玩(hedonic价值)、技术含量高不高(technology)、跟现实联系紧不紧密(concreteness),当然,也包括它有没有品牌效应(name brand)、受不受市场欢迎(mass market)、社不社会认可(social approval)等等。

然后,研究者们给6个主流LLM(GPT-4.1 miniGrok 4 FastDeepSeek V3ERNIE 3.5-8K(百度文心一代表)Claude Haiku 4.5Gemini 2.5 Flash-Lite)抛出了同样的题目:对这26个标准的重要性进行打分。

结果出来了,LLM们只采纳了其中17个标准,重合度65.38%。这意味着,它们比起人类,确实“省”掉了一些尺子。那么,它们砍掉的是哪把尺子呢?
表1:人类评估创造力时使用的26个标准及其对应的七个维度。

研究1核心发现:一张图看懂LLM的“偏科”

下面这张图是研究1的核心结论,大家认真看,龙哥给你们分析。

图中,左边是7个维度(最左列),往右排列的是各个模型对这26个标准的“重要性”判断绿色方格代表该标准被认定“重要”(纳入评估标准),灰色代表不被认为重要。
图2:清晰展示了六个LLM(从左往右分别为GPT、Grok、DeepSeek、ERNIE、Claude、Gemini)的评估标准热图。绿色为采纳标准,灰色为未采纳。可以明显看到Novelty(新颖性)维度几乎全绿,Contextual(背景)维度几乎全灰。
这张图信息量巨大。龙哥帮你提炼几个关键点:

1. “新颖性(Novelty)”是绝对的核心:在Novelty维度,所有8个标准,6个模型几乎全盘接受(全绿)。这说明LLM在评估创意时,把“新不新”当成了最重要的铁律。跟人类标准重合度最高。
2. “背景信息(Contextual)”被集体“弃用”:再看倒数第二个维度Contextual。你看那一片灰色,几乎就没几个绿色。5个背景标准(如品牌、大众市场、时尚性等),LLM们普遍认为它们不配作为评估创意的依据。只有“可信度(credibility)”勉强过关。而恰恰在这个维度上,人类是会把它们当作重要参考的。这就是LLM和人类最大的分水岭。
3. 其他维度有“选择性的接纳”:在有用性(Usefulness)、享乐性(Hedonic)等维度上,不同模型表现不一,但整体上也是打了不少折扣。

新研究揭示:LLM更看重新颖性,却对品牌、市场等背景信息“视而不见”

研究1揭示了LLM的评估“偏好”。但这只是纸上谈兵,关键要看实际打分时会不会产生偏差

这就是研究3要回答的问题。研究者们设计了一个非常巧妙的实验:

他们找了15个真实的Kickstarter(美国众筹平台)产品作为样本。对于每个产品,他们准备了两种版本的描述:
- 版本A(只有产品介绍):只描述了产品本身的功能和外观。
- 版本B(产品介绍+背景信息):在版本A的基础上,用一句话补充了背景信息,比如“这款产品来自一个知名大牌”“这个设计正在引领时尚潮流”或者“这款产品被主流市场广泛接受”。

然后,让1195名人类参与者(N = 1,195)和6个LLM分别对这些产品描述的“创意性”进行打分。结果如下:
图5:对比人类与LLM在不同产品描述下的创造力评分。蓝色线为人类,其他颜色线为不同LLM。人类评分在加入背景信息后显著提升,而所有LLM的评分几乎毫无波澜。
结论非常明确:人类是“读空气”的高手。当他们被告知“这是知名大牌的产品”或“这是当前最火的款式”时,他们给产品的创意性打分显著提高(b = 0.18, p < 0.001)。这是因为他们自然而然地就把品牌、市场热度这些背景信息当作创意有价值的佐证。

而LLM呢?它们就像是“活在真空里的审查员”。不管背景信息怎么变,对产品创意性的评分几乎纹丝不动(b = 0.01, p = 0.367)。它们只盯着产品描述里的功能描述来评判“新不新”,对“它是谁做的”“它有多火”这些信息完全免疫。

进一步的实验分析(图6)还表明,对于“品牌效应”“大众市场”“时尚性”这几种背景信息,这种差异尤其显著。一个出自无名小卒之手的颠覆性创意,和一个出自苹果公司的类似创意,在人类专家眼里天差地别,但在LLM眼里,可能得分差不多。

一句话总结

这就好比,你让一个“理工男”去评判一幅画,他只会盯着构图比例和颜料成分看,完全无视这幅画是毕加索画的,代表着什么艺术流派,或者它在苏富比拍出了天价。LLM就是那个“理工男”,而人类则是懂艺术史和市场的画廊老板。

六大主流模型大比拼:GPT-4最“像人”,Claude最“保守”

虽然整体上LLM都比人类“偏科”,但不同模型的“偏科”程度可大不一样。研究1还深入分析了每个模型独有的标准图谱。

如上图2所示,通过一种叫做文化共识理论(Cultural Consensus Theory)的统计方法,研究者发现,这6个模型各自都有一套独特的评估标准,不存在通用的“LLM评估标准”。而且,它们之间采纳标准数量的宽窄差异巨大:

- 最宽泛的一档:GPT和Grok:它们两个在26个标准中,各自都采纳了20个。换句话说,它们最接近人类的全方位评估视角,不仅看新颖性,还会积极去考虑背景、好用、技术等多个维度的信息。
- 中间档:DeepSeek和ERNIE:各自采纳了14个标准,在标准广度和深度上属于中间力量。
- 最窄的一档:Claude和Gemini:它们俩只采纳了12个和11个标准,可以说是“纯粹的新颖性主义者”。它们对除了“新不新”和“好不好玩”之外的其他信息,几乎都不怎么关注。

这个发现很有意思。龙哥的理解是,不同模型在训练数据、模型架构和偏好对齐上的差异,直接导致了它们在“审美”上的巨大分歧。GPT和Grok可能被训练得更加“通人性”,而Claude和Gemini则更倾向于数据驱动,专注于可量化的内在属性。

标准越宽越准:为什么GPT和Grok能更好区分好创意?

标准不同,结果会不会跟着不同?研究2就是为了验证这一点。他们找来了293名人类参与者,让他们在三个不同的创意任务(如企业难题、环保问题等)中,共生成1,103个创意想法。

然后,让专业的人类评估员和所有6个LLM,分别给这1,103个创意打分。最后,用皮尔逊相关系数(Pearson correlation coefficient)来衡量LLM的评分与人类专家评分的匹配度。

结果在下面的图4中一目了然,而且跟研究1的预测惊人一致。
图4:展示了六个LLM及其综合评分与人类专家评分的相关性(Pearson r)。GPT与Grok的相关性最高(r=0.52, 0.49),其次是DeepSeek和ERNIE(r=0.46),而Claude和Gemini最低(r=0.41)。
这结果简直就像教科书一样规范!

- 相关性最高的第一梯队(r ≈ 0.52和0.49):正是评估标准最宽的GPT和Grok。它们在看到创意时,能同时考虑新颖性、有用性、享乐性、技术等多维信息,因此它们对“好创意”的定义跟人类专家最接近。
- 相关性中等(r = 0.46):是标准宽度中等的DeepSeek和ERNIE
- 相关性最差(r = 0.41):是标准最窄的Claude和Gemini。它们因为只盯着“新不新”,所以经常把“虽然新颖但完全不可行或者没市场”的想法打高分,而忽略了那些“小创新但极其实用”的想法,因此跟人类专家评分差距最大。

这个实验非常漂亮地证明了:评估标准与人类的匹配度,直接决定了LLM能否成为一个合格的“创意评审”。

警惕AI偏见:选择LLM作为创造力评估工具需三思而后行

现在很多公司都在尝试用LLM来筛选商业计划书、评估产品创意、甚至评审科研项目提案。看完这篇论文,龙哥觉得,我们得敲响警钟了

这项研究最直接的警示是:LLM并不是一个中立的、客观的评审,它带有自己根深蒂固的“偏见”——对新颖性的极度偏爱,和对背景环境的极度漠视。

如果你现在用一个Claude或Gemini这种“保守派”模型来筛选创意,你很可能会错过一大批现实中非常成功的好点子。那些靠模仿大牌、精准定位市场、或利用已有品牌背书来实现商业化成功的创意,在它们眼里可能一文不值。反之,一些天马行空、完全不顾及现实条件的想法,可能反而会拿到高分。

什么时候用LLM评审靠谱?
当你的评估目标非常明确,就是追求纯粹的原创性时,比如在头脑风暴阶段寻找最独特的点子,或者某个比赛只以“新奇”为唯一标准。在这些场景下,LLM(尤其是GPT和Grok)可以是一个高效的过滤器,帮你迅速剔除掉平庸的想法。

什么时候千万别用?
当你的评估需要综合考虑市场需求、品牌认知、商业可行性、社会接受度等现实因素时。此时,LLM的评估结果很可能是一个重大误导。你绝对不能仅仅因为一个LLM打了高分就去投资一个项目,也不要因为一个LLM打了低分就放弃一个创意。

龙哥的看法是:LLM可以作为我们创意的“第一轮筛选器”或者“思维激发器”,但绝对不能替代最终的人类专家评审。特别是对于高风险、高投入的决策,一定要把LLM的评估当作一个参考维度,而不是最终判决。


龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:论文中提到的“创造力评估标准”具体包含哪26项?这26个标准被分为七个维度,分别是:新颖性(novelty,8项)、有用性(usefulness,4项)、享乐性(hedonic,3项)、具体性(concreteness,2项)、关系性(relational,2项)、技术性(technology,2项)和背景性(contextual,5项)。每个标准代表一种评估创意时的证据类型,比如“原创性(originality)”、“实用性(usefulness)”、“趣味性(fun)”、“可行性(feasibility)”、“品牌效应(name brand)”、“社会认可(social approval)”等。完整的26个标准详见论文原文的表格。

问题2:论文中提到的“文化共识理论”(Cultural Consensus Theory)是什么?简单来说,这是一种统计学方法,用来判断一组人对某个问题的看法是“共有共识”还是“各有各的看法”。在这项研究中,研究者用它来分析六个LLM对26个标准的评分模式到底是一个统一的“LLM标准”,还是每个模型都有自己独特的标准。结果发现,把6个模型各自分成一类(即6个群体)时模型的拟合度最好,这说明每个模型确实有自己的“想法”,不存在一个放之四海而皆准的“LLM创造力评估标准”。

问题3:这项研究的结果是否意味着LLM永远无法取代人类评审?研究结果揭示了当前LLM在模拟人类创造性评估方面的局限性,但并不意味着永远无法取代。它清楚地告诉我们,LLM当前的“盲点”在于缺乏对复杂社会、市场和品牌背景信息的理解和整合能力。未来的研究可能通过改进训练数据(加入更多关于“背景信息”如何影响创意价值的例子)或调整模型架构来克服这一点。不过,至少在目前,龙哥不建议在任何需要综合评估的场合完全信赖LLM的创造性评分。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

这篇论文最大的创新在于第一次系统地、从评估标准(而不是简单的结果对比)这个根源出发,理论解释了为什么LLM和人类在创造力评估上时好时坏。它提供了一个理论框架,而不是搞一个黑盒模型。

实验合理度:★★★★✰

实验设计堪称教科书级别。从标准识别(研究1)到实际评分验证(研究2),再到特定信息干扰(研究3),逻辑链非常完整。使用的样本量(1103个创意,1195名被试)和模型数量也足够有说服力。扣一星是因为基座模型版本迭代很快,结论的时效性有限。

学术研究价值:★★★★★

非常高。它开创性地提出了“评估标准差异”作为理解LLM与人类对齐问题的核心变量。这个框架不仅适用于创造力评估,还可以推广到LLM在其他领域的偏见和局限性研究上,具有重要的启发意义。

稳定性:★★★✰✰

研究本身结论稳健。但LLM作为一个快速发展的技术,其评估标准会随着模型的迭代更新而不断变化。今天GPT-4.1的“标准”和明天GPT-5的可能就大不相同,因此结论的稳定性和普适性有待持续观察。

适应性及泛化能力:★★★★✰

研究方法具有很强的可复制性。如果你想测试某个新出的模型对创意的评估标准,只需用同样的26个标准问卷让它打分即可。但是,结论对不同文化背景(比如亚洲市场更看重品牌)的泛化能力可能有限。

硬件需求及成本:★★★★★

论文本身是实验性研究,不需要任何硬件成本。唯一的成本是调用API的费用,但这对于这项研究来说完全可以忽略不计。

复现难度:★★★★★

论文提供了详细的实验设计和评估标准(26项标准明明白白),实验数据已在OSF(Open Science Framework)开源平台上公开(链接见前文)。研究者只需按图索骥,就可以复现研究2和研究3的整个过程,可复现性极高。

产品化成熟度:★★✰✰✰

论文的研究结果本身不是产品,而是对现有产品(LLM)的一个批判性评估。它不适合直接打包成产品,但对于正在开发AI辅评选型产品的团队来说,是必须参考的理论基础。

可能的问题:研究所使用的六个模型版本(如GPT-4.1 mini)均为特定时间点的快照,结论可能不适用于其后续版本。此外,评估任务仅局限于“创意评估”这一单一场景,结论能否推广到其他如道德、诽谤、风险等更复杂的判断场景,尚需验证。研究未涉及多模态模型,对于包含视觉元素的创造力评估(如设计作品)结论未知。


主要参考文献

[1] Lyu, P., Kim, Y. J., Xiao, H., & Luan, Y. L. (2026). Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity. arXiv preprint arXiv:2607.22218.
[2] Amabile, T. M. (1996). Creativity in Context: Update to the Social Psychology of Creativity. Westview Press.
[3] Runco, M. A., & Jaeger, G. J. (2012). The standard definition of creativity. Creativity Research Journal, 24(1), 92-96.
[4] Simon, H. A. (1978). The theory of creativity. In A. Rothenberg & C. R. Hausman (Eds.), The Creativity Question (pp. 29-42). Duke University Press.
[5] Baer, J. (2015). The importance of domain-specific expertise in creativity. Roeper Review, 37(3), 120-128.
[6] 论文中引用的其他相关文献,请参阅原文(链接见眉题)。

开放数据:研究中所有的人类创意评估数据、LLM评分和实验材料均已在 OSF(Open Science Framework,一个开源科学框架,用于标准化管理、共享和复用科学数据与实验工作流,帮助研究保持可重复性和透明性)上公开。地址:https://osf.io/q4xa9/overview?view_only=0e22435638ce41468c1f8303f4bab0a9

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
你分得清“真创意”和“包装创意”吗?LLM也分不清!想让你的创意在AI眼中闪闪发光,又怕它不懂人情世故?来龙哥读论文粉丝群,与数千位AI实战派一起聊聊大模型评估的边界与机会。扫描下方二维码或添加龙哥助手微信号:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称,更快通过邀请进群哦!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。