你有没有这样的经历:辛辛苦苦做了一份方案,自己觉得创意满满,拿去给ChatGPT评个分,结果它说“嗯,挺新颖的,但……”。你心里嘀咕:这评判标准到底跟人一不一样啊?
以后不用猜了。剑桥大学、曼彻斯特大学和昆士兰大学的学者们联手,把这个问题给“实锤”了。他们系统地研究了六大主流大语言模型(LLMs)在评判创意时的标准,结果发现:LLM们基本只认“新不新”,根本不关心“火不火”,比如品牌、市场、社会认可这些背景信息,在它们眼里几乎不存在。
虽然模型很强大,但如果你随手拿个LLM来当创意评审,结果很可能跟人类评审大相径庭,选出来的“好创意”可能只是因为它够新奇,完全忽略了它在现实中的可行性和市场反响。
咱们今天就掰扯掰扯,这篇重量级研究到底说了什么。
AI当评委:LLM与人类在创造力评估上究竟有多像?
已有研究找出了人类评估创意的26个具体标准,它们被分成了7个维度,涵盖了从点子本身到它所处社会和市场环境的方方面面。比如,点子够不够新颖(novelty)、有没有用(usefulness)、好不好玩(hedonic价值)、技术含量高不高(technology)、跟现实联系紧不紧密(concreteness),当然,也包括它有没有品牌效应(name brand)、受不受市场欢迎(mass market)、社不社会认可(social approval)等等。
然后,研究者们给6个主流LLM(GPT-4.1 mini、Grok 4 Fast、DeepSeek V3、ERNIE 3.5-8K(百度文心一代表)、Claude Haiku 4.5和Gemini 2.5 Flash-Lite)抛出了同样的题目:对这26个标准的重要性进行打分。
结果出来了,LLM们只采纳了其中17个标准,重合度65.38%。这意味着,它们比起人类,确实“省”掉了一些尺子。那么,它们砍掉的是哪把尺子呢?
研究1核心发现:一张图看懂LLM的“偏科”
图中,左边是7个维度(最左列),往右排列的是各个模型对这26个标准的“重要性”判断。绿色方格代表该标准被认定“重要”(纳入评估标准),灰色代表不被认为重要。
1. “新颖性(Novelty)”是绝对的核心:在Novelty维度,所有8个标准,6个模型几乎全盘接受(全绿)。这说明LLM在评估创意时,把“新不新”当成了最重要的铁律。跟人类标准重合度最高。
2. “背景信息(Contextual)”被集体“弃用”:再看倒数第二个维度Contextual。你看那一片灰色,几乎就没几个绿色。5个背景标准(如品牌、大众市场、时尚性等),LLM们普遍认为它们不配作为评估创意的依据。只有“可信度(credibility)”勉强过关。而恰恰在这个维度上,人类是会把它们当作重要参考的。这就是LLM和人类最大的分水岭。
3. 其他维度有“选择性的接纳”:在有用性(Usefulness)、享乐性(Hedonic)等维度上,不同模型表现不一,但整体上也是打了不少折扣。
新研究揭示:LLM更看重新颖性,却对品牌、市场等背景信息“视而不见”
这就是研究3要回答的问题。研究者们设计了一个非常巧妙的实验:
他们找了15个真实的Kickstarter(美国众筹平台)产品作为样本。对于每个产品,他们准备了两种版本的描述:
- 版本A(只有产品介绍):只描述了产品本身的功能和外观。
- 版本B(产品介绍+背景信息):在版本A的基础上,用一句话补充了背景信息,比如“这款产品来自一个知名大牌”“这个设计正在引领时尚潮流”或者“这款产品被主流市场广泛接受”。
然后,让1195名人类参与者(N = 1,195)和6个LLM分别对这些产品描述的“创意性”进行打分。结果如下:
而LLM呢?它们就像是“活在真空里的审查员”。不管背景信息怎么变,对产品创意性的评分几乎纹丝不动(b = 0.01, p = 0.367)。它们只盯着产品描述里的功能描述来评判“新不新”,对“它是谁做的”“它有多火”这些信息完全免疫。
进一步的实验分析(图6)还表明,对于“品牌效应”“大众市场”“时尚性”这几种背景信息,这种差异尤其显著。一个出自无名小卒之手的颠覆性创意,和一个出自苹果公司的类似创意,在人类专家眼里天差地别,但在LLM眼里,可能得分差不多。
一句话总结
六大主流模型大比拼:GPT-4最“像人”,Claude最“保守”
如上图2所示,通过一种叫做文化共识理论(Cultural Consensus Theory)的统计方法,研究者发现,这6个模型各自都有一套独特的评估标准,不存在通用的“LLM评估标准”。而且,它们之间采纳标准数量的宽窄差异巨大:
- 最宽泛的一档:GPT和Grok:它们两个在26个标准中,各自都采纳了20个。换句话说,它们最接近人类的全方位评估视角,不仅看新颖性,还会积极去考虑背景、好用、技术等多个维度的信息。
- 中间档:DeepSeek和ERNIE:各自采纳了14个标准,在标准广度和深度上属于中间力量。
- 最窄的一档:Claude和Gemini:它们俩只采纳了12个和11个标准,可以说是“纯粹的新颖性主义者”。它们对除了“新不新”和“好不好玩”之外的其他信息,几乎都不怎么关注。
这个发现很有意思。龙哥的理解是,不同模型在训练数据、模型架构和偏好对齐上的差异,直接导致了它们在“审美”上的巨大分歧。GPT和Grok可能被训练得更加“通人性”,而Claude和Gemini则更倾向于数据驱动,专注于可量化的内在属性。
标准越宽越准:为什么GPT和Grok能更好区分好创意?
然后,让专业的人类评估员和所有6个LLM,分别给这1,103个创意打分。最后,用皮尔逊相关系数(Pearson correlation coefficient)来衡量LLM的评分与人类专家评分的匹配度。
结果在下面的图4中一目了然,而且跟研究1的预测惊人一致。
- 相关性最高的第一梯队(r ≈ 0.52和0.49):正是评估标准最宽的GPT和Grok。它们在看到创意时,能同时考虑新颖性、有用性、享乐性、技术等多维信息,因此它们对“好创意”的定义跟人类专家最接近。
- 相关性中等(r = 0.46):是标准宽度中等的DeepSeek和ERNIE。
- 相关性最差(r = 0.41):是标准最窄的Claude和Gemini。它们因为只盯着“新不新”,所以经常把“虽然新颖但完全不可行或者没市场”的想法打高分,而忽略了那些“小创新但极其实用”的想法,因此跟人类专家评分差距最大。
这个实验非常漂亮地证明了:评估标准与人类的匹配度,直接决定了LLM能否成为一个合格的“创意评审”。
警惕AI偏见:选择LLM作为创造力评估工具需三思而后行
这项研究最直接的警示是:LLM并不是一个中立的、客观的评审,它带有自己根深蒂固的“偏见”——对新颖性的极度偏爱,和对背景环境的极度漠视。
如果你现在用一个Claude或Gemini这种“保守派”模型来筛选创意,你很可能会错过一大批现实中非常成功的好点子。那些靠模仿大牌、精准定位市场、或利用已有品牌背书来实现商业化成功的创意,在它们眼里可能一文不值。反之,一些天马行空、完全不顾及现实条件的想法,可能反而会拿到高分。
什么时候用LLM评审靠谱?
当你的评估目标非常明确,就是追求纯粹的原创性时,比如在头脑风暴阶段寻找最独特的点子,或者某个比赛只以“新奇”为唯一标准。在这些场景下,LLM(尤其是GPT和Grok)可以是一个高效的过滤器,帮你迅速剔除掉平庸的想法。
什么时候千万别用?
当你的评估需要综合考虑市场需求、品牌认知、商业可行性、社会接受度等现实因素时。此时,LLM的评估结果很可能是一个重大误导。你绝对不能仅仅因为一个LLM打了高分就去投资一个项目,也不要因为一个LLM打了低分就放弃一个创意。
龙哥的看法是:LLM可以作为我们创意的“第一轮筛选器”或者“思维激发器”,但绝对不能替代最终的人类专家评审。特别是对于高风险、高投入的决策,一定要把LLM的评估当作一个参考维度,而不是最终判决。
龙迷三问
问题1:论文中提到的“创造力评估标准”具体包含哪26项?这26个标准被分为七个维度,分别是:新颖性(novelty,8项)、有用性(usefulness,4项)、享乐性(hedonic,3项)、具体性(concreteness,2项)、关系性(relational,2项)、技术性(technology,2项)和背景性(contextual,5项)。每个标准代表一种评估创意时的证据类型,比如“原创性(originality)”、“实用性(usefulness)”、“趣味性(fun)”、“可行性(feasibility)”、“品牌效应(name brand)”、“社会认可(social approval)”等。完整的26个标准详见论文原文的表格。
问题2:论文中提到的“文化共识理论”(Cultural Consensus Theory)是什么?简单来说,这是一种统计学方法,用来判断一组人对某个问题的看法是“共有共识”还是“各有各的看法”。在这项研究中,研究者用它来分析六个LLM对26个标准的评分模式到底是一个统一的“LLM标准”,还是每个模型都有自己独特的标准。结果发现,把6个模型各自分成一类(即6个群体)时模型的拟合度最好,这说明每个模型确实有自己的“想法”,不存在一个放之四海而皆准的“LLM创造力评估标准”。
问题3:这项研究的结果是否意味着LLM永远无法取代人类评审?研究结果揭示了当前LLM在模拟人类创造性评估方面的局限性,但并不意味着永远无法取代。它清楚地告诉我们,LLM当前的“盲点”在于缺乏对复杂社会、市场和品牌背景信息的理解和整合能力。未来的研究可能通过改进训练数据(加入更多关于“背景信息”如何影响创意价值的例子)或调整模型架构来克服这一点。不过,至少在目前,龙哥不建议在任何需要综合评估的场合完全信赖LLM的创造性评分。
龙哥点评
论文创新性分数:★★★★✰
这篇论文最大的创新在于第一次系统地、从评估标准(而不是简单的结果对比)这个根源出发,理论解释了为什么LLM和人类在创造力评估上时好时坏。它提供了一个理论框架,而不是搞一个黑盒模型。实验合理度:★★★★✰
实验设计堪称教科书级别。从标准识别(研究1)到实际评分验证(研究2),再到特定信息干扰(研究3),逻辑链非常完整。使用的样本量(1103个创意,1195名被试)和模型数量也足够有说服力。扣一星是因为基座模型版本迭代很快,结论的时效性有限。学术研究价值:★★★★★
非常高。它开创性地提出了“评估标准差异”作为理解LLM与人类对齐问题的核心变量。这个框架不仅适用于创造力评估,还可以推广到LLM在其他领域的偏见和局限性研究上,具有重要的启发意义。稳定性:★★★✰✰
研究本身结论稳健。但LLM作为一个快速发展的技术,其评估标准会随着模型的迭代更新而不断变化。今天GPT-4.1的“标准”和明天GPT-5的可能就大不相同,因此结论的稳定性和普适性有待持续观察。适应性及泛化能力:★★★★✰
研究方法具有很强的可复制性。如果你想测试某个新出的模型对创意的评估标准,只需用同样的26个标准问卷让它打分即可。但是,结论对不同文化背景(比如亚洲市场更看重品牌)的泛化能力可能有限。硬件需求及成本:★★★★★
论文本身是实验性研究,不需要任何硬件成本。唯一的成本是调用API的费用,但这对于这项研究来说完全可以忽略不计。复现难度:★★★★★
论文提供了详细的实验设计和评估标准(26项标准明明白白),实验数据已在OSF(Open Science Framework)开源平台上公开(链接见前文)。研究者只需按图索骥,就可以复现研究2和研究3的整个过程,可复现性极高。产品化成熟度:★★✰✰✰
论文的研究结果本身不是产品,而是对现有产品(LLM)的一个批判性评估。它不适合直接打包成产品,但对于正在开发AI辅评选型产品的团队来说,是必须参考的理论基础。可能的问题:研究所使用的六个模型版本(如GPT-4.1 mini)均为特定时间点的快照,结论可能不适用于其后续版本。此外,评估任务仅局限于“创意评估”这一单一场景,结论能否推广到其他如道德、诽谤、风险等更复杂的判断场景,尚需验证。研究未涉及多模态模型,对于包含视觉元素的创造力评估(如设计作品)结论未知。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!