← 返回 PaperDaily
大模型与智能体
UT Austin联手NYU新研究:GENIE,一个能告诉你“故事到底新奇在哪”的细粒度评价神器
还在为一个“创造力得分”争得面红耳赤?UT Austin和NYU的学者们告诉你,真正的评判应该像医生诊断,精准到每个“器官”。本方法把“新颖性”拆解成6个维度,让AI的“创造力”不再是一笔糊涂账。
龙哥读论文
发布于 2026-08-18 00:20:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 还在为一个“创造力得分”争得面红耳赤?UT Austin和NYU的学者们告诉你,真正的评判应该像医生诊断,精准到每个“器官”。本方法把“新颖性”拆解成6个维度,让AI的“创造力”不再是一笔糊涂账。
原论文信息如下:
嘿,亲爱的龙迷们,大家好!今天咱们来聊一个让所有AI研究者又爱又恨的话题——创造力 。
LLM的“创意”究竟差在哪?一个可解释的细粒度评价尺
我们先来做个思想实验。你让GPT-4写一个“关于一座会说话的城堡和一个会飞的南瓜的故事”,它一口气写出来了。你让Claude写同一个主题,它也写出来了。两个故事都合情合理,情节完整,语法全都对。但是——它们“新”吗?如果两个故事的冲突都是“城堡的主人失去了声音,需要帮助”,转折点都是“主人公找到了失传的咒语”,结局都是“大家幸福地生活在了一起”,那不管你用哪个大模型,大家不都是在翻来覆去地讲同一个套路吗?
这就是当前大语言模型(LLM)的一个顽疾——同质化 。学术界以前咋评价这个问题的?给一个“新颖性得分”,用一个数字,比如0.8,来告诉我这篇小说有多创新。但这个数字背后呢?没人知道它是因为“情节”新颖得了高分,还是因为“设定”新颖。就像一个医生只告诉你“你身体不好”,却不告诉你到底是肝有问题,还是肾有毛病。
来自 德克萨斯大学奥斯汀分校 (UT Austin)和 纽约大学 (NYU)的研究者们显然也受不了这种模糊的诊断了。他们在论文中提出了一个全新的框架——GENIE (Granular Evaluation of Novel Ideas with Explainability)。看到这名字就觉得有点“神灯”那味儿了不是?它的全称是 Granular Evaluation of Novel Ideas with Explainability ,翻译过来就是“具有可解释性的细粒度新颖观点评估”。GENIE的核心理念就是:别再给我一个笼统的分数,我要像照X光一样,把“新颖性”这个病种,诊断出六种不同的病情指标来!
解构创造力:什么是新颖性?从“一个分数”到“多个维度”
要想理解GENIE,我们得先聊聊“新颖性”(Novelty)本身。在心理学和计算创造学里,新颖性被认为是创造力的一个核心组成部分(Boden, 1991)。它跟“价值”(Value,也就是作品好不好、质量高不高)是两条独立的轴线。一个作品可能很新颖,但质量稀烂;也可能写得很好,但全是老掉牙的套路。
目前,常见的做法是用 整体性指标 (Holistic Metrics)来评估。比如,把两个故事的词向量拿出来算个余弦距离,看看它们有多像;或者看看哪些n-gram(连续的n个词)是没见过的。这些指标最大的问题在于“一锅粥”:它们把一个多维度的实体硬生生压成了一个标量分数。一个故事如果因为“视角”很新而得了高分,另一个故事因为“对话风格”很新也得了高分,这两个分数在数值上虽然相等,但在意义上却完全不一样。更重要的是,如果有人想通过现有指标来指导LLM改进,他完全不知道应该修改哪个方向。
AGENT(角色/能动者) :故事中的角色是谁?他们的动机、身份和能力是什么?
PERSPECTIVE(视角) :故事是从谁的角度来讲述的?第一人称、第三人称,还是全知视角?
PLOT(情节) :故事讲了一件什么事?有哪些冲突、转折和解决方式?
SETTING(设定) :故事发生在哪里?什么时代?环境如何?
SOCIAL ATMOSPHERE(社会氛围) :故事中的人际关系是什么样?权力结构、情感基调如何?
STYLE(风格) :对话的用词、句式、修辞手法和语气是什么样的?
你看,仅仅这六个维度,就已经把“新颖性”的轮廓画得非常清晰了。接下来,我们就要看看GENIE这个“神灯”是怎么实现这种“微创手术”级别精准评价的。
方法揭秘:GENIE如何自动发现特征并量化“独特性”?
GENIE的流程其实并不复杂,但它非常巧妙。我们可以把它想象成一个“三阶段法则”,贯穿了从“发现什么”到“怎么比较”的完整闭环。我们先来看看它的核心架构图。
GENIE的第一步不是靠人拍脑袋定维度,而是自动发现 (Automatically Discover)特征!论文中,研究者让一个大语言模型(gpt-4.1)针对“创造性写作”这个任务,生成了10次特征描述。然后把这10个结果对应的文本嵌入向量算出来,进行聚类分析。最终,这些特征自然汇聚成了跟学术界已知的写作理论非常吻合的几个大类,例如上面提到的AGENT、PLOT、SETTING等,并最终确定了6个用于后续实验的特征集合。这个设计妙就妙在,它把任务相关性(Task-Specific)这个要求写进了算法的骨子里。如果换个任务,比如评估“产品设计”的新颖性,GENIE能自动发现“功能、材料、外形”等不同的特征。
有了特征后,怎么量化它们呢?GENIE的思路是“通过问题来代答 ”。还是让大语言模型来干活。对于每个待评估的写作提示,比如“写一个关于只会说反话的猫的故事”,GENIE先生成一系列具体的问题,比如:“故事的主角是谁?”“它的主要目标是什么?”“故事发生在一个什么样的地方?”“故事的基调是喜剧还是悲剧?”等等。然后,它会把每个问题映射到之前发现的某个特征上。例如,关于“猫”的问题映射到AGENT,关于“环境”的问题映射到SETTING。这一过程的核心,是保证问题之间是相互独立的,比如不会问一个既涉及“角色”又涉及“情节”的混合问题,保证评价的纯洁性。
这是最精彩的部分。GENIE不是只看一个故事,而是建立一个 参考群体 (Population)。这在论文中是一个非常重要的概念。假设我们有一大堆(约3404篇)由不同LLM生成的故事。我们想知道其中一篇新故事“甲”有什么特别。GENIE首先让一个评判LLM(论文中用的是Qwen2.5-32B-Instruct)找出“甲”和参考群体中每一篇故事对于同一个问题的答案,并计算这些答案之间的差异度 。
差异度的判断是在一个4点的李克特量表上进行的:1分表示几乎一模一样(换个说法但意思相同),4分表示天差地别(细节上和逻辑上完全不同)。或者如果一个故事根本没涉及某个问题信息,它就不计入评分。最终,GENIE会输出一个向量:对于每个特征,都会有一个差异度平均值。比如,上面提到的故事“甲”,它的“设定”特征平均差异度是0.75,而“情节”只有0.67。这就告诉我们:这篇故事的新颖,主要新在了“设定”上,而“情节”则比较常规。
效果验证:GENIE比现有指标更清楚、更可靠吗?
理论再好,也要实战说话。为了证明GENIE这个“新尺子”真的好用,作者设计了一套非常严谨的验证实验。他们需要证明GENIE“是敏感的还是鲁棒的”。
研究者找来了一些故事,然后用LLM对它们进行“微创手术”。比如,把一个故事的“情节”改了,但保留“角色”和“设定”;或者把“视角”从第三人称改成第一人称,但别的东西不变。然后,他们看GENIE能不能检测出来这个改动。结果非常理想:GENIE准确地发现当“视角”被修改后,它在“视角”这个特征上的得分出现了统计学上显著的变化。下图进一步展示了这种差异。
验证二:鲁棒性实验。我就是换个词,你会不会瞎激动?
同样的故事,只是简单地换了个说法(paraphrase):“他非常愤怒”改成“他气得发狂”。优秀的语义指标应该认为它们没有差异。实验证明,GENIE确实很“稳”,它没有因为这种表面措辞的变化而误以为故事变新颖了。它关注的是“内容”的新颖,而不是“外衣”的新颖。
作者还把GENIE和几个主流的整体性指标(Holistic Metrics)放在一起进行了对比。这些指标包括余弦距离(Cosine Distance, Cos. Dist.)、压缩比(Compression Ratio, CR)、创造性指数(Creativity Index, Cr Idx)等。
对比的方式是看它们在面对“特征编辑”时效果大小(Cohen's d)的表现。结果很有意思,如下表所示。
从表3我们可以看出,GENIE在所有特征干预上都表现出较大的效果大小,这意味着它能很清晰地感知到内容的变化。而像“创造性指数”、“LitBench”(一个根据审美偏好训练的评分模型)等指标,在“改个说法”的测试中也表现出了很大的波动,说明它们更多受到词语使用频次或人类审美偏好的影响,而不是真正的“新颖性”变化。例如,LitBench对编辑后的文档给出了负向的分数,说明它倾向于把那些被“动过手术”、有点生硬的、不符合人类审美标准的故事直接打了低分。这说明这些指标其实是在测量“作品质量”(Quality),而不完全是“新颖性”(Novelty)。
图4可以更直观地看到这一现象。当这些点落在阴影区域时,意味着指标对“变换措辞”比对“改变情节”还要敏感——这简直就是个BUG!而GENIE始终稳稳地处在阴影区域外,这证明了它的可靠性。
量化评估:哪些“炼丹术”才能真正提升LLM的创造力?
聊了半天GENIE有多好,那它能为我们做点什么呢?答案是:它能像一个“诊断仪”,帮我们看清哪些方法真的能提升LLM的创造力,以及提升的到底是哪方面的“力”。
目前,学术界已经有了一些被称为“缓解方法”的技巧来给LLM“催情”,增加创造力。比如,提示工程(Prompting)中会加入“请给出一个创意十足的回答”,或者用“要求输出新奇”的专门提示。还有解码策略(Decoding Strategy),比如调整温度参数(Temperature),或者采用对比解码 (Contrastive Decoding)等技术。但以前,我们只能笼统地说“这个方法提升了0.2个创造力分”,具体好在哪里,不清楚。
GENIE的好处就在于,它可以帮我们绘制一个“创造力雷达图”。比如,实验发现,仅仅调整采样温度,可能只是显著提升了“STYLE”特征上的新颖性,而对“PLOT”的提升微乎其微。另一方面,专门的“新奇提示”可能会让“AGENT”和“SETTING”更有想象力,但代价是“PLOT”的逻辑连贯性可能会降低。
这种洞察,在过去是无法想象的。现在,研究者可以有的放矢:如果我想提升故事的“视角”新颖性,我该用什么提示?如果我想做故事长文生成,如何保证“情节”在变新颖的同时不变颠三倒四?GENIE给了我们一个“手术刀”,而非一把“大砍刀”。
总结与展望:让机器更具创意,我们从哪里开始?
GENIE这篇论文的出现,对于大语言模型创造力评估领域,无疑是一股清流。它解决了一个核心痛点:我们常常不知道“好”在哪里,“新”在哪里。通过将新颖性解构成由自然语言描述的多个特征,并通过提问与回答的框架进行量化,GENIE真正做到了不仅给出分数,还给出“为什么”的解释。这对于指导未来的模型训练、提示优化和数据筛选,都有着非常重要的意义。
当然,从展望来看,GENIE当前还主要聚焦在“创造性写作”这个特定领域,虽然它的算法理论上可以扩展到科学发现、创意广告、游戏设计等更多领域。另外,它依赖于一个强大的评判LLM(比如Qwen2.5-32B-Instruct)来比较答案的相似度,这个过程计算量不小。未来的工作或许能教我们:能否把这种特征级的反馈注入训练,做成一个“增强创造性”的强化学习奖励模型(Reward Model)?或者,不同特征之间会不会相互作用?比如,一个过于突兀的“设定”会不会反而毁了故事?这些都是非常有意思的方向。
龙迷三问
Q:这篇论文解决什么问题? A:这篇论文解决的是如何多维度、可解释地评估大语言模型生成内容的“新颖性”问题。它不再满足于给出一个笼统的分数,而是把“新颖”这个概念拆解成“角色”“视角”“情节”“设定”“社会氛围”和“风格”六个独立维度,并告诉你具体在哪里新颖、哪里平庸。
Q:GENIE中的“特征”和“问题”具体指什么? A:特征是宏观的维度,比如“情节”和“风格”。问题是一组具体、可回答的询问,用来从故事里提取特征值。比如针对“角色”特征,GENIE会问“故事的主角是谁?”“他有什么超能力?”“他的主要目标是什么?”然后通过比较这些具体答案的差异,来最终计算该特征的新颖性。
Q:为什么说传统指标可能存在“虚假相关性”? A:因为传统指标容易受到表面特征的影响。比如,一个指标如果过多依赖词汇的稀缺性(N-gram),那么当一篇故事只是换了个非常罕见的同义词,它就会被标记为“新颖”,但实际上内容并没有变。这就是虚假相关性。GENIE通过比较“问题答案的内容”,而不是比较“词语本身”,有效避免了这个陷阱,只关注语义上的真正差异。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★★
提出用“问题-回答”范式来解构和量化不可量化的“新颖性”,思路新颖,很好地跳出了传统基于词频或向量距离的窠臼。
实验合理度:★★★★☆
实验设计非常严密。通过“人为干预特征”和“语义等同改写”分别检验敏感性和鲁棒性,逻辑严谨。美中不足在于,验证微创手术是否成功时,部分干预(如改视角)被认为具有“侵略性”,可能会影响其他特征。
学术研究价值:★★★★☆
为LLM创造力评估提供了一个全新的视角。启发了可解释性在生成质量评估中的应用。有望在没有人类标注的情况下,通过自动化手段来分析模型在创新上的薄弱环节。
稳定性:★★★☆☆
作为评价指标,其稳定性更多地取决于评判LLM的选择。论文选择了Qwen-2.5,如果换成弱一些的模型,答案相似度判断的准确性可能会波动。同时,对“参考群体”的依赖可能导致在不同样本规模下分数漂移。
适应性以及泛化能力:★★★★☆
论文指出框架是领域无关的。虽然只在“创意写作”上验证,但其“自动发现特征→生成问题→映射并比较”的流程完全可以应用于其他领域,如科学论文的创新点分析、产品文案的独特性等。适应性潜力很大。
硬件需求及成本:★★☆☆☆
成本较高。需要多次调用大语言模型(特征发现、问题生成、答案生成、答案相似度比较),并且依赖强力的评判模型(32B)。全流程跑一遍估计费用不菲,不适合小规模团队或个人频繁使用。
复现难度:★★★★☆
论文详细说明了如何通过提示和聚类自动发现特征,公开了实验设置、模型列表和评估细节。虽然没有直接提供现成的“一键运行代码包”,但按照论文的描述,复现出主要流程的难度并不高,属于高可复现性。
产品化成熟度:★☆☆☆☆
目前还处于学术研究阶段,不适合直接作为工业级的内容评估工具。它对计算资源的需求、对评判模型质量的依赖、以及漫长的评估管线(需要生成各种问题)都限制了它直接的线上应用。
可能的问题:
1. 特征集的选择依赖初始LLM的生成,是否存在偶然性?2. 剔除了“无法回答”问题的样本,会不会导致评价偏向于内容更详尽的篇章,而对简洁但同样新颖的作品不公?3. 这个方法目前只针对英文和创意写作,对其他语种和领域的适应性有待考证。
主要参考文献
[1] Ramya Namuduri, Manya Wadhwa, et al. GENIE: A Fine-Grained Measure for Novelty. arXiv preprint arXiv:2606.12790v1, 2026.
[2] Boden, M. A. The Creative Mind: Myths and Mechanisms. 1991.
[3] Hamilton, J., et al. A Taxonomy of Creative Writing Features. 2026.
[4] Zhang, Y., et al. NoveltyBench: A Benchmark for Measuring Novelty in Text Generation. 2025.
[5] Fein, Z., et al. LitBench: A Benchmark for Creative Writing Evaluation. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
告别“玄幻”的得分,来点实实在在的“诊断报告”?本方法教你如何拆解创造力的每一根骨头。想获取更多AI评估的“内功心法”?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。