← 返回 PaperDaily 大模型与智能体

康奈尔提出VOLM:与其问“是不是AI写的”,不如问“你贡献了啥”

当AI检测器还在纠结"这段文字是不是AI写的"时,康奈尔大学的学者们已经换了个更狠的问法:"就算全是AI写的,这里面有多少想法是你先想出来的?"这就像是问一个球员,不是他投进了多少球,而是他比随便从替补席拉上来的人多得了多少分。这篇论文提出的VOLM框架,正试图用棒球统计的智慧,重建人机协作时代的贡献评价体系。

康奈尔提出VOLM:与其问“是不是AI写的”,不如问“你贡献了啥”

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Value Over Language Model: Detecting Original Contribution in Writing
发表日期:
2026年8月
发表单位:
康奈尔大学
原文链接:
https://arxiv.org/pdf/2609.00700v1.pdf

01 从棒球统计说起:什么是"替换价值"

想象一下,你是一个棒球队的经理。你怎么判断一个球员到底值不值得拿高薪?

你不会只看他的本垒打数量或者打击率——因为这些数据很大程度上取决于对手的投手水平、主场的场地条件。真正聪明的做法,是拿他跟"随便从自由球员市场捞一个底薪替补"相比。这个替补,就是棒球圈子里赫赫有名的"替换级球员"(Replacement-Level Player)。

于是,著名统计学家Keith Woolner提出了VORP(Value Over Replacement Player),即"替换球员价值"——你关心的不是这个球员自己得了多少分,而是他比一个不需要任何成本就能获得的替补多贡献了多少分。这听上去只是一个统计口径的小调整,却在棒球数据分析史上留下了浓墨重彩的一笔。

为什么要用这么长的篇幅讲棒球?

因为康奈尔大学这篇刚刚发表的论文,几乎把VORP的底层逻辑,从棒球场平移到了大语言模型的评测场上。当所有人都在问"这段文字是不是AI写的"时,这篇论文提出了一个直击灵魂的新问题——

"这篇文章里,有多少信息是模型本就能轻松写出来的?又有多少是作者真正动脑贡献的?"

这个问题,把学术界和工业界争论不休的"AI检测",从一个识别游戏,硬生生拔高到了"贡献度量"的高度。看起来,人家玩的才是Next Level。

02 现有AI检测器,到底在检测什么?

在详细介绍VOLM框架之前,不妨先来看看现在的AI检测器都在干什么。

近两年,AI检测赛道可以说是卷成了红海。早期的DetectGPT这类方法,发现了一个有趣的现象:把一段AI生成的文字稍微改写一下,模型给它的概率往往会下降;而人类写的文字,改写后的概率可能升也可能降。基于这个"概率曲率"特征,就能把AI生成文本挑出来。

后来的方法越来越精细。有的把人类文本和AI文本分别建模成两个分布,在分布层面做区分;最新的EditLens则更进一步,不再二分类,而是训练一个深度模型,输出一个0到1之间的连续值,表示一篇文章有多少比例被AI"编辑"过。

听起来很厉害是不是?但这些方法有一个共同的底层设定——它们测的都是文本表面形式。AI用自己的风格写出来的句子,算AI的;AI帮人把一段口语化的想法改写成正式书面语,也算AI的;AI把一个中国学者的中文论点翻译成英文,按照这些检测器的逻辑,整个英语文本都该记在AI头上。

但问题来了——

如果一位审稿人认真读了一篇论文,发现了里面证明的漏洞,指出了实验对比的不公平,然后请AI帮他把这些观点组织成通顺的评审意见。虽然最终文本几乎全是AI生成的,但里面的核心思想——那个真正有价值的"发现",是他自己想出来的。这时候你说"这是AI写的评审",合适吗?

再比如,一位科研人员用母语想了完整的论证逻辑,然后交给AI翻译成英文投稿。翻译这件事是AI干的,但"这篇论文想表达什么"这件事,AI一点忙都没帮上。如果我们用的检测标准是"这段文字是谁写的",那AI翻译后的文字显然全判给AI——可这合适吗?

不光是科研圈,新闻行业也很头疼。2025年10月一项研究发现,美国报纸上约9%的新文章部分或完全由AI生成。但"AI生成"这四个字的语义太模糊了:它既包括记者写一句话让AI扩写成篇,也包括记者想好了完整观点、只让AI帮忙调调语序。这两种情况下的"AI含量"天差地别,但所有检测工具的输出,很可能都是同一个刺眼的红色警告。

正是看到了这个巨大的语义鸿沟,康奈尔大学的几位研究者决定,不再纠结文本是谁写的,而是直接度量"信息含量是谁供的"。

03 惊艳的思路:如何度量"想法归谁"?

论文将这套新框架命名为VOLM,全称是Value Over Language Model,中文可以翻译成"语言模型之上的价值"。

这个名字显然是刻意致敬VORP——它要测量的,正是一份文档的作者,在语言模型这个"替补球员"之上额外创造的价值。

VOLM的想法非常巧妙。它让判断"这篇文章是否有原创贡献"这个问题,变成了一个可以量化、可以对比的问题。

具体怎么做到的呢?

先想想如果你是一个语言模型,你拿到一个任务描述(比如"为一篇新闻稿写个开头"),你会很自然地按照海量训练数据中学到的模式和偏好,写出一个"最典型"的开头。这篇开头里没有任何特定于这篇新闻的信息,它只是一个"标准模型输出"。

现在再想想,如果模型拿到任务描述之后,还额外看到了这篇文章的几个关键信息,比如"主角是某某公司""融资三千万美元""这是2026年最新一轮融资"——这时候模型再写出来的开头,就会非常接近这篇真实文章的开头了。

关键洞察来了:

如果一篇新闻文章只是把那些"模型自己早就知道的东西"重新组织了一遍,那么哪怕你只给模型几个提示词,它写出来的东西也已经和原文大差不差了。但反过来,如果一篇新闻文章里包含了大量模型凭任务描述无法准确猜到的独家信息——比如记者的现场见闻、采访对象的独特引语、数据背后的分析和洞察——那么想要让模型"复原"出这篇新闻,你得把文章里越来越多的核心事实一点点喂给它,它才能拼出接近原文的轮廓。

换句话说:

文章的"原创贡献"有多大,取决于它在多大程度上超出了模型凭任务描述就能"无中生有"写出来的水平。模型需要你提供越多额外信息才能写出接近原文的文章,说明你的原创贡献越大——这就把"贡献衡量"变成了一个可以逐步揭示的"信息缺口测试"。

VOLM给这个"信息缺口"起了一个很形象的名字——"逐级惊讶程度"(surprisal)。如果模型看到越来越多的文章内容之后还是"很惊讶",说明你写的确实都是它猜不到的东西;如果模型看了几个要点就不惊讶了,那说明它早就知道你会写什么了。

这个想法非常聪明,但真正让这套方法走通的,是论文里下面要讲的那个精巧的"三层流水线"设计。

VOLM框架图

VOLM框架示意图:文档经提取器压缩信息、重建器生成、打分器评估的全流程

04 层层递进:从"提取-重建"到"打分"

VOLM的第一层,叫作"提取-重建-打分"流水线。整个框架由三个核心组件构成。

第一个组件是提取器(Extractor),它的任务是把一篇长文章"压缩"成不同粒度的摘要。粒度是什么意思?想象一篇1000字的新闻稿,最粗的粒度可以是"标题"级别的信息,也就是一句话浓缩全文;然后逐步细化,变成20%长度的要点、50%长度的摘要——一直到90%的压缩比,内容越来越接近全文。这套框架的高低取决于"内容压缩到什么程度才能让模型复原出这篇原文"。

不是让模型直接复述原文,而是让模型"假装重新写文章",从而剥离开文本表面的风格特征——这就是"重建"的用意所在。

它的名字很直白,第二个组件就叫重建器(Reconstructor)。对于刚才提取出来的每一级粒度(比如10%的要点的文章),重建器会把它作为额外背景信息,结合原始的任务描述,让语言模型从零开始重写一篇完整的文章。这里的关键是重建器重写出来的文章必须是模型自己生成的完整文本,而不是原文本身。

为什么要多此一举?

如果你直接拿原文去评估,那么人类作品和AI作品的差异中,不但包含"信息含量"的差异,还包含了巨量的表面风格差异——比如人类说话更随意、词汇选择更个性化、句子长短节奏和AI惯用的模板化表达完全不同。但VOLM要测量的只有一个纯粹的变量:模型是否对这个文本的"内容"感到惊讶,而不是对它的"措辞"感到惊讶。所有通过检测器打分和重建的文本都是AI模型生成的,所以文风上就拉平了。

最后一层,打分器(Scoring)用同一个模型,只给定任务描述,不给任何其他辅助信息,去计算每一篇重建文章的平均逐token对数概率。这个分数反应的实际上就是:模型在没有看到原文任何细节的情况下,能在多大程度上“猜到”这篇文章的词句。

想象两个极端。如果你拿到的是模型自己生成的文章,那它在重建时给的信息完全是它自己早已拥有的内容,模型打分时自然会非常给面子,分数不会太低。但如果你拿到的是一篇洞察独到的深度报道,模型读到这些重写后的内容时就会想:这写的是什么?我可猜不到——分数就会显著走低。

有了打分之后,就需要一条参照物了。这就像VORP必须定义"替换级球员"是什么水平,VOLM也定义了自己的"替换级文档"——那就是直接让语言模型M只用任务描述、不提供任何额外信息生成一篇基础文章,然后把它当成那条"地板上"的基准线。

此后每往后看一层,就会发现人和AI的得分曲线开始分离。一些文档从最细粒度开始,就和基准文档出现了显著差异——差异出现得越早,说明即使只看一点点内容,模型也已经"猜不透"这篇文档了,这就叫"原创贡献很大"。

一些文档则要到提供到80%-90%内容时才出现差异——差异出现得越晚,说明前面那80%内容都是模型自己闭着眼也能写出来的老套路,仅仅靠最后一点点细节支撑着文章的独特性。这项测试的结果是一个0到1之间的数值,很像一个"原创贡献率"。

至此,一个完整的框架搭建完毕。看起来每一步都不复杂,但把这几个组件串联起来之后,它在多个场景里展现出的"抗风格干扰能力",才是真正的惊艳之处。

05 实验验证:AI改写后,它依然认得"谁是真原创"

为了验证这套新体系是否真的比传统检测器更有洞察力,科研人员在三个真实世界的高价值场景上做了测试。

第一个是新闻语料库All the News里的100篇真实报道。第二个来自学术同行评议——他们从ICLR 2023的会议论文里随机抽取了200篇,每篇挑出一份真实评审意见。第三个则是说服性议论文写作语料PERSUADE 2.0里的200篇学生习作。

每个场景中,论文都把"给出标题让大模型直接写一篇新闻""给出论文全文让大模型写一篇评审意见""给出题目让大模型写一篇议论文"作为匹配的LLM替代文档。

实验的基准测试环节中,他们用0到100%的粒度去压缩这些文档。如果一篇新闻真的是记者实地采访获得的独家信息,那么哪怕只给模型看10%的要点,它重建出来的文章也会和"模型自己凭标题瞎编的文章"形成巨大差异;反之,如果是一篇毫无信息增量的通稿,则两条曲线会非常接近。

下面这个图给出了All the News数据的核心结果。可以看到人类的分数曲线从最左侧(10%粒度)就和参考LLM基线拉开了明显距离,而参考LLM自己的曲线几乎是一条平缓下降的直线。

人类vs参考LLM得分曲线

人类撰写语料 vs 参考级LLM生成语料的平均对数概率曲线。人类语料随内容揭示快速偏离,而参考LLM语料的变化非常平缓

这就是这套方法想要建立的直觉:值得阅读的文章,必须是模型感到意外的文章。

06 最精彩的部分:它能抗住风格改写吗?

常规检测器最怕遇到什么?最怕的是"风格迁移"。AI写的文章只要换一种口气,或者故意模仿人类的措辞风格,很多检测器的置信度就会瞬间崩塌。

VOLM论文在这个环节上做了专门的针对测试,结果相当精彩。他们拿真实的人类文章制造了两个变形版本。

第一个是bullet-reconstructed变体:把人类文章压缩成几个子弹要点,再用AI模型重写成一篇全新的文章。这段话经历了LLM的压缩和LLM的重写——无论从哪个角度看,它的"表面文本"都应该算作AI写的吧?

第二个是round-trip translated变体:先拿人类文章翻译成德语,再从德语翻译回英语,制造一个经过两次翻译的版本,原文的很多措辞和句式都已经彻底丢失了。

结果发现,无论经过上面哪一种操作,VOLM的打分曲线都和原始人类文章曲线紧密贴合,并且显著区别于那些"模型自行创作"的文本。

说明VOLM确实捕捉到了那些语言模型改写不掉的东西——事实信息本身。文字可以不断翻译、重写,但"作者亲自采访了某位市政官员,对方透露了明年要削减预算"这件事,是任何风格改写都无法抹除的信息增量。

实验做到这一步,论文还没满足。他们加试了当前最头疼的对抗场景——"人味儿化"改写。所谓humanizer,就是专门设计用来欺骗AI检测器的改写工具,原理是故意在AI文本里加入语法小瑕疵、口语化断句,让检测器误以为作者是普通人类。传统的AI检测器在humanizer面前败下阵来几乎是家常便饭。

论文用DIPPER攻击器生产的改写文本,在VOLM下会得多少分呢?答案是:曲线位置依然距离人类原始文章很远,而和"参考级LLM基线"的上方徘徊。也就是说,虽然humanizer让文本表面看起来像人类写的,但由于它并没有在信息层面添加任何新的东西,VOLM依然精准地辨识出"这个文本的底子还是A货"。

鲁棒性对比图

鲁棒性对比:换用不同生成模型(Qwen)或经人类化改写(Humanizer)的文本,VOLM曲线仍能识别其未包含真实人类原创信息

07 一个有味道的实验:词穷的提取器带来的困惑

论文最开头提到了三组实验结果,其中一组有些"尴尬":Qwen生成的文本或经过humanizer改写后的文本,并没有完全贴到参考级LLM基线那条线上,而是悬在中间,好像获得了某种不低的"原创贡献值"。作为对照组,这显然不太好解释。

研究团队顺着这个意外发现一路追查,找到了一个很有意思的原因:词汇选择的惯性。

具体来说,提取器在压缩文本时,往往会保留原文中一些非常具体的形容词和名词。当重建器拿到这些压缩要点时,它就会"顺着梯子往上爬",倾向于保留这些具体的词汇,而不是另起炉灶完全重写。

打个比方,原文里写"这首歌有忧郁的旋律和深情的歌词",提取器把它作为要点记下来,重建器在重写时就可能继续使用"忧郁的"和"深情的"这两个词。而humanizer改写后的文本说的是"悲伤的曲调"和"真诚的歌词"——由于提取器把"悲伤的"和"真诚的"也带进了重建过程,模型打分时就觉得这是"模型不熟悉的新词",于是给了一个较低的分数,仿佛这篇文章真的是人类写的。

这就是论文反复强调的"残余风格混杂问题"。VOLM原本的设计目标是不让使用什么词影响评价,只关心"内容是否意外",但具体的选词这一环,还是把风格信息偷偷塞了进来。

不过论文紧接着又提供了一个很妙的对策:如果让提取器再"较真"一点,把动词都统一通过WordNet词网规范成一个固定含义的原形动词,词汇自由度就会被强制压缩。做了这个操作之后,人类写作和humanizer假装的文本之间的曲线差距,整体缩小了72.4%。词义的约束成了消灭伪原创的一把快刀,提取器越「死板」,风格漏洞越小。

08 龙哥点评:这场人机合著时代的新度量衡实验

在AI写作工具已成基础设施的今天,怎么衡量人的贡献,是这个时代真正值得回答的问题。

VOLM这个框架最有价值的,不是它给出了一个新的「AI检测器替代品」,而是它提供了一个完全不同的思想方向。传统检测器在方法论上本质是一个"作者预测器"——判断这段文字更可能是人写的还是机器写的。这类系统的天花板在于,一旦AI模型能够模拟人类的写作风格或人类刻意模仿AI的口吻,它的根基就动摇了。而VOLM发现了一条不靠"作者身份"、只靠"信息缺口"来评测的路径——它真正关注的不是谁执笔,而是谁的思想在驱动内容。

具体有几个点值得强调。

第一,VOLM是训练无关的。它完全依靠现成的语言模型计算log-probability,不需要标注数据,理论上任何组织和个人都能在几天内复现并适配自己的场景。对大模型时代的评测体系来说,这是一个极大的加分项。

第二,它抓住了「内容」和「形式」的新区分维度。在写作这件事上,人类和AI的分工最核心的差异本来就不是「谁写了这句话」,而是「这句话描绘的事实、观点或逻辑链是哪一方构思出来的」。VOLM围绕这一层做的流水线设计逻辑自洽,实验设计也相对

01 当AI写了一半论文,功劳该算谁的?

写论文这件事,正在被AI悄悄"接管"。2025年一项针对1600名学者的调查显示,超过50%的科研人员在评审稿件时用过AI,24%的人在过去一年里用得更多。美国报纸那边更夸张,2025年夏天新发文章里约9%都带AI痕迹。
但这里头藏着一个巨大的认知陷阱。同样是"用了AI",一种用法是丢给模型一句话"帮我写个摘要",然后复制粘贴;另一种是自己把实验漏洞、对比不公平、相关工作遗漏都想得明明白白,只让AI帮忙把这些观点串联成通顺的英文。这两种情况,表面上看都是AI在写字,但内里的"含人量"天差地别。
以往的AI检测器,回答的是"这段文字是不是模型生成的"。可现实中更关键的问题是:这篇文章里有多少想法和信息,是模型靠一个通用提示就能凭空写出来的?又有多少是作者自己动脑贡献的?前者是"谁执的笔",后者才是"谁动的心、谁动的脑"。
康奈尔大学的这篇论文,干脆把这个"谁执笔"的问题扔到一边,直接定义了一个叫VOLM(Value Over Language Model,语言模型之上的价值)的框架,专门衡量人在AI之上的增量贡献。这操作,属实是把评测的段位拉高了。
VOLM框架图
图1:VOLM框架示意图,展示提取—重建—打分流水线,以及样本文档与LLM生成的参考文档经过同一处理后被比较的过程

02 从"谁写的"到"谁想的":重新定义写作贡献

为什么说传统方法从一开始就问错了问题?
学术圈里现有的AI检测工作,主要分几路。一路是零样本方法,比如DetectGPT,利用"对模型生成的句子做小幅改写后概率会下降"这个特性来识别;一路是统计建模派,把人类文本和AI文本分别看成两个分布,用带标签数据学出分布差异;再新一点的是以EditLens为代表的深度监督模型,不搞二分类了,改输出一个0到1的连续值,表示文章被AI"编辑"过多少。但它们骨子里测的还是同一件事:文本的最终形态有多少是模型直接生成的
这个口径会误伤多少人?一个母语不是英语的科研工作者,用母语把论证思路全部想清楚,然后让AI翻译成英文投稿——按"谁写的字"算,全文都该记在AI头上,可这显然不公平。还有个审稿人发现了论文里的关键漏洞,让AI帮忙把评审意见写完整——这份评审的思想贡献全在人类这边,AI只是个"打字员+润色工"。如果拿传统的AI检测器去审这份评审意见,大概率直接标红,人家反而不敢用AI好好表达了。
VOLM不想当这种"文字警察"。它的目标不是抓住"这段是谁写的",而是度量"这份文档里有多少信息增量是模型靠通用提示猜不出来的"——换句话说,作者到底在这篇文档上叠了多少只属于他自己的buff。

03 VOLM框架:如何量化人类在AI之上的"增量价值"

VOLM的名字和底层逻辑,明眼人一看就知道是在向棒球界的传奇统计量VORP(Value Over Replacement Player,替换球员价值)致敬。VORP不问一个球员的绝对水平有多高,只问一件事:他比一个从自由球员池子里随便捞上来的底薪替补,多贡献了多少价值?康奈尔团队把这套逻辑平移到了大语言模型评测上,思路非常清晰。
在这个场景里,"替补球员"就是语言模型M本身。模型靠一个通用任务描述就能写出来的文档,就是"替换级文档"Dref。作者的价值,不是ta产出的完整文章本身,而是ta在"模型随便就能写出来的水平线"之上,额外贡献的那部分信息。如果一篇文档的任何内容,模型拿到通用提示几乎都能"默写"出来,那作者的贡献就接近于零;反过来,若想让模型写出这篇文档需要喂给它大量它猜不到的真实细节,那么作者的贡献就非常大。
怎么量化这个"信息缺口"?核心就是一个叫"惊讶度(surprisal)"的指标。语言模型是一个自回归模型,每生成一个token都会有一个概率。如果一个token在给定上下文时的概率很低,就说明模型很"惊讶"。把整篇重建文档的平均逐token对数概率算出来,就能知道:模型在只见过任务描述时,对这篇文档到底有多"没想到"。
但这中间还差一步——不能直接拿原始文档的文本去打分。人类写的文章和AI生成的文章,表面风格差异太大,比如用词习惯、句式长短、段落节奏各不相同。如果直接对原文算惊讶度,那得分差异会混入大量"风格因素",根本分不清模型是因为内容"想不到"而惊讶,还是仅仅因为措辞"不常见"而惊讶。于是论文设计了三个组件协同工作的流水线,巧妙地把风格这个干扰变量隔离掉。

提取器(Extractor)

提取器负责把文档D压成不同粒度的内容表示。论文里用了一种"模式约束事实提取器",让模型把文档拆成一个有序的事实列表,每个事实记成固定结构,包含主语、动作、宾语,以及相关数量、日期或引语。为了减少动词表达的多样性干扰,提取器还会先识别每个事实的动词原形,用WordNet词网和Lesk算法做词义消歧,把动词统一成一个规范的代表形式。
然后定义11个粒度层级 gi,从0%、10%、20%一直到100%。在粒度 gi 时,提取器返回事实列表里前 ⌈gi·n⌉ 个事实,也就是说看的是"信息透露了多少比例"。这样做有一个好处——粒度越低,重建时模型获得的额外信息越少,如果这时它写出来的东西已经和原文明显不同,说明文档的独特性"藏不住"。

重建器(Reconstructor)

重建器把"任务描述T + 当前粒度的额外事实列表"拼在一起,让模型从零开始写一篇满足T的完整文章。重建还有一个硬约束:生成的文章长度要和原文控制在10%的差异以内,避免"篇幅长短不同"成为打分时的干扰变量。
关键点在于:重建器生成的每一篇文章都是模型自己写的。所以后面打分时,模型面对的所有候选文本都是"AI风格",不存在"人类文风 vs AI文风"的直接碰撞。风格差异被拉到同一水平线之后,剩下的差别只能来自内容本身。

打分器与参考文档

打分器就是模型M本身,对每篇重建文档计算平均逐token对数概率,记为 si。需要注意,计算概率时只给定任务描述T,不给其他任何辅助信息,这样才能测出"模型仅凭通用任务描述,能在多大程度上预期到这篇文章的词句"。
(a) 针对单篇文档X的提取-重建-打分流水线示意
图2(a):针对单篇文档X的提取—重建—打分流水线示意
有了逐级的分数曲线,还得再拉一条"地板参照线"。替换级文档直接定义为 Dref = M(T),即模型只凭任务描述T独立生成的文章,不给任何额外信息。这篇Dref也要和待测文档走完全一样的提取、重建、打分流程,得到它的分数分布曲线。
图3:All the News数据集上人类撰写语料、其内容保持变体(往返翻译或要点压缩后重建)与参考语料的平均对数概率曲线
图3:All the News数据集上人类撰写语料、其内容保持变体(往返翻译或要点压缩后重建)与参考语料的平均对数概率曲线
那最终VOLM得分怎么算?论文在每个粒度层级上做一个统计检验,比较"D的分数分布"和"Dref的分数分布"是否显著不同(显著性水平取p<0.05)。从粒度层级低到高逐一检查,找到第一个被拒绝且之后所有更高层级都持续被拒绝的位置 i*。VOLM得分定义为 1 - i*/k,k是总层级数。如果一个文档的信息模型早早就"接不住",那么很小的粒度就能拉开差距,i*很小,VOLM接近1;如果文档内容本来就是模型能闭眼写出来的,要到很后面才被区分开,VOLM得分就趋近于0。
对比Xie等人提出的信息理论方法,VOLM还有一个很重要的区别:Xie的方法分母是"无任何条件下"的困惑度,直接把模型对零上下文文本的惊讶作为地板,这在真实场景里等于默认"作者一句话都没交代"也有人类贡献,明显有失公平。而VOLM用的是"任务描述条件下的参考文档"做基线,地板设在"模型拿到一个和作者一样的通用任务提示时能写到什么程度"——这才真正贴近实际。

04 三大领域验证:新闻、同行评审与议论文

一套新方法想让人信服,不能只在论文里自说自话。研究者在三个高价值的真实场景上做了测试:新闻、ICLR同行评审和学生议论文。
新闻方面,从All the News语料中取了100篇文章,任务描述T就用文章公开的新闻标题。同行评审方面,从ICLR 2023随机抽了200篇论文,每篇挑一条真实评审意见,T由论文全文、评审指南和评分量表组成。议论文方面,从PERSUADE 2.0语料的8个独立写作提示里抽了200篇学生习作,每篇的T就是学生拿到的作文题。
为了做对照,每一篇人类文档都配了一个"匹配的AI生成文档"——给同一个模型同样的任务描述T,让它写一篇长度和原文档相差不超过10%的文章。整个实验用的模型是Llama 3.1 8B Instruct,同时充当提取器、重建器和打分器。
图4:人类撰写语料与参考级LLM生成语料的平均对数概率对比曲线
图4:人类撰写语料与参考级LLM生成语料的平均对数概率对比曲线,人类语料随内容揭示快速偏离参考级LLM,说明人类文章中存在大量模型无法仅凭标题预测的信息
语料库级别的结果非常清晰(见上图):真实人类新闻那条曲线从10%粒度就开始明显偏离参考级LLM曲线。为什么?因为真实新闻报道里充满了记者实地采访获知的独家事实、具体的引语和人物关系——这些信息是模型凭标题猜不出来的。而参考级LLM生成的文章曲线变化缓慢,因为它本身就是模型自己写的,你给模型看多少它自己生成的要点,它都不会觉得意外。
ICLR评审和议论文上的结果同样验证了这个趋势。在ICLR数据集上,人类的评审意见曲线与LLM参考曲线从较低的信息粒度就开始显著分离,这很合理——评审人真正读懂了论文之后提出的那些具体意见,模型光看论文标题或摘要不可能凭空编出来。议论文数据的结果也类似,那些包含了具体论证和个人见解的议论文,模型在内容逐渐展开时表现出了持续的高惊讶度。

05 风格vs内容:为什么简单检测器会误判?

评测一个新框架的成色,光看它能不能分清"人类写的"和"AI写的"远远不够——还得看它会不会被文本表面的"伪装"骗过去。论文设计了一个很刁钻的压力测试:拿真实人类文章,做两种"表面彻底AI化"的处理。
第一种叫"要点重建":把人类文章压缩成若干bullet要点,再用LLM把这些要点重写成一篇完整文章。这样一来,从"文字表面"看,最终文本已经经历了LLM的压缩和LLM的重建,任何一个常规AI检测器都会把它当成AI生成。但VOLM打完分后发现,它的曲线并没有跑到AI那边去,而是仍然老老实实贴着原始人类文章的曲线——因为那些要点里的信息是记者实地采访来的,模型无法凭空捏造,重写并没有消除这个信息增量。
第二种叫"往返翻译",先把文章翻译成德语或韩语,再翻译回英语。两次翻译已经把所有英语措辞都打散了,但结果还是一样——VOLM依然能从信息层面认出这是"有人类原创贡献"的文本。
更狠的测试还在后头。现在市面上有一种叫humanizer的对抗工具,专门用来"去AI味"——故意在AI生成文本里插入语法小瑕疵、口语化表达,让检测器以为作者是普通人类。论文用DIPPER攻击器做了测试,VOLM对这种"假装人类"的文本依然不买账,曲线和真正的AI参考文档更接近,而不是跑到人类那边。这说明VOLM抓的确实是"信息有没有增量"这个本质,而不是"文字像谁写的"。
不过实验并不是一帆风顺。研究者发现,如果让AI文本经过一个更强的生成模型(比如Qwen)改写,VOLM得分会卡在中间地带,不上不下。追查下来发现玄机出在"选词"上——提取器提取事实时,会把原文里一些具体的形容词和名词一并带走;重建器拿到这些词,写文章时倾向于继续用这些词。而humanizer改写后的文本用了另一批"同义但不同形"的词,模型对这批词更"惊讶",就误以为遇上了原创内容。这就是论文里说的"残余风格混杂"问题。
图5:文档的具体用词在压缩和重建过程中的保留情况对比
图5:文档的具体用词在压缩与重建过程中被保留的示例,上方为参考LLM生成文章,下方为同一文章经DIPPER humanizer处理后的版本,蓝色和橙色分别标记两篇文章各自的描述性用词,它们均完整通过了提取器和重建器
怎么解决?论文的对策是给提取器戴上"紧箍咒"——引入WordNet词网做词义消歧和动词规范化。把动词统一到规范的原形之后,提取器"夹带私货"的空间就小了。论文报告了一个相当惊人的数据:加了WordNet规范化之后,人类写作和humanizer文本之间的曲线差距整体缩小了72.4%。提取器越"死板",风格漏洞越小,测量结果越干净。
图6:六种提取器设计下各来源文本配对AUC差距的变化趋势
图6:六种提取器设计下各来源文本配对AUC差距的变化趋势。提取器的信息提取越"锋利",humanized文本看起来就越像无条件的LLM输出

06 未来展望:当人机边界持续模糊

VOLM最漂亮的一点是,它本质上是一个"模型无关"的框架。它不训练任何分类器,不需要任何标注数据,只需要现成的语言模型M(Llama 3.1 8B Instruct就够了)去算log-probability。这意味着任何个人和团队都可以在几天内把它复现出来,接到自己的评测流程里。


龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?康奈尔大学提出VOLM框架,不再测“文本有多少是AI写的”,而是测“想法有多少是你原创的”。该方法无需训练、不评分原文,通过逐级提取内容并让LLM重建,就能区分真实思想贡献与表面文风差异,在新闻、同行评审、议论文三大领域均取得稳定
这篇工作最值得看的点是什么?VOLM能有效区分人类撰写文档与LLM生成的匹配文档,同时对内容保持性变换(LLM重建、往返翻译)保持高度不变性;对来自不同LLM的文本和经过人类化处理的文本,VOLM分数较低但非零,表明存在残余风格差异
这篇工作的边界或风险在哪里?优点:(1)无需训练和标注数据,易于采用和适应;(2)不直接评分文档表面文本,避免风格混淆;(3)框架通用,可适用于任何文档与任务描述配对;(4)对内容保持性变换具有鲁棒性。缺点:(1)残余风格差异仍会影响结果,导致不同LLM生成的文本或人类化文本获得非零VOLM分数;(2)提取器的设计对结果影响显著,需要精心设计;(3)计算开销较大,需要多次提取和重建;(4)对任务描述T的选择敏感。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出VOLM框架,通过提取文档在不同粒度下的内容表示,用LLM重建文档并计算其相对于仅由任务描述生成的重建文档的惊讶度差异,从而量化人类作者在LLM基础上的原创贡献。

实验合理度:★★★★☆

平均每token对数概率(log-probability)、VOLM分数(0到1之间)、AUC差异

学术研究价值:★★★★☆

提出VOLM框架,通过提取文档在不同粒度下的内容表示,用LLM重建文档并计算其相对于仅由任务描述生成的重建文档的惊讶度差异,从而量化人类作者在LLM基础上的原创贡献;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(无需训练,仅需推理)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)残余风格差异仍会影响结果,导致不同LLM生成的文本或人类化文本获得非零VOLM分数;(2)提取器的设计对结果影响显著,需要精心设计;(3)计算开销较大,需要多次提取和重建;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球