
原论文信息如下:
01 从棒球统计说起:什么是"替换价值"
想象一下,你是一个棒球队的经理。你怎么判断一个球员到底值不值得拿高薪?
你不会只看他的本垒打数量或者打击率——因为这些数据很大程度上取决于对手的投手水平、主场的场地条件。真正聪明的做法,是拿他跟"随便从自由球员市场捞一个底薪替补"相比。这个替补,就是棒球圈子里赫赫有名的"替换级球员"(Replacement-Level Player)。
于是,著名统计学家Keith Woolner提出了VORP(Value Over Replacement Player),即"替换球员价值"——你关心的不是这个球员自己得了多少分,而是他比一个不需要任何成本就能获得的替补多贡献了多少分。这听上去只是一个统计口径的小调整,却在棒球数据分析史上留下了浓墨重彩的一笔。
为什么要用这么长的篇幅讲棒球?
因为康奈尔大学这篇刚刚发表的论文,几乎把VORP的底层逻辑,从棒球场平移到了大语言模型的评测场上。当所有人都在问"这段文字是不是AI写的"时,这篇论文提出了一个直击灵魂的新问题——
"这篇文章里,有多少信息是模型本就能轻松写出来的?又有多少是作者真正动脑贡献的?"
这个问题,把学术界和工业界争论不休的"AI检测",从一个识别游戏,硬生生拔高到了"贡献度量"的高度。看起来,人家玩的才是Next Level。
02 现有AI检测器,到底在检测什么?
在详细介绍VOLM框架之前,不妨先来看看现在的AI检测器都在干什么。
近两年,AI检测赛道可以说是卷成了红海。早期的DetectGPT这类方法,发现了一个有趣的现象:把一段AI生成的文字稍微改写一下,模型给它的概率往往会下降;而人类写的文字,改写后的概率可能升也可能降。基于这个"概率曲率"特征,就能把AI生成文本挑出来。
后来的方法越来越精细。有的把人类文本和AI文本分别建模成两个分布,在分布层面做区分;最新的EditLens则更进一步,不再二分类,而是训练一个深度模型,输出一个0到1之间的连续值,表示一篇文章有多少比例被AI"编辑"过。
听起来很厉害是不是?但这些方法有一个共同的底层设定——它们测的都是文本表面形式。AI用自己的风格写出来的句子,算AI的;AI帮人把一段口语化的想法改写成正式书面语,也算AI的;AI把一个中国学者的中文论点翻译成英文,按照这些检测器的逻辑,整个英语文本都该记在AI头上。
但问题来了——
如果一位审稿人认真读了一篇论文,发现了里面证明的漏洞,指出了实验对比的不公平,然后请AI帮他把这些观点组织成通顺的评审意见。虽然最终文本几乎全是AI生成的,但里面的核心思想——那个真正有价值的"发现",是他自己想出来的。这时候你说"这是AI写的评审",合适吗?
再比如,一位科研人员用母语想了完整的论证逻辑,然后交给AI翻译成英文投稿。翻译这件事是AI干的,但"这篇论文想表达什么"这件事,AI一点忙都没帮上。如果我们用的检测标准是"这段文字是谁写的",那AI翻译后的文字显然全判给AI——可这合适吗?
不光是科研圈,新闻行业也很头疼。2025年10月一项研究发现,美国报纸上约9%的新文章部分或完全由AI生成。但"AI生成"这四个字的语义太模糊了:它既包括记者写一句话让AI扩写成篇,也包括记者想好了完整观点、只让AI帮忙调调语序。这两种情况下的"AI含量"天差地别,但所有检测工具的输出,很可能都是同一个刺眼的红色警告。
正是看到了这个巨大的语义鸿沟,康奈尔大学的几位研究者决定,不再纠结文本是谁写的,而是直接度量"信息含量是谁供的"。
03 惊艳的思路:如何度量"想法归谁"?
论文将这套新框架命名为VOLM,全称是Value Over Language Model,中文可以翻译成"语言模型之上的价值"。
这个名字显然是刻意致敬VORP——它要测量的,正是一份文档的作者,在语言模型这个"替补球员"之上额外创造的价值。
VOLM的想法非常巧妙。它让判断"这篇文章是否有原创贡献"这个问题,变成了一个可以量化、可以对比的问题。
具体怎么做到的呢?
先想想如果你是一个语言模型,你拿到一个任务描述(比如"为一篇新闻稿写个开头"),你会很自然地按照海量训练数据中学到的模式和偏好,写出一个"最典型"的开头。这篇开头里没有任何特定于这篇新闻的信息,它只是一个"标准模型输出"。
现在再想想,如果模型拿到任务描述之后,还额外看到了这篇文章的几个关键信息,比如"主角是某某公司""融资三千万美元""这是2026年最新一轮融资"——这时候模型再写出来的开头,就会非常接近这篇真实文章的开头了。
关键洞察来了:
如果一篇新闻文章只是把那些"模型自己早就知道的东西"重新组织了一遍,那么哪怕你只给模型几个提示词,它写出来的东西也已经和原文大差不差了。但反过来,如果一篇新闻文章里包含了大量模型凭任务描述无法准确猜到的独家信息——比如记者的现场见闻、采访对象的独特引语、数据背后的分析和洞察——那么想要让模型"复原"出这篇新闻,你得把文章里越来越多的核心事实一点点喂给它,它才能拼出接近原文的轮廓。
换句话说:
文章的"原创贡献"有多大,取决于它在多大程度上超出了模型凭任务描述就能"无中生有"写出来的水平。模型需要你提供越多额外信息才能写出接近原文的文章,说明你的原创贡献越大——这就把"贡献衡量"变成了一个可以逐步揭示的"信息缺口测试"。
VOLM给这个"信息缺口"起了一个很形象的名字——"逐级惊讶程度"(surprisal)。如果模型看到越来越多的文章内容之后还是"很惊讶",说明你写的确实都是它猜不到的东西;如果模型看了几个要点就不惊讶了,那说明它早就知道你会写什么了。
这个想法非常聪明,但真正让这套方法走通的,是论文里下面要讲的那个精巧的"三层流水线"设计。
VOLM框架示意图:文档经提取器压缩信息、重建器生成、打分器评估的全流程
04 层层递进:从"提取-重建"到"打分"
VOLM的第一层,叫作"提取-重建-打分"流水线。整个框架由三个核心组件构成。
第一个组件是提取器(Extractor),它的任务是把一篇长文章"压缩"成不同粒度的摘要。粒度是什么意思?想象一篇1000字的新闻稿,最粗的粒度可以是"标题"级别的信息,也就是一句话浓缩全文;然后逐步细化,变成20%长度的要点、50%长度的摘要——一直到90%的压缩比,内容越来越接近全文。这套框架的高低取决于"内容压缩到什么程度才能让模型复原出这篇原文"。
不是让模型直接复述原文,而是让模型"假装重新写文章",从而剥离开文本表面的风格特征——这就是"重建"的用意所在。
它的名字很直白,第二个组件就叫重建器(Reconstructor)。对于刚才提取出来的每一级粒度(比如10%的要点的文章),重建器会把它作为额外背景信息,结合原始的任务描述,让语言模型从零开始重写一篇完整的文章。这里的关键是重建器重写出来的文章必须是模型自己生成的完整文本,而不是原文本身。
为什么要多此一举?
如果你直接拿原文去评估,那么人类作品和AI作品的差异中,不但包含"信息含量"的差异,还包含了巨量的表面风格差异——比如人类说话更随意、词汇选择更个性化、句子长短节奏和AI惯用的模板化表达完全不同。但VOLM要测量的只有一个纯粹的变量:模型是否对这个文本的"内容"感到惊讶,而不是对它的"措辞"感到惊讶。所有通过检测器打分和重建的文本都是AI模型生成的,所以文风上就拉平了。
最后一层,打分器(Scoring)用同一个模型,只给定任务描述,不给任何其他辅助信息,去计算每一篇重建文章的平均逐token对数概率。这个分数反应的实际上就是:模型在没有看到原文任何细节的情况下,能在多大程度上“猜到”这篇文章的词句。
想象两个极端。如果你拿到的是模型自己生成的文章,那它在重建时给的信息完全是它自己早已拥有的内容,模型打分时自然会非常给面子,分数不会太低。但如果你拿到的是一篇洞察独到的深度报道,模型读到这些重写后的内容时就会想:这写的是什么?我可猜不到——分数就会显著走低。
有了打分之后,就需要一条参照物了。这就像VORP必须定义"替换级球员"是什么水平,VOLM也定义了自己的"替换级文档"——那就是直接让语言模型M只用任务描述、不提供任何额外信息生成一篇基础文章,然后把它当成那条"地板上"的基准线。
此后每往后看一层,就会发现人和AI的得分曲线开始分离。一些文档从最细粒度开始,就和基准文档出现了显著差异——差异出现得越早,说明即使只看一点点内容,模型也已经"猜不透"这篇文档了,这就叫"原创贡献很大"。
一些文档则要到提供到80%-90%内容时才出现差异——差异出现得越晚,说明前面那80%内容都是模型自己闭着眼也能写出来的老套路,仅仅靠最后一点点细节支撑着文章的独特性。这项测试的结果是一个0到1之间的数值,很像一个"原创贡献率"。
至此,一个完整的框架搭建完毕。看起来每一步都不复杂,但把这几个组件串联起来之后,它在多个场景里展现出的"抗风格干扰能力",才是真正的惊艳之处。
05 实验验证:AI改写后,它依然认得"谁是真原创"
为了验证这套新体系是否真的比传统检测器更有洞察力,科研人员在三个真实世界的高价值场景上做了测试。
第一个是新闻语料库All the News里的100篇真实报道。第二个来自学术同行评议——他们从ICLR 2023的会议论文里随机抽取了200篇,每篇挑出一份真实评审意见。第三个则是说服性议论文写作语料PERSUADE 2.0里的200篇学生习作。
每个场景中,论文都把"给出标题让大模型直接写一篇新闻""给出论文全文让大模型写一篇评审意见""给出题目让大模型写一篇议论文"作为匹配的LLM替代文档。
实验的基准测试环节中,他们用0到100%的粒度去压缩这些文档。如果一篇新闻真的是记者实地采访获得的独家信息,那么哪怕只给模型看10%的要点,它重建出来的文章也会和"模型自己凭标题瞎编的文章"形成巨大差异;反之,如果是一篇毫无信息增量的通稿,则两条曲线会非常接近。
下面这个图给出了All the News数据的核心结果。可以看到人类的分数曲线从最左侧(10%粒度)就和参考LLM基线拉开了明显距离,而参考LLM自己的曲线几乎是一条平缓下降的直线。
人类撰写语料 vs 参考级LLM生成语料的平均对数概率曲线。人类语料随内容揭示快速偏离,而参考LLM语料的变化非常平缓
这就是这套方法想要建立的直觉:值得阅读的文章,必须是模型感到意外的文章。
06 最精彩的部分:它能抗住风格改写吗?
常规检测器最怕遇到什么?最怕的是"风格迁移"。AI写的文章只要换一种口气,或者故意模仿人类的措辞风格,很多检测器的置信度就会瞬间崩塌。
VOLM论文在这个环节上做了专门的针对测试,结果相当精彩。他们拿真实的人类文章制造了两个变形版本。
第一个是bullet-reconstructed变体:把人类文章压缩成几个子弹要点,再用AI模型重写成一篇全新的文章。这段话经历了LLM的压缩和LLM的重写——无论从哪个角度看,它的"表面文本"都应该算作AI写的吧?
第二个是round-trip translated变体:先拿人类文章翻译成德语,再从德语翻译回英语,制造一个经过两次翻译的版本,原文的很多措辞和句式都已经彻底丢失了。
结果发现,无论经过上面哪一种操作,VOLM的打分曲线都和原始人类文章曲线紧密贴合,并且显著区别于那些"模型自行创作"的文本。
说明VOLM确实捕捉到了那些语言模型改写不掉的东西——事实信息本身。文字可以不断翻译、重写,但"作者亲自采访了某位市政官员,对方透露了明年要削减预算"这件事,是任何风格改写都无法抹除的信息增量。
实验做到这一步,论文还没满足。他们加试了当前最头疼的对抗场景——"人味儿化"改写。所谓humanizer,就是专门设计用来欺骗AI检测器的改写工具,原理是故意在AI文本里加入语法小瑕疵、口语化断句,让检测器误以为作者是普通人类。传统的AI检测器在humanizer面前败下阵来几乎是家常便饭。
论文用DIPPER攻击器生产的改写文本,在VOLM下会得多少分呢?答案是:曲线位置依然距离人类原始文章很远,而和"参考级LLM基线"的上方徘徊。也就是说,虽然humanizer让文本表面看起来像人类写的,但由于它并没有在信息层面添加任何新的东西,VOLM依然精准地辨识出"这个文本的底子还是A货"。
鲁棒性对比:换用不同生成模型(Qwen)或经人类化改写(Humanizer)的文本,VOLM曲线仍能识别其未包含真实人类原创信息
07 一个有味道的实验:词穷的提取器带来的困惑
论文最开头提到了三组实验结果,其中一组有些"尴尬":Qwen生成的文本或经过humanizer改写后的文本,并没有完全贴到参考级LLM基线那条线上,而是悬在中间,好像获得了某种不低的"原创贡献值"。作为对照组,这显然不太好解释。
研究团队顺着这个意外发现一路追查,找到了一个很有意思的原因:词汇选择的惯性。
具体来说,提取器在压缩文本时,往往会保留原文中一些非常具体的形容词和名词。当重建器拿到这些压缩要点时,它就会"顺着梯子往上爬",倾向于保留这些具体的词汇,而不是另起炉灶完全重写。
打个比方,原文里写"这首歌有忧郁的旋律和深情的歌词",提取器把它作为要点记下来,重建器在重写时就可能继续使用"忧郁的"和"深情的"这两个词。而humanizer改写后的文本说的是"悲伤的曲调"和"真诚的歌词"——由于提取器把"悲伤的"和"真诚的"也带进了重建过程,模型打分时就觉得这是"模型不熟悉的新词",于是给了一个较低的分数,仿佛这篇文章真的是人类写的。
这就是论文反复强调的"残余风格混杂问题"。VOLM原本的设计目标是不让使用什么词影响评价,只关心"内容是否意外",但具体的选词这一环,还是把风格信息偷偷塞了进来。
不过论文紧接着又提供了一个很妙的对策:如果让提取器再"较真"一点,把动词都统一通过WordNet词网规范成一个固定含义的原形动词,词汇自由度就会被强制压缩。做了这个操作之后,人类写作和humanizer假装的文本之间的曲线差距,整体缩小了72.4%。词义的约束成了消灭伪原创的一把快刀,提取器越「死板」,风格漏洞越小。
08 龙哥点评:这场人机合著时代的新度量衡实验
在AI写作工具已成基础设施的今天,怎么衡量人的贡献,是这个时代真正值得回答的问题。
VOLM这个框架最有价值的,不是它给出了一个新的「AI检测器替代品」,而是它提供了一个完全不同的思想方向。传统检测器在方法论上本质是一个"作者预测器"——判断这段文字更可能是人写的还是机器写的。这类系统的天花板在于,一旦AI模型能够模拟人类的写作风格或人类刻意模仿AI的口吻,它的根基就动摇了。而VOLM发现了一条不靠"作者身份"、只靠"信息缺口"来评测的路径——它真正关注的不是谁执笔,而是谁的思想在驱动内容。
具体有几个点值得强调。
第一,VOLM是训练无关的。它完全依靠现成的语言模型计算log-probability,不需要标注数据,理论上任何组织和个人都能在几天内复现并适配自己的场景。对大模型时代的评测体系来说,这是一个极大的加分项。
第二,它抓住了「内容」和「形式」的新区分维度。在写作这件事上,人类和AI的分工最核心的差异本来就不是「谁写了这句话」,而是「这句话描绘的事实、观点或逻辑链是哪一方构思出来的」。VOLM围绕这一层做的流水线设计逻辑自洽,实验设计也相对 02 从"谁写的"到"谁想的":重新定义写作贡献 03 VOLM框架:如何量化人类在AI之上的"增量价值" 提取器(Extractor) 重建器(Reconstructor) 打分器与参考文档 04 三大领域验证:新闻、同行评审与议论文 05 风格vs内容:为什么简单检测器会误判? 06 未来展望:当人机边界持续模糊01 当AI写了一半论文,功劳该算谁的?
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
提出VOLM框架,通过提取文档在不同粒度下的内容表示,用LLM重建文档并计算其相对于仅由任务描述生成的重建文档的惊讶度差异,从而量化人类作者在LLM基础上的原创贡献。实验合理度:★★★★☆
平均每token对数概率(log-probability)、VOLM分数(0到1之间)、AUC差异学术研究价值:★★★★☆
提出VOLM框架,通过提取文档在不同粒度下的内容表示,用LLM重建文档并计算其相对于仅由任务描述生成的重建文档的惊讶度差异,从而量化人类作者在LLM基础上的原创贡献;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
不适用(无需训练,仅需推理)复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:(1)残余风格差异仍会影响结果,导致不同LLM生成的文本或人类化文本获得非零VOLM分数;(2)提取器的设计对结果影响显著,需要精心设计;(3)计算开销较大,需要多次提取和重建;
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!