← 返回 PaperDaily 大模型与智能体

别让AI空谈科研:北大华为六字段契约让"可证伪性"不再只是口号

如何判断大模型提出的科研设想靠不靠谱?北大、华为等机构给出一个硬核标准:让模型先写清楚,什么观察结果能证明它自己错。全新Lit2Test基准用六字段契约把可证伪性变成可检验的文本属性,在1200个标准对、2400次盲评下排出GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2的严格名次,人类一致率87.2%。

别让AI空谈科研:北大华为六字段契约让"可证伪性"不再只是口号
原论文信息如下:
论文标题:
What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation
发表日期:
2026年08月
发表单位:
北京大学多媒体信息处理国家重点实验室、北京大学计算机学院、天津大学、海南大学、华为技术有限公司
原文链接:
https://arxiv.org/pdf/2608.22948v1.pdf

如果一条科研设想永远不可能被证明是错的,那它还算科学吗?这个问题放在大模型身上,就变成了一个有点扎心的现实拷问:现在AI已经能洋洋洒洒写出研究计划、假设甚至整篇论文了,可我们到底该怎么判断这些设想是真好还是假好?
过去大家常用的办法不外乎两种。一种是找个人或者找个模型当评委,直接说哪个想法更好,这玩意儿主观性强得离谱,换个排版顺序都能改变结论。另一种是拿未来的论文当标准答案,看哪个设想跟后续发表的论文更接近,可现实里科研路径本来就千条万条,一篇论文凭什么就代表最优解?再加上数据污染问题,模型要是提前"见过"那篇论文,整个评测就失真了。

研究思路评估的困境:现有范式为何失效

Lit2Test的作者开篇就点了一个很有意思的现象:同一个科研设想,放在不同评估范式下,得到的结论竟然可以相互矛盾。论文用一组真实的ICLR长上下文问答邻域作为例子。这个邻域里有四篇论文,ALR2声称检索
现在大模型写科研设想已经不是什么新鲜事了,但怎么判断这些设想的质量,学术圈其实一直没找到特别靠谱的尺子。Lit2Test的论文开篇就点出一个非常扎心的现象:同一个科研设想,放在不同评估范式下,结论居然可以互相打架。为了把这事儿说清楚,论文用了一个真实的ICLR长上下文问答(Long-context Question Answering,即让模型处理超长文本并回答问题)邻域来演示。这个邻域里有四篇论文:ALR2说自己搞的“先检索再推理”(retrieve-then-reason)能减少幻觉事实,并把功劳记在自己的对齐步骤上;而ChatQA 2则说,让长上下文模型多检索一些就够了,根本不需要那么复杂的对齐。
这四篇论文摆在一起,留下一个开放问题:“先检索再推理”除了单纯增加检索量之外,到底有没有额外收益?这个问题如果抛给一个什么都不约束的AI,它能滔滔不绝讲上几百字,说得天花乱坠,但就是不告诉你:到底做个什么实验、量什么指标、看到什么结果就算你输了。而Lit2Test要做的就是把这个模糊的“研究设想”压缩成一个有明确判定规则的单元。论文用这个具体案例展示了三种评估范式的巨大差异,直接从根上暴露了现有评估方式的毛病,如下图所示。
图1:三种评估范式在同一个输入上的对比,左图为自由文本评判,中图为以未来论文为答案的打分,右图为六字段契约路径
三种评估范式在同一真实ICLR长上下文问答邻域上的实际运行结果。其中想法I由GPT-5.2生成,想法II由GLM-5生成。两种现有范式结论分歧:(a)自由文本评判在两个展示顺序下都偏好想法I;(b)以未来论文为答案的打分(Shi等人, 2024)偏好想法II,且随答案论文的选择而反转;(c)六字段契约路径在两种顺序下评判同一对模型按契约书写的提案,给出有依据的判定;“order-audited”表示每一对都在两种展示顺序下分别评判。
先说第一种范式:自由文本评判。这玩意儿最省事,直接让一个LLM评委说哪个想法更好就完事了。但问题在于,这种评判没有给评委任何决策规则。评委说“这个想法更有新意”“那个计划可行性更高”,全凭主观感觉。更麻烦的是,LLM作为评委有位置偏差(position bias),同一个想法换个展示顺序,结论就变了。而且自由风格的话术极其影响判断,论文指出“idea quality”本质上就是一个没有决策规则的对象,你说它好它就好,你说它差它就差,没有统一标尺。
第二种范式看起来“科学”一些:拿未来的论文当答案。也就是看你的设想跟后来真实发表的论文在多大程度上吻合。但这条路也走不通,原因有二。第一,科研路径本是千条万条,现实中发表的那篇论文只是众多可能路径里的一条,凭啥它就能代表最优解?比如前面那个长上下文QA邻域,ALR2走的是“检索+对齐”路线,ChatQA 2走的是“多检索+长上下文”路线,两条路都有自己的道理,拿其中任何一篇当标准答案去评判设想,都是在惩罚走了另一条合理路线的想法。第二,数据污染问题。如果模型在训练时“见过”那篇未来论文,那整个评测分数就直接失真了。论文引用了Qiu等人2025年和Guo等人2025年的相关工作,指出这些以“后续论文匹配度”为核心打分的基准都存在这个问题。
更麻烦的是,这两种范式给出的结论可以完全相反。在论文的演示案例里,自由文本评判在两个展示顺序下都偏好想法I,而未来论文打分法则偏好想法II。也就是说,你选哪种评估方式,直接决定了你得出哪个结论。这就让人不禁想问:连评估工具本身的结论都这么不稳定,我们凭什么相信单个基准给出的“模型科研能力排名”?
621df26778f05KkH

六字段契约:让可证伪性成为可检验的文本属性

既然自由评判和未来论文打分都不靠谱,那怎么办?Lit2Test的思路很“波普尔”:一个科研设想好不好,关键看它是否承诺了“什么观测能证明我错了”。如果一个设想永远不可能被证明是错的,那它就不具备可证伪性(falsifiability),自然也就谈不上科学的严谨性。这个想法本身不算特别新,但Lit2Test的厉害之处在于,它把这种哲学理念变成了一个可操作的文本契约。
这个契约叫“六字段契约”(six-field contract),每个提案必须包含六个字段:文献缺口(literature gap)、假设(hypothesis)、最小测试(minimal test)、决定性指标(decisive metric)、支持结果(supporting result)和反证结果(falsifying result)。这六个字段缺一不可。去掉任意一个,成对比较就失去了共同的决策结构。论文用了一个很形象的词来描述这个设计:把可证伪性从“抽象美德”转变成“文本的即可检验属性”。
仔细拆开看这六个字段,会发现每个字段都是冲着某个具体评估痛点去的。文献缺口字段把提案绑定到给定的论文邻域上,评的是“文献综合能力”而不是“空泛头脑风暴”。假设字段要求把方向磨成带条件、带机制、带预期差异的明确断言,让评委判定的是“一个命题”而不是“一个愿望”。最小测试字段有两个任务:一是把提案的粒度标准化,避免“我打算研究整个领域”这种大而空的项目赢过小而精的实验;二是评分标准里有一条“反宏大叙事条款”,谁的实验最小且最能区分假设,谁就得分高。决定性指标字段要求指明能判定机制的那个测量量,防止用“准确率涨了”这种怎么解释都行的聚合指标糊弄过去。最核心的是支持结果和反证结果两个字段,它们合在一起构成双向决策规则:既写清楚什么观测能支持你,也写清楚什么观测能推翻你。
这套设计里有一个细节非常值得品味:反证结果不一定是数值。论文明确说了,定性方向也可以是可证伪的——只要指标、对比和矛盾观测在操作层面足够清晰。这个细节避免了把评测变成“只有做实验的人才能参与的游戏”,也保证了理论性、定性类设想也能被纳入评测范围。
六字段契约这件事,乍一看是给模型加了紧箍咒,但论文专门做了对照实验来回应“约束会伤害创造力”的质疑。他们发现:把同样的内容用结构化schema还是用散文形式呈现,对评判结果没有影响;而加上契约约束的提案,明显碾压朴素基线。换句话说,要求模型先写清楚“什么能证明我错了”,不是给它戴镣铐,而是逼它把想法真正想透。
这套整体思路其实跟学术界的“注册报告”(Registered Report)制度一脉相承。注册报告要求研究者在收集数据之前就预注册好确证性和证伪性的结果。Lit2Test把这个科学界的成熟实践改造成了模型可评估的单元。论文还对比了HARPA、AI Co-Scientist、ResearchStudio-Idea(IdeaSpark)等系统:这些系统虽然从不同角度引入了可证伪性,但要么是只把它当作生成时的安全机制、最终评判时不看这个字段,要么是让模型先跑实验再分类结果。Lit2Test的不同之处在于,它要求在提案生成时、在被评判的答案内部,就预承诺双向决策规则。下表的定位对比可以看得很清楚。
表2:Lit2Test与最接近的科研设想评测邻居的定位对比
表2:Lit2Test与最接近的科研设想评测邻居的定位对比。“Min. test”代表提案是否必须指定最小受控实验;“Metric”代表是否要求给出可裁决的测量量;“Sup./Fals.”代表是否要求并评估显式的双向结果(支持/反证);“Order”代表是否测量同一对正反顺序的反转;“Human”代表是否有人类标定;“Answer key”代表打分所用的参考信号是哪种类型。Y=是,P=部分或仅生成阶段,N=否。

前瞻性构建与审计协议:Lit2Test的方法论创新

光有六字段契约还不够,评测管线的可靠性同样重要。Lit2Test在构建和评估流程上下了很重的功夫,整体管线如图2所示。数据集构建方面,论文从OpenReview和ICLR相关的近期文献里挑出了800篇不重复的论文,按每40篇一个批次组成200个文献邻域,每个邻域4篇论文配成一个团队。构造时要求这4篇论文共享同一个主题但存在跨论文张力,也就是它们之间有可以通过小规模实验裁决的分歧。
图2:Lit2Test管线全貌:(a)基准构建流程与(b)评估协议,展示邻域#034在各阶段的流向
图2:Lit2Test管线全貌。(a)基准构建流程;(b)随附的评估协议。示例芯片追踪邻域#034(即图1中的那个ICLR邻域)在每一个阶段的流向。1200个标准对每个都在正反两种顺序下评判,最终折叠为950个顺序稳定案例加250个顺序敏感案例;只有稳定案例参与排名聚合。
论文特别强调一个词:前瞻性构建(prospective construction)。什么意思?就是在数据收集阶段,不预设任何“正确答案”,不为任何一个邻域指定“未来哪篇论文才是对的”。所有参与评测的模型拿到的是完全相同的固定上下文,输出之间的差异纯粹反映提案质量而非检索能力差异。同时,来源审计(provenance audit)会逐一追溯每篇论文的出处,从源头堵住数据污染的漏洞。
参与生成提案的四个模型是GPT-5.2、Claude Sonnet 4.6、GLM-5和DeepSeek-V3.2,每个模型在每个邻域产生一份原生六字段提案,注意是直接按schema生成而不是事后转换。四个模型×200个邻域就是800份提案,每4份配成6对,得到1200个标准对(canonical pair)。每个标准对在正反两种展示顺序下由不参与提案生成的第三方评委Gemini 3.1 Pro(Preview)做盲评,共产生2400个有序判断。这里有一个关键设计:反向展示时通过方向门控(orientation gate)验证A/B内容确实做了交换,保证“顺序敏感性分析”建立在真实反转之上,而不是复制粘贴的错误上。
评判结果的聚合不是简单粗暴地统计胜场,而是用“顺序折叠”(order folding)的方式:正反两个顺序的判定结果如果一致,就归为“顺序稳定案例”;如果结果相反,或者至少一个顺序给出了平局,就归为“顺序敏感案例”。这样一套操作下来,1200个标准对最终折叠成950个顺序稳定案例和250个顺序敏感案例。顺序敏感案例被单独报出来,不参与排名聚合,因为这类案例反映的是评委无法消解的比较,对称平均的处理方式反而会掩盖这种不确定性。论文很坦率:保留这些敏感案例,本身就是在给排序划定可靠性的边界。
稳定案例进入Bradley–Terry模型(一种成对比较的经典统计模型,用于从两两对决的结果中估计每个对象的“能力值”)做参数估计,康多塞决胜关系(Condorcet,即某个候选者在所有一对一对比中都胜过对手的支配关系)则用来无参数地概括优劣关系。不确定性估计用的是案例级自举法(case-level bootstrap,通过对原始样本做有放回重采样来估计统计量的分布),重采样1万次。这种设计很有讲究:统计单元是标准对而不是有序行,避免了把正反两个判断当作独立样本造成的样本量虚增。
前面这些还只是骨架,真正的亮点在于论文精心设计的一组诊断控制实验,专门用来回答“你这评测到底测的是内容还是形式”“评委是真的在看门道还是凭感觉”。这组控制实验大致分为五层。
维度分解审计从1200个标准对里抽了90对,让评委在文献锚定、假设明确性、最小可行测试、决定指标、可证伪性这五个维度上打分,看看结构化维度评价与整体评判是否吻合。隐藏控制把朴素关键词模板生成的提案混在真实提案里让评委挑,8个自动审计席位全部命中真实提案。同源渲染控制把同一份提案分别用schema和散文两种形式呈现,看评委会不会被格式带偏。单字段污染检查每次只破坏一个字段(文献锚定、决定指标或可证伪性),要求干净提案在正反顺序下都得赢。微妙污染审计更进一步,用自然的、风格匹配的缺陷代替明显缺陷,并配对“假装修饰”,确保评委对干净提案的偏好是净效应,而不是表面文字加工带来的。
这组诊断设计的巧妙之处在于,它把“评委是否靠谱”这件事本身变成了一个可以验证的命题。评委要是瞎打分,单字段污染检查肯定挂掉;评委要是被文风带偏,渲染控制和微妙污染审计就会露出马脚。这种“评判评判者”的元评估思路,在科研设想评测领域并不多见。

实证发现:模型排序、驱动因素与人类佐证

Lit2Test的实证部分围绕三个研究问题展开,每个问题同时也追问“评测工具本身的可信度”。先看最重要的RQ1:模型排序及其鲁棒性。折叠后的950个稳定案例进了Bradley–Terry拟合和康多塞分析,得到的排序是GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2,而且这个完整排序在全部1万次案例级自举重采样中都被完整恢复。
表1:Lit2Test主结果表
表1:Lit2Test主结果。BT列是Bradley–Terry模型在顺序稳定案例上拟合得到的居中对数能力值;95%置信区间来自1万次案例级自举。主评委与J2的稳定胜-负-平记录:每个模型参与600个折叠案例的胜、负、平次数,其中胜/负计稳定案例,平计顺序敏感案例。主评委是Gemini 3.1 Pro(Preview),J2是独立第二评委Doubao Seed 2.0 Pro(重评全部2400个比较)。逐对折叠胜负平:以行模型视角统计的每对200个折叠案例的胜负平(主评委)。人工胜率:分层人工标定研究(20个邻域、90个真实对、3位标注者,平局记0.5)的多数胜率。
这个排序是严格的康多塞序:每个排名更高的模型在对每一个排名更低的模型的稳定对决中都获胜。按批次分别统计,5个构建批次里排序完全一致。作为交叉验证,研究者还端出了另一个评委——豆包Seed 2.0 Pro(Doubao Seed 2.0 Pro),它的模型家族跟4个参赛者和主评委都不同源。这个第二评委独立重评了全部2400个比较,复现了完全一致的排序,并且在顺序稳定比较中跟主评委的一致率是86.1%。这个跨评委一致性的证据非常有说服力,说明排序不是某个特定评委的“个人口味”。
论文还做了两组压力测试:把顺序敏感的250个案例全部计为平局,排序不变,自举完整恢复;哪怕做对抗性分配,把每个敏感案例都判给较低排名的模型,GPT-5.2和Claude Sonnet 4.6组成的上层结构依然纹丝不动,只是层内相邻位的顺序可能互换。这个“两层结构稳健、层内可能翻转”的结论,比一句“模型A最强”要精确得多,也诚实得多。
接下来看RQ2:什么因素驱动了这个排序?是模型的内容实质,还是花哨的文字表面?论文的维度分解审计显示:结构化整体判断跟整体评判在180个有序判断中一致152个,一致率84.4%。在模型自然输出之间,最小可行性(minimality/feasibility)是区分度最强的维度,而可证伪性字段的区分度最低——180个判断里只有33个给出了非平局的维度判定,只有1个比较把它当作决定维度。这个结果看似反直觉,但论文给出了合理解释:自然生成的提案中可证伪性普遍良好,各模型都通过了这道门槛,自然拉不开差距。这正好说明可证伪性是个“准入门槛”而不是“能力分水岭”。后续的操纵检查证实了这一点:一旦人为破坏可证伪性字段,评委立刻就能察觉。
风格问题也有直接回应。同源渲染控制证明:同一份提案,用schema还是散文呈现,不改变评判结果。单字段污染检查中,干净提案在三个维度各40个有序比较里全部获胜。微妙污染审计更是把“内容”和“风格”彻底分开:每个维度上,风格匹配的假修复改带来0个干净提案胜出、40个平局;而在扣除这种表面修饰基线后,干净提案的偏好值在三个维度上都是正数且置信区间排除零。这些证据叠加在一起,指向一个结论:评委在评判中追踪的是实质,而不是表面流畅度。
图3a:清晰与微妙单字段污染下的目标得分下降 图3b:微妙污染下对干净提案的修正后偏好 图3c:评委稳定案例BT强度与人类多数胜率的对比
图3:诊断控制与人类标定。(a)清晰与微妙单字段污染下的目标得分下降(0-4评分制,95%置信区间;每个维度n=20个案例):清晰污染产生大幅下降,微妙污染产生较小但非零的下降。(b)在微妙污染下、扣除风格匹配假修复改后的干净提案偏好值,所有置信区间均排除零。(c)评委稳定案例的Bradley–Terry强度与人类多数胜率的对比,虚线标出BT中点和随机基线。两种工具恢复了一致的排名和一致的两层分离。人类-评委一致率:决定性稳定案例34/39(87.2%),朴素控制检出率11/12,自举排名88.3%在一次反转以内。
最后是RQ3:人类是否认同这套自动评测的结论?论文做了一个分层人工标定研究,从200个邻域里分层抽了20个,覆盖90个真实模型对和4个隐藏的真实对朴素控制,3位标注者(资深的计算机专业本科生)在不知模型身份的情况下独立判断。结果分三个层面看:人类在12次朴素控制判断中识别出11次,说明人类确实能区分真实提案和模板水货;在60个顺序稳定的真实对里,39个产生了决定性的人类多数意见,其中34个跟Gemini的稳定判定一致,一致率87.2%;用人类多数标签拟合Bradley–Terry模型,恢复的排序跟主排序一致,88.3%的自举排名跟主排序的差异不超过一次反转,每一份自举样本都保持了“顶层对/底层对”的两层结构。
不过论文也没有回避人类标定的软肋:标注者之间的一致性并不高,Krippendorff's α只有0.238(胜者选择)和0.127(邻域筛选)。这种标注者之间的分歧,论文认为是“多数投票聚合和案例级自举可以部分吸收”的,但也坦率承认,这也划定了这个评测能证明的边界——人类佐证支持主要结论,但远不到“全量人类验证”的程度。这种边界意识贯穿全文,好几个关键数字后面都跟着置信区间和“bounded”这个词。

局限与展望:从可测试性到执行验证

Lit2Test目前测的是“提案是否具有可测试性”,但“可测试”和“测试后真的成功”是两回事。论文明确把这句话写进了范围声明:该基准衡量的是提案在当前文献语境下是否可测试,而不是它执行后会不会成功。这个边界很关键,它决定了Lit2Test的定位——它不是用来预测哪个科研想法能出成果的预言机,而是用来衡量模型能否提出一个“具备合格科学形态”的设想的体检仪。
这种边界意识也延伸到了“未来论文作为答案”这个范式的批判上。Lit2Test拒绝给任何邻域指定“正确延续”,因为一旦指定了某个未来论文当标准答案,你奖励的其实是“猜中哪条路被实现了”的能力,而不是“提出好问题”的能力。在知识截止日期不断后移的今天,这种设计也有效避免了数据污染的干扰。
展望一下,这个工作最值得期待的是它提供了一个可扩展的评测框架。Lit2Test的全套资产——基准本身、构建管线、审计产物——全部开源,意味着其他团队可以在这个框架上扩展邻域数量、更换参赛模型、调整评判维度。这就像给科研设想评测领域立了一个“USB接口标准”,后续的工作可以基于这个接口快速迭代,而不是每次从零开始造轮子。
R-C

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?北大、华为等机构提出Lit2Test基准,用六字段契约要求大模型事先写明“什么结果会证明自己错”,在200个真实论文邻域、1200个标准对上盲评四个前沿模型,得出严格排序GPT-5.2 > Claude Sonnet 4.6 >
这篇工作最值得看的点是什么?Lit2Test在全部10,000次bootstrap重复中恢复了四个模型的严格排序(GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2),排序由测试和指标设计质量驱动而非表面流畅度;人类校准研究在87.2%的决定性稳定案例中与评判者一致。
这篇工作的边界或风险在哪里?优点:(1) 提出六字段契约作为可证伪研究思路的统一评估单元,解决了现有评估范式缺乏共同决策规则的问题;(2) 前瞻性构建流程避免了未来论文作为答案键的污染问题;(3) 可靠性审计协议(顺序折叠、诊断控制、人类校准)使测量本身可被审计。缺点:(1) 人类校准范围有限(20/200邻域,3名标注者);(2) 规范评判者仍为单一LLM;(3) 未涉及实际实验执行验证;(4) 领域局限于ML相关文献。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把波普尔的可证伪性哲学思想变成可操作的六字段评估契约,用前瞻性构建避开未来论文污染,这套组合拳在科研设想评测里确实是头一份。不过每个单点技术(LLM-as-judge、顺序折叠、注册报告式设计)都已有先例,创新更多体现在组合方式而非全新发明。

实验合理度:★★★★★

1200个标准对、2400次盲评、双评委交叉验证、5层诊断控制加上人类标定,实验设计的严谨程度在同类工作里属于顶配。尤其是顺序折叠把250个敏感案例单独报出来而不硬凑排名,这种处理方式非常诚实。

学术研究价值:★★★★★

这个工作的研究价值不在于给出了一个“排行榜”,而在于提供了一套可复用的评测方法论。六字段契约+审计协议的组合,完全可以迁移到其他开放式生成任务的评估上。后续研究者可以直接拿这套框架做扩展,学术辐射面很广。

稳定性:★★★★☆

排序在1万次自举里全部恢复,第二评委也复现了相同排序,稳定性证据非常扎实。但评分标准依赖LLM作为终极裁判,虽然做了大量控制,LLM评委本身的稳定性和潜在偏差仍是一个无法完全消除的不确定因素。

适应性以及泛化能力:★★★★☆

200个邻域覆盖800篇论文,主题横跨长上下文问答等多个ICLR方向,有一定的领域广度。但所有邻域都来自OpenReview/ICLR邻近文献,其他学科(生物、化学、物理)的科研设想能否用这套框架评测,还需要进一步验证。

硬件需求及成本:★★★☆☆

完整跑一遍需要4个参赛模型各生成800份提案,加上主评委2400次盲评,算力消耗不小。不过评测是一次性投入,之后的推理成本可控;如果只评测新增模型,成本会大幅降低。

复现难度:★★★★☆

论文明确说了会发布基准、构建管线和审计产物,这对复现非常友好。但完整复现需要访问GPT-5.2、Claude Sonnet 4.6、GLM-5、DeepSeek-V3.2、Gemini 3.1 Pro等多个闭源模型,对没有这些API访问权限的团队来说,复现门槛偏高。

产品化成熟度:★★★☆☆

六字段契约本身可以直接嵌入科研辅助工具,作为模型生成研究计划的强制输出格式,这块落地路径清晰。但Lit2Test作为“评测基准”的产品化受限于模型API成本和频繁换代的模型版本,每换一个主评委就需要做版本化全套重跑,维护成本不低。

可能的问题:人类标注者一致性偏低(α=0.238),说明“哪个设想更适合作为下一步实验”这件事本质上还是存在较大的主观判断空间。人工标定只覆盖20个邻域,对整体结论的支撑强度有限。测试集从ICLR邻近文献构建,对非CS领域科研设想的评测适用性尚未验证。建议后续扩大领域覆盖,并探讨评委数量对判定稳定性的影响。

思路启发

这个工作对做评估类研究的读者有非常直接的启发:当评测对象是开放式生成内容时,与其费劲训练一个完美的打分模型,不如先定义好“什么是一个合格的回答单元”。Lit2Test先把“科研设想”压缩成六字段,然后把“好坏”变成“契约是否完整+每个字段是否达标”,这种先定义单元再定义质量的思路,可以迁移到代码生成、数据分析报告生成、产品方案生成等其他开放式任务上。另外,论文把“评委的不可靠”显式建模成评估对象(顺序敏感案例单独报告),而不是试图掩盖它,这种“把已知缺陷变成评估输出的一部分”的做法,也值得借鉴。

主要参考文献

[1] Ziyue Wang, Aomufei Yuan, Yiran Yao, et al. What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation. arXiv:2608.22948, 2026.
[2] Zheng et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023.
[3] Qiu et al. AI Idea Bench: Assessing AI Ideation in Scientific Discovery. 2025.
[4] Guo et al. IdeaBench: Benchmarking LLMs in Scientific Idea Generation. 2025.
[5] Zhao et al. ResearchStudio-Idea (IdeaSpark): Mechanism-Linked Falsification in Research Ideation. 2026.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
科研设想靠不靠谱,关键看敢不敢写明“什么结果能推翻我”。想一起拆解Lit2Test的六字段契约、追踪大模型科研能力评测的下一步,欢迎加入龙哥读论文粉丝群。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+北大+龙哥),根据格式备注,可更快被通过且邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的小伙伴,等你来聊~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。