← 返回 PaperDaily 大模型与智能体

自动科研选题评分6.27追平人类,清华腾讯等做了什么?

这篇论文打的是“AI自己出科研题”的玩法,把文献关系从静态清单升级成进化树,跨轨迹找机会。六个AI方向实测6.27分,逼近人类论文参考,科研选题自动化又往前迈了一步。想跟上AI for Science节奏的,值得一看。

自动科研选题评分6.27追平人类,清华腾讯等做了什么?
原论文信息如下:
论文标题:
Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution
发表日期:
2026年08月

发表单位:
广东人工智能与数字经济实验室(深圳)、墨尔本大学、悉尼大学、深圳大学、南洋理工大学、清华大学、腾讯优图实验室

ToI框架的创新之处

先来聊聊这篇论文到底在解决什么问题。做科研的人都知道,选题往往是整个研究过程中最让人头疼的一步。导师常说的话就是“多读文献”,但读了大量文献之后,怎么从几百篇论文里找到那个值得做的方向,依然是一门玄学。传统的做法是靠人的直觉、经验,以及对领域脉络的整体把握。而Tree-of-Ideas这篇论文想做的事情,一句话概括就是:让AI像一位资深学者一样,通过梳理文献之间的演化关系,自动提出有根有据的科研选题。
这个问题的难点在哪里?关键在于现有的方法对文献的理解太“平”了。有的方法把相关论文直接拼在一起作为大模型的上下文,比如基于检索增强生成(Retrieval-Augmented Generation, RAG)的路线,论文之间什么关系、怎么演化的,模型完全看不到。还有一类方法,比如Chain-of-Ideas,把论文排列成线性的时间链或者引用链,一条路走到底,但真实的学术研究往往是“分叉”的,一个方向会分化出多个流派,不同流派之间还有交叉互动。线性链条很容易把这种复杂的演化图景压扁。
ToI框架的核心创新,就是把“树”的结构引入到科研选题中。这里的“树”不是模型自己脑补出来的思考树,而是从真实的引用关系里长出来的文献演化树。每一篇前沿论文往回追溯,能看到它的思想源头、方法迭代、问题演变,就像沿着一条河流的支流追溯到发源地。更为关键的是,ToI不只是把树建出来就完事了,它还会跨越多条轨迹去对比,寻找不同分支之间隐藏的关联。
图1:ToI框架总览。给定研究主题和文献语料库,EvoGraph检索并扩展相关论文以构建主题中心引用图并识别前沿论文(阶段1)。EvoTrace为每篇前沿论文重建局部演化树,追踪方法论转变、未解决的研究空白以及分支内外的支撑来源(阶段2)。EvoAgent提取汇聚与跨链信号,保留受多条轨迹支撑的方向,并迭代地生成、审查和筛选想法,最终产生一组有文献依据的研究提案(阶段3)。
图1:ToI框架总览。给定研究主题和文献语料库,EvoGraph检索并扩展相关论文以构建主题中心引用图并识别前沿论文(阶段1)。EvoTrace为每篇前沿论文重建局部演化树,追踪方法论转变、未解决的研究空白以及分支内外的支撑来源(阶段2)。EvoAgent提取汇聚与跨链信号,保留受多条轨迹支撑的方向,并迭代地生成、审查和筛选想法,最终产生一组有文献依据的研究提案(阶段3)。
从技术路线上看,ToI是个两阶段框架。第一阶段叫EvoTrace,负责追溯演化。它给定一个研究主题,先构建以主题为中心的引用图,然后从“前沿论文”(frontier papers,也就是这个领域最新、最活跃的那批工作)出发,沿着参考文献往回追溯,把每一条演化路径上的关键节点都标注出来:这篇论文在上一篇的基础上做了什么改进?解决了什么问题?还有哪些问题没解决?这个过程中,EvoTrace关注的不是单篇论文本身,而是论文和论文之间的“关系”——引用关系里藏着方法演化的密码。
为了构建这个演化树,EvoTrace首先需要解决一个基础问题:如何从海量文献中筛选出与主题真正相关的论文,并构建出高质量的引用图。论文采用了一种结合语义检索与引用扩展的策略。具体来说,系统首先使用主题关键词在学术搜索引擎(如Semantic Scholar)中进行检索,获取一批种子论文。然后,系统会迭代地扩展这些种子论文的引用关系,既包括它们引用的文献(后向引用),也包括引用它们的文献(前向引用)。通过这种双向扩展,EvoTrace能够构建出一个以主题为中心、覆盖多个演化层次的引用网络。在这个网络上,系统会进一步识别出“前沿论文”——通常是指那些发表时间较新、被引次数增长较快、且处于网络中心位置的论文。这些前沿论文被视为当前研究热点的代表,也是后续演化树重建的起点。
在识别出前沿论文之后,EvoTrace的核心工作才真正开始。对于每一篇前沿论文,系统需要重建它的“局部演化树”。这个演化树并不是简单的引用列表,而是一个有层次、有结构的树状图。树的根节点是这篇前沿论文,它的子节点是这篇论文直接引用的关键文献,而这些文献的子节点又是它们所引用的更早期的文献,以此类推。在构建这个树的过程中,EvoTrace会利用大语言模型(LLM)来分析每一条引用边的关系类型。例如,一篇论文可能“扩展”了另一篇论文的方法,或者“解决了”另一篇论文提出的开放问题,又或者“对比”了另一篇论文的实验结果。这些关系标签被用来构建一个“方法演化图谱”,它清晰地展示了研究问题是如何一步步被细化、方法是如何一步步被改进的。
除了标注关系,EvoTrace还会在演化树上标记“研究空白”(Research Gaps)。这些空白是LLM在分析论文内容时识别出的、作者在论文中明确指出的尚未解决的问题,或者是通过对比不同分支的方法后推断出的潜在改进空间。例如,一篇论文可能在结论部分提到“我们的方法在X场景下效果不佳,未来工作将探索Y方案”,这就是一个明确的研究空白。而如果两条分支分别采用了不同的技术路线来解决同一个问题,但都没有达到理想效果,那么这两条路线之间的“结合点”也可能是一个潜在的研究空白。这些空白标注是后续EvoAgent进行跨轨迹推理的重要素材。

EvoTrace与EvoAgent的协同作用

第二个阶段,也就是真正的“出题”阶段,叫EvoAgent。EvoAgent拿着EvoTrace建好的演化树,开始跨轨迹推理。它的核心操作是找出两类信号:一类是“汇聚信号”(convergent signals),也就是不同演化路径上反复出现的、共性的研究空白或者共同的技术动作。例如,好几条独立发展的分支都在用一个类似的技术假设,或者都在解决同一个问题但都没有彻底搞定,这就说明这里可能藏着一个结构性的瓶颈。另一类是“跨链信号”(cross-link signals),指的是一条路径上已经发展成熟的技术能力,恰好可以用来解决另一条路径上悬而未决的问题。这种“你家的钥匙开我家的锁”的搭配,靠传统的单链推理是发现不了的。
这两个模块的配合方式很有意思。EvoTrace做的是“自底向上”的梳理,它不管最终要出什么题目,只负责把文献演化的事实结构挖出来——谁继承了谁的思想,谁解决了谁的问题,谁又留下了新的坑。EvoAgent则是“自顶向下”的猎手,它拿着演化树,横向扫描各个分支之间的模式匹配,寻找交叉点。二者的分工恰好对应了科研选题中最核心的两个认知动作:一是读懂领域的历史脉络,二是在脉络之间建立新的联系。
论文中给出了一个很直观的例子,来自扩散模型(Diffusion Models)主题。EvoTrace从一篇名为“Simple and Critical Iterative Denoising”的前沿论文出发,重建出两条主要的分支:一条发展出了“评论家引导去噪”(Critic-guided denoising),另一条引入了“基于分数的修正步骤”(score-based corrector steps)。这两条分支都在改进反向生成过程,但出发点不同。如果只看其中任何一条分支,你只会觉得“哦,这个方向还有优化空间”。但当EvoAgent同时盯着这两条分支时,它发现了一个关键共性:评论家引导的方法在修正生成结果时,默认前向过程(forward process)是固定的;而分数修正器的方法也把前向过程当作给定的常量。两条独立演化的分支不约而同地把“固定前向过程”当成了共同前提,而这个前提恰恰是限制生成质量的瓶颈。于是ToI就提出一个研究思路:能不能把前向过程也变成可学习的,让评论家和修正器联合优化整个去噪轨迹?这个想法,单看任何一条链都想不到。
表4:ToI在扩散模型主题上的完整管线追踪。汇聚型空白(第3行)只有在两条主分支同时被纳入视野时才会显现;只跟随任意一条分支的单链方法无法发现“固定前向过程”是共享的结构性瓶颈。
表4:ToI在扩散模型主题上的完整管线追踪。汇聚型空白只有在两条主分支同时被纳入视野时才会显现;只跟随任意一条分支的单链方法无法发现“固定前向过程”是共享的结构性瓶颈。
EvoAgent的工作流程并非一次性的,而是一个迭代的“生成-审查-筛选”循环。在每一轮迭代中,EvoAgent会基于当前识别出的汇聚信号和跨链信号,生成一批候选的研究想法。然后,它会使用一个“审查器”(Reviewer)模块对这些想法进行评估。审查器会检查每个想法是否真正基于演化树中的证据、是否具有新颖性、是否在逻辑上自洽。通过审查的想法会进入下一轮,而未通过的想法则会被丢弃或用于启发新的想法。这个过程会重复多次,直到生成足够数量且质量达标的研究提案。这种迭代机制确保了最终输出的想法不仅数量充足,而且经过了多轮“深思熟虑”的筛选。

实验结果展示与分析

既然是顶会级别的论文,实验部分自然不能含糊。论文选了六个AI研究主题进行评测,包括扩散模型、大语言模型对齐、图神经网络等方向。评价维度有五个:新颖性(Novelty)、重要性(Significance)、接地气程度(Groundedness,即想法是否紧密基于已有文献)、可行性(Feasibility)和预期有效性(Expected Effectiveness),满分10分。评价方式包括三种前沿大模型作为裁判打分,以及五名人类专家做真人评审。
先看模型评审的结果。
表1:基于模型的评估:三个大模型裁判(GPT-5.5、Claude Opus 4.7、Grok 4.3)在6个主题上(每方法30个想法)的平均得分。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,不是竞争系统。分数基于10分制。
表1:基于模型的评估:三个大模型裁判(GPT-5.5、Claude Opus 4.7、Grok 4.3)在6个主题上的平均得分(每方法30个想法)。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,非竞争系统。分数基于10分制。
ToI在全部五个维度上都排名第一,平均分6.27,比最强基线ResearchAgent的5.36高了近0.9分。这个差距在10分制下已经相当可观了。更值得注意的是接地气程度(Groundedness),ToI拿到了7.00,而直接提示(Direct Prompting)只有3.83。这说明ToI生成的想法不是凭空想象的,而是真正长在文献土壤里的。论文还设置了一个很有意思的参照物——“真实论文”(Real Paper),也就是从已发表论文中提取的核心想法作为人类水平的参考。ToI的平均分6.27跟真实论文的6.29几乎持平,这说明AI自动生成的选题在质量上已经摸到了人类研究者的脚后跟。
表2:基于人类的评估:6个主题5名专家(每方法30个想法)。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,非竞争系统。分数基于10分制。
表2:基于人类的评估:6个主题5名专家(每方法30个想法)。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,非竞争系统。分数基于10分制。
再来看看人类专家的评价。在这个更严格的测试里,CoI-Agent(Chain-of-Ideas的agent版本)表现也很强,平均分6.71甚至略高于ToI的6.62。但仔细看分维度得分会发现,ToI在新颖性(6.78)和接地气程度(7.17)上仍然是最高的,重要性也和CoI-Agent并列第一。CoI-Agent的优势主要体现在可行性和预期有效性上。这个结果其实很有意思,它说明线性链在某些情况下能产生更保守、更容易落地的想法,但ToI的跨轨迹推理能发现更不显而易见、更有突破潜力的方向,代价是可行性评分略低。这是一个经典的“探索vs利用”的张力。
消融实验进一步验证了各个模块的贡献。
表3:ToI中演化结构、空白建模和跨轨迹信号的消融研究。结果在六个研究主题上平均,每种配置30个想法,基于10分制报告。
表3:ToI中演化结构、空白建模和跨轨迹信号的消融研究。结果在六个研究主题上平均,每种配置30个想法,基于10分制报告。
把树状结构退化成单链(Chain-only),平均分从6.27掉到5.85;进一步退化成只看前沿论文(Frontier-only),直接掉到4.77。把“研究空白”的标注去掉(w/o Gap),掉到5.55;把跨轨迹信号检测去掉(w/o Signals),掉到5.62。每一刀砍下去都掉分,而且最受伤的恰恰是新颖性和接地气程度这两个核心维度。这组实验非常清晰地说明了:树状结构、空白标注、跨轨迹信号,这三个设计缺一不可。
表5:用于评估的六个AI研究主题。
表5:用于评估的六个AI研究主题。
除了定量评估,论文还进行了定性分析,展示了ToI生成的一些具体研究想法。例如,在“大语言模型对齐”主题下,ToI通过跨轨迹推理发现,一条关于“基于人类反馈的强化学习(RLHF)”的分支和另一条关于“可解释性”的分支之间存在潜在联系。RLHF方法在训练奖励模型时,往往面临“奖励黑客”(reward hacking)问题,即模型找到了一种欺骗奖励函数的方法,却没有真正符合人类意图。而可解释性研究则致力于理解模型内部的表征和计算过程。ToI提出的想法是:能否利用可解释性工具来监控RLHF训练过程中的奖励模型,从而提前发现并阻止“奖励黑客”行为?这个想法将两个相对独立的研究领域巧妙地结合起来,体现了跨轨迹推理的价值。
在“图神经网络(GNN)”主题下,ToI也发现了有趣的跨链信号。一条分支专注于开发更强大的图卷积操作,例如通过注意力机制或高阶邻域信息来聚合节点特征。另一条分支则关注图的鲁棒性,研究如何防御对图结构的恶意攻击。ToI注意到,攻击方法通常会扰动图的边或节点特征,而鲁棒性方法则试图在受到扰动的情况下仍能保持模型性能。一个潜在的研究方向是:能否将图卷积操作的设计与鲁棒性训练结合起来,例如设计一种对扰动具有内在鲁棒性的图卷积层?这个想法同样源于对不同分支技术优势的整合。

跨轨迹推理的潜在应用

这个框架的应用前景值得认真想一想。最直接的应用场景是科研辅助。对于刚入门的研究生,ToI可以帮忙快速扫描一个陌生领域,列出哪些问题已经被解决、哪些还在争论中、哪些是两条技术路线交汇处的空白地带。这比从零开始读几十篇论文高效得多。对于资深研究者,ToI的跨链信号有时能带来“意外之喜”——不同子领域之间那种看似无关实则互补的联系,往往就是高质量跨学科合作的起点。
再往远处想一步,ToI的范式不仅仅适用于科研选题。任何需要从大量历史信息中发现机会的任务,都有它的用武之地。技术战略规划、专利布局分析、产品路线图设计,本质上也都是在“文献”中寻找演化脉络和交叉机会。如果把这个思路嵌入到行业分析里,可能会有更大的想象空间。
当然,ToI也并非万能。目前实验覆盖的是AI领域的六个主题,在更大规模、跨学科的文献空间里表现如何,还有待验证。另外,论文评估的是“选题质量”而非“做出来的成果质量”,一个重要发现是:LLM生成的选题在落地实施后,分数往往会下降(这在前人工作如Si et al. 2025中已有讨论)。也就是说,ToI擅长的是提出“看起来很有道理且足够新颖”的好问题,但从好问题到好成果,中间还有漫长的路要走。
从技术实现的角度看,ToI的模块化设计也为其在不同场景下的应用提供了便利。EvoTrace和EvoAgent是两个相对独立的模块,它们之间的接口是演化树。这意味着,如果研究者想要将ToI应用于一个新的领域,他们只需要调整EvoTrace中用于构建引用图和标注关系的提示词(prompt),而EvoAgent的跨轨迹推理逻辑可以基本保持不变。这种模块化设计降低了框架的迁移成本,也使得它更容易被社区采用和扩展。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?论文提出Tree-of-Ideas(ToI),一种自动化科研选题框架。通过EvoTrace重建分支化学术演化轨迹,追踪方法演进与未解决难题;再由EvoAgent跨轨迹推理,识别收敛难题与互补方案。
这篇工作最值得看的点是什么?在所有自动化方法中获得最佳整体表现,特别是在新颖性和扎实性方面表现突出。
这篇工作的边界或风险在哪里?优点在于通过跨轨迹推理进行自动化研究创意生成,能够识别不明显的研究机会并提供扎实的文献支持;缺点可能在于依赖于引文图的完整性和质量。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出了一种名为Tree-of-Ideas的自动化研究创意生成框架,通过跨轨迹推理分析学术演化来生成研究想法。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

提出了一种名为Tree-of-Ideas的自动化研究创意生成框架,通过跨轨迹推理分析学术演化来生成研究想法;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:可能在于依赖于引文图的完整性和质量。

主要参考文献

[1] Xun Li, Yiying Yang, Pengtao Li, et al. Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution. arXiv preprint arXiv:2608.10740v1, 2026.
[2] Jinheon Baek, et al. ResearchAgent: Iterative research idea generation over scientific literature with knowledge graphs. 2025.
[3] Chris Lu, et al. The AI Scientist: Towards fully automated open-ended scientific discovery. 2024.
[4] Xinyuan Li, et al. Chain-of-Ideas: Harnessing the reasoning of LLMs for research ideation. 2024.
[5] Baolei Si, et al. Can LLMs generate novel research ideas? A large-scale human study with 100+ NLP researchers. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
选题焦虑不用愁,AI帮你出思路!跟Tree-of-Ideas学一招:读文献要读出“进化树”,找方向要懂“跨分支”。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。