既然是顶会级别的论文,实验部分自然不能含糊。论文选了六个AI研究主题进行评测,包括扩散模型、大语言模型对齐、图神经网络等方向。评价维度有五个:新颖性(Novelty)、重要性(Significance)、接地气程度(Groundedness,即想法是否紧密基于已有文献)、可行性(Feasibility)和预期有效性(Expected Effectiveness),满分10分。评价方式包括三种前沿大模型作为裁判打分,以及五名人类专家做真人评审。先看模型评审的结果。表1:基于模型的评估:三个大模型裁判(GPT-5.5、Claude Opus 4.7、Grok 4.3)在6个主题上的平均得分(每方法30个想法)。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,非竞争系统。分数基于10分制。ToI在全部五个维度上都排名第一,平均分6.27,比最强基线ResearchAgent的5.36高了近0.9分。这个差距在10分制下已经相当可观了。更值得注意的是接地气程度(Groundedness),ToI拿到了7.00,而直接提示(Direct Prompting)只有3.83。这说明ToI生成的想法不是凭空想象的,而是真正长在文献土壤里的。论文还设置了一个很有意思的参照物——“真实论文”(Real Paper),也就是从已发表论文中提取的核心想法作为人类水平的参考。ToI的平均分6.27跟真实论文的6.29几乎持平,这说明AI自动生成的选题在质量上已经摸到了人类研究者的脚后跟。表2:基于人类的评估:6个主题5名专家(每方法30个想法)。加粗为该列最佳自动方法,下划线为第二。†真实论文是人类参考,非竞争系统。分数基于10分制。再来看看人类专家的评价。在这个更严格的测试里,CoI-Agent(Chain-of-Ideas的agent版本)表现也很强,平均分6.71甚至略高于ToI的6.62。但仔细看分维度得分会发现,ToI在新颖性(6.78)和接地气程度(7.17)上仍然是最高的,重要性也和CoI-Agent并列第一。CoI-Agent的优势主要体现在可行性和预期有效性上。这个结果其实很有意思,它说明线性链在某些情况下能产生更保守、更容易落地的想法,但ToI的跨轨迹推理能发现更不显而易见、更有突破潜力的方向,代价是可行性评分略低。这是一个经典的“探索vs利用”的张力。消融实验进一步验证了各个模块的贡献。表3:ToI中演化结构、空白建模和跨轨迹信号的消融研究。结果在六个研究主题上平均,每种配置30个想法,基于10分制报告。把树状结构退化成单链(Chain-only),平均分从6.27掉到5.85;进一步退化成只看前沿论文(Frontier-only),直接掉到4.77。把“研究空白”的标注去掉(w/o Gap),掉到5.55;把跨轨迹信号检测去掉(w/o Signals),掉到5.62。每一刀砍下去都掉分,而且最受伤的恰恰是新颖性和接地气程度这两个核心维度。这组实验非常清晰地说明了:树状结构、空白标注、跨轨迹信号,这三个设计缺一不可。表5:用于评估的六个AI研究主题。除了定量评估,论文还进行了定性分析,展示了ToI生成的一些具体研究想法。例如,在“大语言模型对齐”主题下,ToI通过跨轨迹推理发现,一条关于“基于人类反馈的强化学习(RLHF)”的分支和另一条关于“可解释性”的分支之间存在潜在联系。RLHF方法在训练奖励模型时,往往面临“奖励黑客”(reward hacking)问题,即模型找到了一种欺骗奖励函数的方法,却没有真正符合人类意图。而可解释性研究则致力于理解模型内部的表征和计算过程。ToI提出的想法是:能否利用可解释性工具来监控RLHF训练过程中的奖励模型,从而提前发现并阻止“奖励黑客”行为?这个想法将两个相对独立的研究领域巧妙地结合起来,体现了跨轨迹推理的价值。在“图神经网络(GNN)”主题下,ToI也发现了有趣的跨链信号。一条分支专注于开发更强大的图卷积操作,例如通过注意力机制或高阶邻域信息来聚合节点特征。另一条分支则关注图的鲁棒性,研究如何防御对图结构的恶意攻击。ToI注意到,攻击方法通常会扰动图的边或节点特征,而鲁棒性方法则试图在受到扰动的情况下仍能保持模型性能。一个潜在的研究方向是:能否将图卷积操作的设计与鲁棒性训练结合起来,例如设计一种对扰动具有内在鲁棒性的图卷积层?这个想法同样源于对不同分支技术优势的整合。
跨轨迹推理的潜在应用
这个框架的应用前景值得认真想一想。最直接的应用场景是科研辅助。对于刚入门的研究生,ToI可以帮忙快速扫描一个陌生领域,列出哪些问题已经被解决、哪些还在争论中、哪些是两条技术路线交汇处的空白地带。这比从零开始读几十篇论文高效得多。对于资深研究者,ToI的跨链信号有时能带来“意外之喜”——不同子领域之间那种看似无关实则互补的联系,往往就是高质量跨学科合作的起点。再往远处想一步,ToI的范式不仅仅适用于科研选题。任何需要从大量历史信息中发现机会的任务,都有它的用武之地。技术战略规划、专利布局分析、产品路线图设计,本质上也都是在“文献”中寻找演化脉络和交叉机会。如果把这个思路嵌入到行业分析里,可能会有更大的想象空间。当然,ToI也并非万能。目前实验覆盖的是AI领域的六个主题,在更大规模、跨学科的文献空间里表现如何,还有待验证。另外,论文评估的是“选题质量”而非“做出来的成果质量”,一个重要发现是:LLM生成的选题在落地实施后,分数往往会下降(这在前人工作如Si et al. 2025中已有讨论)。也就是说,ToI擅长的是提出“看起来很有道理且足够新颖”的好问题,但从好问题到好成果,中间还有漫长的路要走。从技术实现的角度看,ToI的模块化设计也为其在不同场景下的应用提供了便利。EvoTrace和EvoAgent是两个相对独立的模块,它们之间的接口是演化树。这意味着,如果研究者想要将ToI应用于一个新的领域,他们只需要调整EvoTrace中用于构建引用图和标注关系的提示词(prompt),而EvoAgent的跨轨迹推理逻辑可以基本保持不变。这种模块化设计降低了框架的迁移成本,也使得它更容易被社区采用和扩展。
[1] Xun Li, Yiying Yang, Pengtao Li, et al. Tree-of-Ideas: Automated Research Ideation via Cross-Trajectory Reasoning over Scholarly Evolution. arXiv preprint arXiv:2608.10740v1, 2026.[2] Jinheon Baek, et al. ResearchAgent: Iterative research idea generation over scientific literature with knowledge graphs. 2025.[3] Chris Lu, et al. The AI Scientist: Towards fully automated open-ended scientific discovery. 2024.[4] Xinyuan Li, et al. Chain-of-Ideas: Harnessing the reasoning of LLMs for research ideation. 2024.[5] Baolei Si, et al. Can LLMs generate novel research ideas? A large-scale human study with 100+ NLP researchers. 2024.