← 返回 PaperDaily 大模型与智能体

AI科学家要来了?Adam之父给出2025最新时间表

这是剑桥大学Ross King教授撰写的一篇AI for Science全景综述。Ross King正是历史上第一个全自动机器人科学家Adam的缔造者。这篇论文以亲历者视角,系统梳理了从DENDRAL到AlphaFold、再到AI Scientist的完整进化路径,并首次提出六级科学自主性框架。想看懂AI科学家的过去、现在与未来,这篇是绕不开的入口。

AI科学家要来了?Adam之父给出2025最新时间表
原论文信息如下:
论文标题:
The Past and Future of AI Scientists
发表日期:
2026年8月
发表单位:
剑桥大学(University of Cambridge)与查尔姆斯理工大学(Chalmers University of Technology)
原文链接:
https://arxiv.org/pdf/2608.14407v1.pdf

AI科学家:从科幻到现实的科学革命

先问大家一个问题:如果AI终将取代人类的大部分工作,那么“科学家”这个职业是不是最安全的?毕竟科研要的是创造力、洞察力和对未知的好奇心,这些东西总该是人类的禁区吧?
这篇论文给出的回答可能会让你坐不住:科学本身可以被自动化,而且这件事正在发生。写这篇综述的不是别人,正是剑桥大学的Ross King教授——历史上第一个全自动机器人科学家Adam的缔造者。换句话说,这不是外行在畅想未来,而是亲手造出过“机器科学家”的人,在给你画一张完整的路线图。
论文的立场非常鲜明:一个真正的AI科学家不是“扩大版的预测程序”,也不是“会聊天的科研助手”。它是能够自主提出假设、设计实验、执行实验、解读结果并修正信念的集成式科学智能体——连接文献、形式化知识、数学模型、模拟器、数据分析系统和物理实验室。这个定义把门槛定得很高,也把方向指得很清楚。
表情包
论文的核心判断是:科学自动化的瓶颈不再是单个组件,而是“集成”。神经网络、逻辑推理、概率建模、因果推断、模拟、实验设计、机器人操作、形式化科学记录——这些技术单体都已经足够强大,但如何把它们拧成一个能闭环跑起来的完整系统,才是真正的硬骨头。
更让龙哥觉得有意思的是,论文引出了一个极具争议的时间表:Nobel Turing Challenge提出要在2050年之前开发出能够自主完成“诺奖级”科学发现的AI系统。而论文直言:按照目前的进度,这个目标已经超前于时间表

六级自主性框架:如何衡量机器的科学能力

聊AI科学家,最怕的就是概念混战。你说AlphaFold是AI科学家吗?它预测蛋白质结构确实厉害,但严格来说它只是一个预测工具。那能自动写论文的AI Scientist算不算?它跑完了从想法到成稿的全流程,但从未碰过一根试管。为了把这些层级掰扯清楚,这篇论文事实上给出了一把尺子——科学自主性的分级。虽然综述中没有用单独的编号表格来罗列,但沿着“从工具到科学家”的主线,我们可以归纳出清晰的六级爬坡路径。
Level 0:纯人类科研——所有环节由人类完成,机器不参与。
Level 1:计算辅助科研——机器帮助人类完成单项任务,比如文献检索、数据分析、代码生成、结构预测。这一级对应论文中定义的AI科学助手(AI scientific assistant)。绝大多数人现在用的AI工具都在这个层级。
Level 2:假设生成辅助——AI开始主动提出候选科学假设。典型代表是基于文献的发现(Literature-based Discovery),AI在阅读大量互不关联的文献后,找到人类因为阅读量限制而无法察觉的隐藏关联,并生成可检验的新假设。机器开始介入“提出问题”这一最核心的科学环节。
Level 3:计算全流程闭环——机器自主完成“生成想法→写代码→跑实验→分析结果→撰写报告”的完整计算研究流程,但完全不触碰物理世界。这对应论文中描述的智能体科学系统(Agentic Scientific System),比如The AI Scientist和Co-Scientist就处于这个层级。
Level 4:物理实验闭环——机器不只在计算机里跑流程,而是直接控制物理实验室的机器人,自主选择实验、执行实验、读取结果并决定下一步做什么。这就是论文中定义的自动驾驶实验室(Self-Driving Laboratory),典型代表是Eve、A-Lab和SAMPLE。
Level 5:完全自主科学——机器不仅能在物理世界里闭环做实验,还能自己决定“什么科学问题是重要的”,自主重构概念框架,甚至发明全新的实验技术和研究范式。这是论文中Nobel Turing Challenge指向的终极形态,也是当下任何系统都尚未达到的水平。
这个分级框架最有价值的地方在于:它把“AI能不能当科学家”这个容易变成口水战的问题,翻译成了一个具体的系统能力坐标。以后大家再争论某个AI算不算科学家,先看它落在哪个Level,讨论立刻就有抓手了。

神经符号集成:AI科学家的核心架构

如果让你设计一个AI科学家,你会怎么做?最常见的思路是:把一个大语言模型调教到足够强,让它什么都干。这篇论文明确否定了这种“单体模型包打天下”的路线,给出了一个完全不同的架构哲学——AI科学家是一个相互交互的模块联邦(federation of interacting modules),而不是一个单一的单体模型
图3:AI科学家是一个相互交互的模块联邦(federation of interacting modules),而非单一的单体模型。
图3:AI科学家是一个相互交互的模块联邦,而非单一的单体模型。
为什么必须走“联邦”路线?因为科学研究的完整链路实在是太长了。你需要一个科学记忆模块来存储形式化知识、概率、模型、数据、协议和溯源信息;需要一个文献接口来完成检索、阅读、信息提取和引用核查;需要一个问题和假设生成器来提出科学问题;需要形式化的逻辑、数学和概率推理器来推导结论;需要模拟和模型执行环境来检验理论预测;需要实验设计和组合分配系统来决定下一步做什么实验;需要协议编译器把实验意图翻译成机器人能执行的指令;需要实验室控制和观测接口来连接物理世界;还需要数据质量、统计分析、结果解读模块,以及对抗性批评者和独立验证智能体来挑刺。
这套架构里最特别的,是论文强调的神经符号集成(neuro-symbolic integration)。什么意思?就是用神经网络来做感知、模式识别和灵活的语言交互,用逻辑推理器来做严格的演绎验证,用概率推理器来管理不确定性和信念更新。两者结合,而不是谁取代谁。纯粹的逻辑系统死板、缺乏鲁棒性,纯粹的神经网络会产生幻觉、缺乏可验证性。只有把两者缝合在一起,才有资格谈科学推理。
在信念修订环节,论文给出了一个数学上很漂亮的框架。AI科学家面对多个竞争性假设时,应该用贝叶斯模型平均(Bayesian Model Averaging)来综合所有模型的预测:
公式:P(y|E)=∑ᵢ P(y|Mᵢ,E)P(Mᵢ|E)
这个公式的含义是:在观测到数据E之后,对未知量y的预测,等于所有候选模型Mᵢ的预测按模型后验概率加权求和。换句话说,AI科学家不应该只押注一个模型“赌赢了”,而要时刻对所有可能假设保持概率化的开放态度。这种“分布式信念”正是人类科学家在头脑里隐约在做、但很少能精确表达的事情。
在实验设计层面,论文给出的核心思想是:一个好的实验,是最能降低不确定性的实验。信息论里有一个很漂亮的表达式:
公式:I(M,E)=I(M)+I(E|M)
做实验获得的信息I(M,E),由两部分构成:I(M)是检验模型本身的信息增益,I(E|M)是在给定模型下观测数据带来的信息增益。把这两个公式组合起来看,AI科学家的“行动逻辑”就非常清晰了——它需要找那些能最大化信息增益的实验来做,而不是随机试试。这套数学框架把“好奇心”变成了一个可计算的目标函数。

从Adam到AlphaFold:AI科学家的进化之路

这篇综述最有“历史厚重感”的地方,在于它把AI科学家的谱系从头梳理了一遍,而这正是Ross King作为圈内人的独家优势。
故事要从1960年代的斯坦福大学讲起。那是一个AI的蛮荒年代,诺贝尔生理学或医学奖得主Joshua Lederberg牵头启动了一个名为DENDRAL的项目,目标是让计算机从质谱数据中推断分子结构。DENDRAL被公认为世界上第一个专家系统,它首次证明了:在特定科学领域内,把形式化领域知识与启发式搜索结合,机器可以达到专家级水平。这个项目奠定了后来所有科学AI的内核——智能不只靠通用推理机制,更靠大规模、结构化、显式的领域知识
接下来是BACON项目(注意:这个BACON和吃的培根没关系,是致敬哲学家弗朗西斯·培根)。Herbert Simon团队用机器学习从数值数据中自动生成方程,居然“重新发现”了多条著名的科学定律。放在今天,这个任务叫符号回归或方程发现。BACON的意义不在于“重新发明轮子”,而在于证明了“创造性思维”可以被拆解为启发式搜索操作。
图1:发现科学(Discovery Science)时间线。
图1:发现科学时间线——从DENDRAL到现代AI科学家的完整演进脉络。
1986年,Don Swanson做了一个后来被反复引用的经典工作:他发现鱼油、血粘度和雷诺氏综合征之间存在潜在关联,但当时没有任何一篇论文同时提到这三者的因果链条。Swanson证明了一个大胆的观点——新的科学假设可能早已隐含在文献的分布式结构中,只是没有任何人类研究者能读完全部相关论文。这就是“文献驱动发现”的起源,也是今天LLM智能体做科研的早期思想雏形。
时间快进到2004年。Ross King团队推出了第一个机器人科学家Adam——这是历史上第一台“自主做出新颖科学发现”的机器。Adam的工作领域是酵母菌的功能基因组学,它用逻辑语言表示背景知识和竞争性假设,自主选择能区分这些假设的实验,用实验室机器人物理执行实验,解读数据,然后更新假设的概率。这个闭环的每一个环节都是机器自主完成的,没有人类科学家在中途插手。
图2:自动化科学的原始图示(引自King et al., 2004)。
图2:自动化科学的原始图示(引自King等人2004年论文)——假设驱动发现与物理实验执行的一体化结构。
紧接着的Eve则走出了另一条路。Eve专注于早期药物发现,更强调数据驱动的闭环优化。它把化合物筛选、检测自动化、机器学习、主动学习结合起来,高效地探索化学空间。Eve后来被公认为现代自动驾驶实验室的架构鼻祖。论文里特别区分了这两者的谱系:Adam是“AI科学家”的直系祖先,Eve是“自动驾驶实验室”的直系祖先,而当代系统正在把这两条传统融合在一起。
接下来的故事大家就比较熟悉了。AlphaFold 2在蛋白质结构预测上实现了质的突破,预测了超过2亿个蛋白质结构;AlphaFold 3把能力扩展到蛋白质与核酸、小分子、离子的联合结构和相互作用。大语言模型则带来了全新的交互方式——Coscientist连接了LLM与互联网检索、代码执行和实验自动化来完成化学任务;ChemCrow把LLM接到专业化学工具上;The AI Scientist跑通了“想法→代码→分析→论文→模拟同行评审”的全自动计算研究工作流;Co-Scientist用多智能体生成、辩论、排序和优化生物医学假设;Robin则把文献搜索和数据分析智能体整合起来,生成假设、设计实验、解读数据并持续更新自己的假设。
值得注意的是,论文用一个表格清晰地给这些系统分了类,这个分类很重要,值得放出来给大家看:
表1:代表性科学AI系统的分类与能力。
表1:代表性科学AI系统的分类与能力。注意,这个分类是功能性的,不是宣传性的——“有用的预测器”和“AI科学家”之间,隔着整个科学闭环。
这个表最扎眼的一列是“Primary limitation”(主要局限)。AlphaFold再厉害,它不会自己问“下一个该解什么结构”。The AI Scientist再自动化,它只活在纯计算环境里,不碰物理世界。Co-Scientist和Robin再聪明,它们依然高度依赖人类设定目标,而且有幻觉风险。每一个顶流系统,都只是整个科学闭环上的一块拼图。

挑战与展望:AI科学家将如何改变世界

论文的落脚点落在了一个激动人心又隐含风险的目标上:Nobel Turing Challenge。简单说,这个挑战的目标是:到2050年,开发出能够自主做出诺奖级科学发现的AI系统。Ross King的判断很直接——进度已经超前于时间表。注意,这是作者本人的判断,是否认同可以保留意见,但这个判断本身就值得读完全文。
论文给出了一套评估“诺奖级成果”的评判标准,这大概是目前对AI科学家最严格的验收清单:
表3:Nobel Turing Challenge的评估标准。
表3:Nobel Turing Challenge的评估标准——从“自主性程度”到“结果是否可复现”,每一项都在校准“AI科学家”这四个字的成色。
AI科学家如果真的实现,会带来什么样的改变?论文给出了几个相当有画面感的预测。第一,科学会变得更便宜、更快、更系统、更可复现。第二,AI科学家能研究那些复杂度超出人类单打独斗能力的系统——比如理解上万种基因之间的相互作用。第三,数千个AI科学家可以同时协作攻克同一个问题,而不用睡觉、不用开组会、不用写基金本子。但论文没有回避阴暗面:AI科学家也可能集中科学权力、自动化错误、直接把科学推理连接到危险的物理动作上。
所以在治理层面,论文提出了一套相当务实的安全设计原则:必须建立严格的评估制度,关键是完整的溯源(provenance)体系——每一个材料决策、每一次行动都要有记录;要有问责机制,要有安全与权限管理系统(safety and permissions governor);还要让人类科学家始终保留设定目标、检查推理和干预的权力。这些不是空话,而是论文在架构图的每一个箭头上都标注了的设计约束。
总的来说,这篇综述的价值不在于给了你一个马上能跑的算法,而在于把“AI科学家”这个宏大叙事拆解成了可讨论、可规划、可逐步实现的工程问题。它让每一个关注AI for Science的人,都能在同一个坐标系里看清楚:我们走到哪了,下一步该踩哪里。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?剑桥大学与查尔姆斯理工联合发表AI科学家前瞻综述。
这篇工作最值得看的点是什么?本文为综述论文,无实验部分。通过系统梳理Adam、Eve、AlphaFold、Coscientist、ChemCrow、The AI Scientist、Co-Scientist、Robin、A-Lab、SAMPLE等代表性系统,构建了科学AI系统的分类学框架,并提出了六级科学自主性评估体系。
这篇工作的边界或风险在哪里?优点:(1) 首次系统性地提出AI科学家的完整架构蓝图,涵盖知识表示、推理、实验设计、物理执行、安全治理等全链条;(2) 提出六级科学自主性框架(Level 0-5),为评估AI科学系统提供了统一标准;(3) 深刻分析了神经符号集成、概率推理、因果推理等关键技术路线的互补性;(4) 对历史脉络的梳理非常详尽,从DENDRAL到Adam/Eve再到现代LLM系统,逻辑清晰;(5) 对安全、治理、可复现性等关键问题有前瞻性思考。缺点:(1) 作为综述,缺乏对具体技术方案的定量比较和实验验证;(2) 对某些新兴技术(如具体LLM agent架构)的讨论相对概括;(3) 对"如何实现"的讨论多于"如何验证"的具体方案;
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文是综述性论文,系统梳理AI科学家的历史演进、当前技术现状与未来架构路线图,提出六级科学自主性框架并论证各组件(知识表示、概率推理、数学发现、神经网络等)的集成必要性。

实验合理度:★★★★☆

不适用(综述论文)

学术研究价值:★★★★☆

本文是综述性论文,系统梳理AI科学家的历史演进、当前技术现状与未来架构路线图,提出六级科学自主性框架并论证各组件(知识表示、概率推理、数学发现、神经网络等)的集成必要性;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(综述论文);建议补充显存占用、推理时延和吞吐数据。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。

主要参考文献

[1] King, R.D., et al. Functional genomic hypothesis generation and experimentation by a robot scientist. Nature, 2004, 427(6971): 247-252.
[2] King, R.D., et al. The automation of science. Science, 2009, 324(5923): 85-89.
[3] Williams, K., et al. Cheaper faster drug development validated by the repositioning of drugs against neglected tropical diseases. Journal of the Royal Society Interface, 2015, 12(104): 20141289.
[4] Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature, 2021, 596(7873): 583-589.
[5] Abramson, J., et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature, 2024, 630(8016): 493-500.
[6] Lu, C., et al. The AI Scientist: Towards fully automated open-ended scientific discovery. arXiv preprint arXiv:2408.06292, 2024.
[7] Boiko, D.A., et al. Autonomous chemical research with large language models. Nature, 2023, 624(7992): 570-578.
[8] Szymanski, N.J., et al. An autonomous laboratory for the accelerated synthesis of novel materials. Nature, 2023, 624(7990): 86-91.
[9] Swanson, D.R. Fish oil, Raynaud's syndrome, and undiscovered public knowledge. Literature in Information Technology, 1986, 1(1): 7-20.
[10] Gottweis, J., et al. Co-Scientist. arXiv preprint, 2026.
[11] Ghareeb, S., et al. Robin: LLM-based hypothesis-driven biology research. arXiv preprint, 2026.
[12] 原论文链接:https://arxiv.org/pdf/2608.14407v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球