← 返回 PaperDaily
大模型与智能体
EMBL零索引方案让GPT-5.4涨9个点:AI科研文献检索新范式
当所有团队都在砸钱堆向量数据库时,EMBL反手甩出一套“零索引”方案,直接用大模型编排实时检索引擎,就把GPT-5.4的问答准确率拔高近9个点。这波操作,堪称给学术文献检索来了次降维打击。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 5
查看原文
原论文信息如下:
龙哥导读:想象一下,AI Agent每天要读几十篇论文找证据,却还得先学会各种检索语法、看完无数篇无关全文才能找到一句有用的话——这不就是让博士生去干图书管理员的活儿吗?EMBL的科学家们看不下去了,直接甩出一套能让AI用大白话问文献、拿现成证据的知识层方案。
一个"AI图书馆员"的诞生:为什么AI agent需要全新的文献访问方式
最近有测量数据显示,来自自动化智能体(其中很多由大语言模型驱动)的网络流量,已经在相当大范围上追平甚至超过了人类流量。在生命科学领域,AI智能体已深度嵌入日常研究工作流:帮研究者跨论文总结发现、执行代码并编排生物信息学工具、筛选候选生物标志物、生成可检验的科学假说。这些应用都需要锚定在已发表的科学证据上。
问题是,文献正以指数级的速度膨胀。生命科学领域最常用的开放文献检索引擎Europe PMC,虽然收录了超过1100万篇全文文章、4000多万条PubMed摘要和120万条预印本记录,但这个界面是为人设计的。它要求用户用关键词和复杂语法来查询,返回的是整篇论文,而不是直接回答问题的证据。对AI智能体来说,这种接口有两大痛点:一是输入侧,生物实体有大量别名(比如基因符号TP53和蛋白质名称p53是同一个东西),单个关键词查询很难查全;二是输出侧,返回的是整篇文档,一个智能体的上下文窗口有限,读完一篇几万字的论文可能只找到一句话有用的证据,效率极低。
这就好比AI本来想问你"某条信号通路里哪个蛋白质跟这个疾病最相关",结果得先学会查MESH词表、写十几个检索式、翻几十篇论文才能拼出答案。欧洲分子生物学实验室(EMBL)的研究团队正是看到了这一矛盾,提出了一个大胆的设想:与其让每个AI智能体都去学习怎么用文献检索引擎,不如直接在Europe PMC之上盖一层"AI知识层",让智能体用自然语言提问,拿到的直接是可引用的证据片段。
零索引方案:如何用单个LLM编排Europe PMC实时检索
在LIBRARIAN之前,把科学文献暴露给AI智能体的主流思路是建密集向量数据库:把论文切块、embedding成向量、存起来,然后查最近邻。OpenScholar就是典型代表,它存了约4500万篇论文的稠密段落向量,光数据存储就有约744GB,还得配上重排序、自反馈等一大堆组件。
但密集向量索引有几个绕不开的坑。第一,贵。要索引并服务整个文献库,需要几百GB的embedding,基础设施投入巨大。第二,随着大模型能力增强,稠密检索的边际优势越来越小。有研究表明,一个调校良好的BM25检索骨干,配上能力足够强的LLM发出多个关键词查询,在科学基准上就能匹配甚至超过稠密检索。第三,embedding把结构化元数据(基因、蛋白质、生物体、化学物质等注释字段)展平了,导致无法对"基因符号是TP53且物种是人类"这类字段化条件做精确查询。第四,往向量空间里找最近邻,结果不可检查;而结构化的字段化检索,每一条都能解释为什么被搜出来。
LIBRARIAN的路线完全不同:不维护任何自己的索引,直接复用Europe PMC的实时搜索服务。它的名字起得很妙——Librarian就是图书管理员,帮你找文献但不替你囤书。整个系统由一个统一的LLM控制器驱动:用户输入自然语言问题,控制器负责生成互补的关键词/字段查询,检索匹配的记录,把选中的论文拆成段落,对候选证据进行打分排序,最终返回一组精炼的、可引用的证据片段及来源元数据。模型无关的设计让它可以随时替换更强的LLM作为引擎,新模型出现时系统自动继承收益。
三阶段流水线:子查询生成、段落排序与证据抽取的完整链路
LIBRARIAN的检索流程分为三个关键阶段,整体思路是先"广撒网"再"精钓鱼"。为什么先要广撒网?因为生命科学概念的同义表达太多了,一个记录如果用"p53"做的索引,用"TP53"去查可能就漏掉了;而MeSH这类受控词表又跟自然语言对不上。单条查询的召回率天然有限,必须先通过多条互补查询提升召回,再做精细化筛选。
阶段一:子查询生成。 LIBRARIAN用一个大模型,把用户的自然语言问题q映射为一组互补的子查询Q = f_plan(q) = {q1,...,qN}。f_plan就是那个LLM控制器,一个提示词就能把用户问题转成一个JSON子查询列表。每个qi可以是普通关键词查询,也可以定向到标题、摘要、关键词/MeSH词条、基因/蛋白质、生物体、疾病、化学物质等Europe PMC的特定字段。生成的子查询会经过确定性语法校验器,格式不对的直接丢弃,只有通过校验的才会真正去执行。
阶段二:论文级检索与段落排序。 校验后的子查询并行打到Europe PMC实时搜索服务上,按相关度返回记录。每条查询最多取P篇文章,最多M = N×P篇,重复的只保留一份。每篇全文论文被拆成段落:LIBRARIAN拉取XML,抽取正文段落,丢弃参考文献和前后辅文。然后用BM25算法(Best Matching 25,一种经典概率检索模型)对段落排序——把段落跟它所属的小节标题、类型(比如方法、结果、讨论等)拼接起来,跟原始问题q做相关性打分。每篇论文最终最多带k段进入下一阶段,摘要必带。没有全文的论文只出摘要。
阶段三:过滤、重排与证据抽取。 所有候选论文的段落被拼接起来,用pySBD工具切成句子,每句加唯一标识。一个大模型调用同时完成三件事:过滤不相关段落、对相关段落重新排序、抽取支撑证据作为句子。关键设计点在于,模型输出的是句子标识符而不是重新生成文本,少解码几十上百个token,降延迟又降成本。最后,选中的句子按来源论文聚合,配上论文元数据,输出为E——一组按相关度排序的可引用证据片段。下游agent可以直接引用、直接推理,不需要读全文,也不需要自己写检索语法。每条证据还保留了生成它的查询,全程可溯源可检查。
四大基准实测:全面超越现有检索方案的实验证据
论文在四个互补的基准套件上做了系统评测,覆盖从开放式综述到窄事实检索的完整任务光谱。实验使用GLM-5作为LIBRARIAN引擎,自托管在NVIDIA DGX B200上,通过vLLM提供服务;默认N=7条子查询、每条子查询最多取P=50篇文章、每篇最多k=16段进入最终阶段。
文献综述:ScholarQA-Bench。 这是由博士级专家编写的广泛问题集,回答每个问题都需要综合多篇文献的证据。论文构建了一个"综述智能体":给定一个广泛问题,先发起检索调用,再基于证据生成带引用的总结。用LIBRARIAN替换BM25索引后,Bio分区Citation F1从67.0涨到73.8,Neu分区从68.5涨到79.4,Multi分区从72.0涨到76.2;LLM评分从4.10涨到4.90(满分5分)。Citation F1是引用精确率和召回率的调和平均,这一指标同时衡量引用的充分性和必要性,比单纯看答案质量更严格。
主张验证:ProClaim-eval。 ProClaim-eval包含419条来自SIGNOR(蛋白质-蛋白质相互作用)和ConnectomeDB(配体-受体相互作用)的科学主张,每条都有专家共识裁决,需要智能体检索多篇文献证据,给出SUPPORT(支持)、REFUTE(反驳)或UNCERTAIN(证据不足)三选一判决。论文把LIBRARIAN作为ProClaim流水线的检索层,同时实现了一个更简单的"验证智能体"(单提示词直接出结论)。结果很有意思:单提示词的验证智能体配上LIBRARIAN后,平均一致性达到0.66,比它用PubMed+S2检索高了15个点,只比原版ProClaim完整流水线低9个点。而ProClaim换上LIBRARIAN后,平均一致性从0.75涨到0.80。这说明LIBRARIAN已经承担了最重的"找证据"工作,把下游agent的任务简化成了"读证据给结论"。
开放式问答:LitQA2。 LitQA2是窄领域、高难度的科学事实性问题集,设计上就保证无法只靠摘要回答,必须读全文。论文把原始的多选题改造成了开放式问答,要求模型直接产出答案而非选选项,并在Europe PMC里有全文的91道题上测试。GPT-5.4不做检索直接答,准确率只有17.6%——典型的"自信的幻觉";接上通用网络搜索,准确率飙到70.3%;换成LIBRARIAN,准确率进一步涨到78.9%,精确率也涨了6.4个点,覆盖率还从92.3提升到95.6。三个设置共用同一个GPT-5.4骨干,这个对比干净地隔离了检索器的贡献。
生物学基础任务:LAB-Bench。 LAB-Bench评估智能体在基础生物学研究任务上的能力。论文选了四个子集:数据库信息检索(DbQA)、生物学实验方案排查(ProtocolQA)、生物序列操作(SeqQA)和分子克隆场景(Cloning Scenarios)。GPT-5.4配上LIBRARIAN后,宏平均准确率从50.5涨到54.6(+4.2个点),其中SeqQA涨了11.3个点——从52.5直接干到63.8。更妙的是两个模型对LIBRARIAN的反应方式不同:较弱的GPT-4o是用精确率换覆盖率,宏平均精确率+5.0,覆盖率却降了5.4,准确率基本持平——机制是校准而非提升:grounding压住了参数化知识带来的幻觉,证据不足时模型选择弃权而不是瞎猜;而GPT-5.4在证据加持下精确率稳定不动,覆盖率大涨6.8个点,原本不敢答的题现在敢答且能答对了。不过DbQA这种"查数据库"型任务,文献检索几乎帮不上忙,两个模型准确率都微降。这反而是个很有价值的负例:不是所有生物任务都需要文献证据。
为什么"知识层与模型解耦"是AI科研基建的新范式
LIBRARIAN最值得玩味的哲学是"知识层与模型解耦"。传统RAG(检索增强生成)系统把检索器和生成器焊死在一起,换个骨干模型往往要重新调整个流水线;而LIBRARIAN把"找证据"这件事做成一个独立、即插即用的层,任何智能体都能接。实验中它同时服务了GLM-5综述智能体、Claude Sonnet 4.6验证智能体、GPT-5.4问答智能体和GPT-4o/5.4生物任务智能体,同一个LIBRARIAN层,四类下游模型,全部带来性能提升。
这种解耦还有个现实红利:新模型出来不用重新折腾检索管线。研究团队自己都说了,模型无关设计意味着"新的、更强的模型出现时,系统自动继承收益"。在大模型迭代按月计数的当下,这一点很务实。
另一个值得关注的设计选择是"零索引"。不建向量库,不存embedding,直接打Europe PMC实时搜索。这省掉了744GB的向量存储,省掉了索引更新流程,还天然保持数据新鲜——Europe PMC新增了论文,LIBRARIAN立刻就能搜到,不存在索引滞后的问题。同时,欧洲PMC背后是EMBL-EBI这种国际生命科学资助者联盟支撑的基础设施,可信度比自建库高出一个量级。
局限与展望:多模态、多跳检索与更广的知识覆盖
任何好工作都会直面自己的边界。LIBRARIAN的局限性也很清楚。第一,知识覆盖受限于Europe PMC的收录范围,付费墙背后的全文是拿不到的。研究团队计划后续整合其他EMBL资源来补足,比如OpenTargets(药物靶点数据库)、UniProt(蛋白质序列与功能数据库)和ChEMBL(生物活性分子数据库)。第二,LIBRARIAN目前不做多跳检索——它是一次性检索(虽然有多条互补子查询提升召回),复杂的多跳推理留给下游agent自行处理;未来计划让LIBRARIAN自己判断证据不足时是否继续搜索多轮。第三,当前版本只处理文字,图表、补充材料一律忽略,表格也只能当纯文本处理。扩展到多模态是明确的方向。
论文在相关工作部分也提到了同类系统的演进脉络:OpenScholar(4500万篇论文的稠密索引+重排+自反馈)、SciRAG(自适应检索+引文图谱推理)、PaperQA2(全文本段落的agentic综述)、BioSage/SciSage(领域特化agent)。这些系统的共同问题在于"每个都要重新造一套检索基础设施"。LIBRARIAN的路线则像一个杠杆:站在欧洲PMC这个公共基础设施的肩膀上,用单个LLM做编排,省掉自建索引的全部成本。
龙迷三问
Q1:LIBRARIAN和传统的RAG系统到底有什么本质不同? 传统RAG一般自己维护一个向量数据库,把文档切块、embedding、存起来,然后查相似度。LIBRARIAN完全不建索引,直接调Europe PMC的实时搜索API,用LLM生成多条结构化查询去搜,再用BM25+LLM做段落级证据过滤和排序。本质区别在于:一个是"自己囤书再翻",一个是"请图书管理员帮忙找"。好处是零索引维护成本、天然数据新鲜、可利用Europe PMC的字段化元数据(基因、蛋白质、物种、化学物质等)做精确检索,而且每条证据都保留了生成它的查询,全程可溯源。
Q2:BM25在深度学习时代还有竞争力吗? 有,而且竞争力不弱。BM25(Best Matching 25)是1994年提出的经典概率检索模型,它本质上是一个词频-逆文档频率的改进版打分函数。在LIBRARIAN里,BM25不是用来做最终判决的——它只负责在中间阶段把每篇论文的段落按相关性粗排一遍,选出Top-k喂给最后的大模型精排。这种"词法粗筛+语义精排"的组合在多个科学文献检索基准上都被证明能匹配甚至超过纯稠密检索。关键原因是:LLM越来越强,能生成更好的关键词查询;BM25虽然"笨",但它快、可解释、不依赖向量索引基础设施。
Q3:这套系统能直接用在自己的研究里吗? 代码已经开源,地址在github.com/petroni-lab/librarian,包含了prompts、运行时配置和评测管线。如果研究或工作涉及生命科学文献检索、自动化证据收集、科学综述生成、实验方案排查这类任务,完全可以拿来做检索层。需要注意的是:LIBRARIAN目前只覆盖Europe PMC的内容,且只处理文字证据,不含图表。另外,检索质量受限于Europe PMC的索引质量,如果研究领域偏向工程或CS,它就不太适用了。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
核心"零索引+LLM编排实时检索引擎"的思路在科学文献层检索场景中有新意,但三阶段流水线本身(子查询生成→段落排序→精排抽取)并没有超出已有agentic检索方案的框架,更多是工程整合创新。
实验合理度: ★★★★☆
四套基准覆盖全面,每套都做了消融来隔离检索器的贡献(如LitQA2共用GPT-5.4骨干对比三种检索设置),对比方法也足够新(OpenScholar、SciRAG、PaperQA2、ProClaim都是近期工作)。扣一星是因为LAB-Bench使用了公开子集(约80%)而非完整测试集,与基线的严格可比性略打折扣。
学术研究价值: ★★★★☆
对"AI智能体的科学文献基础设施应该长什么样"这个问题给出了一个可复现、可扩展的答案,并验证了"知识层与模型解耦"的可行性,对后续生命科学agent研究有较强的启发意义。
稳定性: ★★★★☆
四个基准上性能提升方向一致,且不同模型(GPT-4o/5.4、Claude Sonnet 4.6、GLM-5)下都能获得增益,说明方法本身对模型选择不敏感。但依赖外部服务(Europe PMC)的可用性和接口稳定性,有一定的外部依赖风险。
适应性以及泛化能力: ★★★☆☆
限定在生命科学领域,且依赖Europe PMC的字段化索引和MeSH等生物医学词表。对其他学科(如CS、物理)的文献覆盖不适用。对数据库查询类任务(DbQA)增益为负,说明它不能解决所有科研任务的信息获取问题。
硬件需求及成本: ★★★☆☆
零索引省掉了向量数据库的存储和索引成本,但每个查询需要调用外部搜索API一次,并运行一个大模型做多子查询生成和最终证据抽取(实验用GLM-5约700B参数),查询时延和算力成本不低。好在模型无关,后续可以换更小的模型做引擎。
复现难度: ★★★★★
论文明确说了公开发布代码、prompts、运行时配置和评测管线,github链接在正文和摘要都给出了。这是值得赞赏的开放程度。
产品化成熟度: ★★★☆☆
作为科研文献知识层,已经达到了"工具可用"的水平,但只覆盖Europe PMC和文字内容,缺少图表理解和多轮检索能力。在科研agent工作流中可以作为检索组件接入,但要作为通用科研知识基础设施还有距离。
可能的问题:
论文的对比设置并非完全公平——LAB-Bench用了公开子集而非完整基准,LitQA2是自有实现的开源版本而非原始选择形式;另外实验只测了GLM-5作为LIBRARIAN引擎,LLM控制器换成其他模型时的性能变化没有覆盖。
主要参考文献
[1] Asai A. et al. OpenScholar: Synthesizing Scientific Literature with Retrieval-Augmented LMs. 2026.
[2] Skarlinski M. et al. Language agents achieve superhuman synthesis of scientific knowledge. 2024.
[3] Ai Y. et al. ProClaim: Verifying scientific claims against literature consensus. 2026.
[4] Laurent J. et al. LAB-Bench: Measuring Capabilities of Language Models for Biology Research. 2024.
[5] Rosonovski S. et al. Europe PMC: A full-text literature database for the life sciences and platform for innovation. 2024.
[6] Hsu C. et al. PI-SERINI: Matching deep-research agents with lexical search tools. 2026.
[7] 论文原文: EMBL AI LIBRARIAN: Life-Sciences Knowledge Layer for AI Agents. arXiv:2607.28229v1.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
这波AI Librarian的操作,像不像给科研智能体配了个24小时在线、随叫随到的文献管家?想第一时间 get 更多AI+科研基建的硬核解读和前沿玩法?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称 ,例如:AI4Science+上海+EMBL+龙哥。群里已经备好了图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的深度讨论,就差你啦!