← 返回 PaperDaily 大模型与智能体

GPT-5.5翻车了?病毒数据检索准确率仅16.9%,一招飙到99.7%

继2026年6月聊过DrugAgent等AI agent相关话题后,龙哥发现AI agent在科研数据检索上真的“不靠谱”。最新研究明确揭示:连GPT-5.5在病毒序列查询任务上准确率都只有16.9%!想知道如何让AI agent秒变数据处理大师,准确率飙到99.7%吗?看这篇就够了。

GPT-5.5翻车了?病毒数据检索准确率仅16.9%,一招飙到99.7%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
继2026年6月聊过DrugAgent等AI agent相关话题后,龙哥发现AI agent在科研数据检索上真的“不靠谱”。最新研究明确揭示:连GPT-5.5在病毒序列查询任务上准确率都只有16.9%!想知道如何让AI agent秒变数据处理大师,准确率飙到99.7%吗?看这篇就够了。


原论文信息如下:
论文标题:
Deterministic access to global viral sequence data enables robust AI agent-driven scientific discovery
发表日期:
2026年06月

发表单位:
美国加州理工学院(California Institute of Technology)、美国国家生物技术信息中心(NCBI)等多个单位

原文链接:
https://arxiv.org/pdf/2606.14504v1.pdf

开源代码链接:
https://github.com/lauraluebbert/VirBench

项目链接:
https://pachterlab.github.io/gget/en/virus.html
大家好,我是龙哥。
今天聊一个让AI agent崇拜者都“CPU疼”的话题——科研数据检索。目前最顶尖的AI agent,在病毒序列检索上表现堪称“翻车现场”。
插图
来自加州理工、NCBI等机构的研究人员构建了 VirBench 基准测试,检验AI agent的“数据库查询”功底。结果:最差的Claude Sonnet 4平均准确率仅 16.9%,最好的GPT-5.5也只有 91.3%。在科研场景下,那8.7%的误差可能是致命的。
图1:Agent在VirBench各分类任务上的表现和失败模式
图1:Agent在VirBench各分类任务上的表现和失败模式。VirBench包含120个手动整理的病毒数据检索查询,每个查询对每个agent独立评估三次。(A) 每个分类目标在各agent上的平均准确率,分别显示不使用(上方)和使用(中间)gget virus的情况,以及使用与不使用gget virus的准确率差值(下方)。(B) 各agent的偏差(检索到的序列数减去预期序列数)分布。(C) 各agent的运行结果分类,显示正确结果、正确零结果、错误零结果等比例。
核心原因:AI agent通过调用不稳定的网页接口、拼凑残缺API甚至“灵机一动”猜答案。这种不确定性在严谨科研中不可接受。当前“下载-再过滤”范式效率低下、有偏差且不可复现。

病毒数据检索:AI agent的致命短板

研究团队构建了VirBench,包含120个精心设计的查询,覆盖从简单单一病毒搜索到复杂多条件组合过滤。例如:“检索TaxID 3052310(拉沙病毒LASV)来自非洲、收集日期在2020-01-01至2025-12-31之间的病毒序列,并返回匹配的序列数量”。
测试了 Biomni, Claude Sonnet 4, GPT-5.2-pro, Claude Opus 4.7, GPT-5.5Edison Analysis 六款顶级AI agent。Claude Sonnet 4平均准确率仅16.9%,最好的GPT-5.5也只有91.3%。那8.7%的错误可能导致漏掉关键病毒变异株,影响疫情应对策略。
失误模式五花八门:有的对复杂查询直接崩溃,有的“自作聪明”脑补不存在的过滤器,有的在大规模数据翻页时“断片”。这些错误是系统性的,在不同运行轮次间表现很不稳定。

gget virus:从“靠猜”到“确定”的底层逻辑

论文提出反常识但有效的解决方案:gget virus。它不“训练”AI变好,而是把“不确定的、模糊的”数据检索变成“确定的、可复现的”操作。它属于gget开源生态系统(GitHub 1.2k Star),定位是“一行代码搞定基因组数据库查询”。
gget 项目整体功能概览
图:gget 项目整体功能概览图,展示了gget各个模块的工作流程和相互关系,gget virus是其中专门负责病毒基因组数据下载的模块。
gget virus的逻辑可概括为 “分阶段、智能化、最小化” 的数据检索策略。其核心思想被提炼为确定性病毒序列检索:对于给定查询q,在确定数据库状态D下,无论执行多少次,都返回完全相同的唯一确定集合,具备完备性确切性
图3:gget virus工作流程示意图
图3:gget virus工作流程示意图。展示了搜索具有特定过滤条件(如宿主、最小序列长度、包含特定蛋白)的HIV-1原病毒序列的示例。图中灰色框展示了内部查询处理步骤,右侧展示返回给用户的输出文件。
具体分步执行策略:

第一步:元数据预筛选。只下载最轻量的元数据(序列ID、长度、宿主、地理位置等),在下载过程中应用服务器端所有可用过滤器,极大减少初期数据量。

第二步:客户端精准过滤。下载元数据后,根据用户详细条件(如基因名称、作者国家等服务器不支持的条件)在本地二次过滤,精确锁定需要下载的序列范围。

第三步:差异化下载。只有“幸存”的序列才触发实际GenBank记录和完整序列下载,避免海量无用数据传输。

第四步:鲁棒性处理。内置智能错误处理机制,遇到API临时故障或过滤器失效时自动重试、切换备选策略或调整批次大小,确保流程不因单一节点问题崩溃。

实验验证与结果分析

研究团队让AI agent在检索时被明确要求使用gget virus编程接口,结果所有agent性能发生质的飞跃:
图2:VirBench上各agent的总体表现
图2:VirBench上各agent使用和不使用gget virus的总体表现。分别展示了准确率、稳定性、误差大小、运行时间和工具调用次数。
没有gget virus时(橙色列),各agent表现天差地别。使用gget virus后(蓝色列),最差的Claude Sonnet 4准确率从16.9%飙升至92.8%,GPT-5.5达到99.7%。agent在不同查询、不同轮次间的稳定性也大幅提升,系统性错误几乎消失。
在工程效率上,对包含超过900万条记录的SARS-CoV-2数据库进行过滤时,传统“全量下载再本地过滤”需要下载 284GB 数据,而gget virus仅需 3.8GB,数据量减少98%。
图4:程序化病毒数据检索的压力测试结果
图4:程序化病毒数据检索的压力测试结果(120个查询,每小时并发执行3个,持续24小时)。分别展示了成功率、元数据字段数量、存储消耗、峰值内存占用和平均运行时间。

病毒数据检索:AI agent的致命短板

什么是确定性病毒序列检索?同样的查询,同样的数据库,不管查多少次、谁查,结果必须完全一致。但现在的AI agent做不到——它们像“自由发挥”的实习生,有的翻网页,有的调API,有的自己编答案。这种“非确定性”在科研里是大忌。
现有程序化数据检索手段,如直接调NCBI API,也问题多多。论文列出了不同API支持情况的对比表格——看完就知道AI agent为什么这么难。
表1:NCBI各API所支持的过滤功能对比
表1:NCBI各API所支持的过滤功能对比。很多重要过滤条件(如基因名称、隔离来源等)在现有API里不支持或支持不完整,迫使研究者靠手动或AI agent“土办法”处理。

VirBench基准测试揭秘LLM检索能力

研究团队创建了VirBench,包含120个手工精心设计的病毒序列查询,覆盖从简单单一病毒检索到复杂多条件组合过滤。每个查询都有基于手工执行NCBI网页界面的“标准答案”。
六个当前最先进的AI agent被推上“考场”:Biomni(基于Claude Sonnet 4)、Edison AnalysisGPT-5.2-proGPT-5.5Claude Sonnet 4Claude Opus 4.7。最好的GPT-5.5只考了91.3分,最差的Claude Sonnet 4仅16.9%!在科研数据检索里,91.3%远远不够——那8.7%的错误可能漏掉关键疫情变异株。而且agent在重复运行时表现很不稳定。
失败模式包括:复杂查询(超过3-4个过滤器)导致漏计数、翻页失败、自行对不存在的过滤器进行脑补。AI agent在“数据检索”这个看似简单的事情上,暴露了作为“概率模型”的先天不足。

gget virus:把“模糊查询”变成“精确计算”

论文给出的方案很聪明:既然AI agent在“模糊”的网页交互中表现不好,就给它一个确定的、程序化的接口。他们打造了gget virus,它是已有开源项目gget(GitHub 1.2k星)的一个模块。核心思想是分阶段查询优化策略:能不下载的数据绝不下载,能提前过滤的绝不拖到后面。
工作流程分四步:

第一步:轻量级元数据预筛选。通过NCBI Datasets API下载最轻量的元数据(长度、宿主、位置等),在此过程中应用服务器端能过滤的全部条件。

第二步:本地精确过滤。元数据到手后,在客户端进行更精细的过滤(如基因名称、隔离来源等服务器不支持的条件),进一步缩小候选序列范围。

第三步:按需差分下载。只有通过所有过滤的序列才触发实际序列数据下载,GenBank记录也按需获取。

第四步:鲁棒性重试与回退。如果某个API临时罢工或过滤器不支持,gget virus自动检测、重试,甚至切换备选API路径,确保流程不因单一节点故障崩溃。

下图展示了gget virus处理具体查询时的内部流程:
图3:gget virus工作流程示意图。展示了搜索具有特定过滤条件的HIV-1原病毒序列的示例。图中灰色框展示内部查询处理步骤,右侧为返回给用户的输出文件。
效果有多夸张?检索2025年发布的所有包含表面糖蛋白的SARS-CoV-2序列,传统方法需下载284GB数据,gget virus仅用3.8GB——减少98%!更关键的是,这套接口是确定性的,同样参数不管运行多少次,返回的序列集合完全一致。

压力测试下gget virus的绝对优势

研究团队设计了严苛的压力测试:将VirBench的120个查询,在24小时内每小时重复执行一遍,并发3个查询。对比对象是直接使用NCBI Datasets REST API和Datasets CLI。结果:

成功率:gget virus几乎100%成功,原生API在部分时段仅60%-80%。

存储效率:gget virus单次查询中位数存储仅0.4MB,而Datasets REST API需2.2MB,CLI需2.6MB,节约约5-6倍。

元数据丰富度:gget virus的CSV输出包含41个元数据字段,增强版GenBank元数据达51个字段,原生API仅25个。

内存占用:三者峰值内存相当,普通笔记本电脑就能跑。

当让AI agent使用gget virus作为数据检索工具时,准确率全部飙升至90%以上,GPT-5.5达到99.7%。agent在不同运行间的稳定性也大幅提升。这说明,真正的问题不在于AI agent不够聪明,而在于缺乏一个确定的编程接口

从科研到实战gget virus如何赋能下一次疫情

关键应用场景:

疫情暴发应急:快速、准确、可复现地下载所有相关序列,保证全球团队拿到完全一致的数据集。

疫苗与抗体设计:高效检索特定基因型、特定时间段的序列,省去大批量下载和本地筛选的繁琐。

进化与传播追踪:结合地理、时间信息,轻松构建系统发育树,追踪变异株传播路径。

机器学习模型训练:确定性数据检索让干净、完整、有标注的训练数据集构建不再是玄学。

插图
gget virus为病毒基因组数据检索这个“脏活累活”找到了工程化解决方案。下一次疫情来临时,如果全球科学家都能用上这套工具,数据层面的混乱将大幅减少。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:这篇论文解决什么问题?A:解决了AI agent进行病毒序列数据检索时准确率低、不稳定、不可复现的问题。核心贡献是构造了确定性数据检索工具gget virus和评估基准VirBench。

Q2:gget virus与直接调用NCBI API有什么区别?A:gget virus实现了分阶段查询优化策略,内置错误重试、自动回退、本地二次过滤等机制。输出是确定性的,而直接调用API常因翻页、服务器状态导致不一致。

Q3:VirBench包含哪些查询类型?A:包含120个手工构建的查询,覆盖40种病原体,从简单单个病毒搜索到复杂多条件组合过滤(最多同时应用6个过滤器)。参数包括宿主、地理位置、收集日期、序列长度、片段类型等。每个查询都有通过人工在NCBI网页界面执行的预期结果作为标准答案。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

思路不算全新,但系统化应用到病毒序列检索并构建完整基准测试和工具链,创新性足够。

实验合理度:★★★★★

实验设计严谨:120个手工查询,重复三次,24小时压力测试,多角度对比,结论信服力强。

学术研究价值:★★★★☆

为AI agent在数据检索场景下的可靠性研究提供了重要基准和工具,推动“确定性基础设施”在生物信息学领域的重视。

稳定性:★★★★★

gget virus内置完整错误处理和重试机制,压力测试表明在各种网络条件下都能稳定返回结果。

适应性以及泛化能力:★★★★☆

目前专注于病毒序列检索,但分阶段查询优化框架可推广到其他基因组数据或类似多源数据检索场景。

硬件需求及成本:★★★★★

普通笔记本电脑即可流畅运行,数据下载量极小,完全开源免费。

复现难度:★★★★★

代码已开源(MIT协议),提供Python包和命令行工具,文档齐全,安装简单。

产品化成熟度:★★★★☆

作为开源工具已具备产品级质量,但在大规模并发或高可用性要求下需进一步优化。

可能的问题:论文未深入探讨agent在“如何正确使用gget virus输出”上的失败——部分agent会对工具输出进行二次“脑补”导致错误,暴露了AI agent在工具使用中的“推理脆弱性”。


主要参考文献

[1] Nashif et al. "Deterministic access to global viral sequence data enables robust AI agent-driven scientific discovery." arXiv:2606.14504v1, 2026.
[2] gget: One-line access to genomic databases. https://pachterlab.github.io/gget/
[3] NCBI Virus. https://www.ncbi.nlm.nih.gov/labs/virus/
[4] Benson et al. "GenBank." Nucleic Acids Res. 2013.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🐶 看完这篇,是不是觉得AI agent在科研数据检索上“一本正经地胡说八道”太可怕了?想获取更多像gget virus这样能真正落地的科研工具解析?想知道如何用一行Python代码搞定复杂的生物信息学分析?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 病毒序列分析+上海+加州理工+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,近期将新增“生物信息学与AI制药”专题群,感兴趣的小伙伴速来占座! wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。