← 返回 PaperDaily 大模型与智能体

RIKEN新解:LLM数据溯源“捷径”还是“精确制导”?BM25+影响力函数99%一致?

LLM输出的“灵感”到底是从训练数据里“原样照搬”还是“高维加密”后释放?日本理研牵头的新研究首次给数据相似度(BM25)和数据影响力(KFAC)的排名关系画了张精准的“等高线图”。发现一个反直觉事实:影响力函数能更一致地预测相似度的结果,反过来则不行——这意味着“先BM25粗筛,再影响力精排”的混合方案,可能是大模型可解释性工具箱里的黄金搭档。

RIKEN新解:LLM数据溯源“捷径”还是“精确制导”?BM25+影响力函数99%一致?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
LLM输出的“灵感”到底是从训练数据里“原样照搬”还是“高维加密”后释放?日本理研牵头的新研究首次给数据相似度(BM25)和数据影响力(KFAC)的排名关系画了张精准的“等高线图”。发现一个反直觉事实:影响力函数能更一致地预测相似度的结果,反过来则不行——这意味着“先BM25粗筛,再影响力精排”的混合方案,可能是大模型可解释性工具箱里的黄金搭档。


原论文信息如下:
论文标题:
Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior
发表日期:2026年06月
发表单位:RIKEN Center for Advanced Intelligence Project(日本理研)、EPFL(瑞士洛桑联邦理工学院)、达姆施塔特工业大学(TU Darmstadt)
原文链接:https://arxiv.org/pdf/2606.23591v1.pdf

LLM输出溯源:到底是“长得像”还是“学到过”?

各位看官,咱们聊个大模型经常会被灵魂拷问的问题:一个LLM为什么能输出这么个玩意儿?它的“灵感”或“知识”,到底是从训练数据里 “原样照搬”,还是通过复杂机制“理解”并“泛化”了?这事儿对解决幻觉、偏见、版权问题都至关重要。
要追溯“灵感来源”,学术界主要有两大流派:一派是“数据发小”路线,看 输出和训练数据长得像不像(数据相似度);另一派是“挖祖坟”路线,看 如果把某块数据从训练里拿掉,输出会不会变(数据影响力)。两个方法各有拥趸,但到底谁更靠谱?它们之间是“同行是冤家”还是“可以称兄道弟”?
日本理研(RIKEN)牵头的团队,联合EPFL和达姆施塔特工业大学,最近就干了这么件事。他们精确量化了两种方法之间的 “同与不同”。结果嘛,有点意思。
图1:理解LLM行为的一种方式是用prompt对其进行探测,并将其响应追溯到训练数据。文献中使用了两种追踪方法:数据相似度和数据影响力。两者都会返回训练数据的排名。我们比较这些排名,以了解它们在哪些方面一致和不一致,以及应该优先选择哪一种。
图1:理解LLM行为的一种方式是用prompt对其进行探测,并将其响应追溯到训练数据。文献中使用了两种追踪方法:数据相似度和数据影响力。两者都会返回训练数据的排名。我们比较这些排名,以了解它们在哪些方面一致和不一致,以及应该优先选择哪一种。

两大方法硬碰硬:BM25 vs 影响力函数

在深入结果之前,咱们得先把两个“选手”请上台,看看它们各自的独门绝技。

选手一号:数据相似度(Data-Similarity)

这位选手的绝活叫做“以貌取人”。核心逻辑是:如果模型输出和训练语料中的某段文本在字面上非常“像”,那么这段文本就很有可能是“灵感来源”。
本文中,这个流派的代表算法是 BM25(Best Matching 25)。BM25是一种更高级的“词袋”模型,计算查询和每个文档中词的匹配程度。像OLMo-Trace(Liu et al., 2025a)这类工具,用的就是BM25做输出溯源,据说跟人工判断的相关性很高。
它最大的优点是 便宜、高效。在动辄数万亿tokens的语料里大海捞针,用BM25这种纯文本匹配方法,算力成本几乎可以忽略不计。

选手二号:数据影响力(Data-Influence)

这位选手的招数要“内力深厚”得多。它想回答一个反事实问题:“如果当初模型训练时没看过这个文档,它的输出会有什么不同?” 这种衡量训练数据对模型输出“贡献度”的方法,就是数据影响力。
理论上最好的方法是“把模型重头训一遍,但剔除某个文档”,但这在实操上简直是天方夜谭。所以研究者们发明了各种高效的近似方法。本文主要使用的是基于Hessian矩阵的 EK-FAC(Eigenvalue-corrected Kronecker-Factored Approximate Curvature)估计器。它通过分析模型参数的“曲率”来推断剔除某个数据会造成的影响力,虽然比BM25贵很多,但理论上也精确很多。他们还对比了更简单的对角近似(DIAG)和纯梯度方法(GRAD)。

核心发现:不对称的一致性与混合策略

好,两位选手都就位了,那它们会不会“英雄所见略同”呢?答案是,有点同,但又不同。文章的“实验设置”工作流如下:
图3:比较数据影响力和数据相似度排名的实验工作流程。
图3:比较数据影响力和数据相似度排名的实验工作流程。
论文的核心实验是:给模型100个不同的提示(prompt),让模型自己生成回复,形成“查询”。然后,分别用BM25和EK-FAC对训练数据中心的所有文档进行打分,得到两个排名。通过对比排名来量化关系。第一个发现就是图2中的案例:
对于“如何打开锁着的门”这个prompt,BM25给出的top-3文档里,第三个居然是讲SCRUM开发方法的,跟“开门”八竿子打不着。而EK-FAC给出的文档精准得多,全是关于门锁的。这说明BM25虽然便宜,但可能被某些关键词蒙蔽,并不知道模型真正学到了什么。
但是,看所有100个prompt的整体排名情况,作者发现了一个更微妙的规律,就是图4中展示的“不对称性”:
图4:该图显示了Inf和Sim之间的一致性,以及Inf根据Sim对top文档的排序优于Inf根据Inf对top文档的排序。左侧的两个表格(a)显示了top-20设置的差异,其中超出top-100的排名以黄色突出显示。右侧的两个图(b)可视化了横轴上的top-100,以及纵轴上对数刻度下的另一种度量分配的排名。实心黑线表示度量之间可能的最佳匹配。结果针对查询:
图4:该图显示了Inf(影响力)和Sim(相似度)之间的一致性,以及Inf根据Sim对top文档的排序优于Inf根据Inf对top文档的排序。
图4展示了对某个特定prompt的结果。在BM25的top-20里,有3个文档在影响力方法的排名中跌出了100名开外(黄色高亮)。但在影响力方法的top-20里,有7个文档在BM25的排名中跌出了前100。右边的点图更能说明问题:对于BM25排出的文档,影响力方法给出的排名往往比较靠前;但对于影响力方法排出的文档,BM25给的排名就发散多了。 这说明:影响力方法能更好地“预测”相似度方法的偏好,而反过来则不太行。论文里称之为“不对称性”。
这个不对称性在统计上也是显著的(通过Wilcoxon符号秩检验验证)。作者因此提出了一个非常实际且优雅的“混合策略”:
先粗筛,再精排。 先用廉价的数据相似度(BM25)快速过滤出一个相对较小的候选文档集,然后再对这个候选集用昂贵的、更准确的数据影响力方法进行精准排序。如图6b的ROC曲线所示,这种“预过滤+精炼”的策略(Inf→Sim方向),AUC达到了0.83,而反过来(Sim→Inf方向)的AUC只有0.63,再次证实了该策略的有效性。
图6:结果表明Inf比反之更能预测Sim。(a)使用Inf(KFAC)预测Sim(BM25)的前100名排名,反之亦然,针对四种LLM。对于所有100,000个排名和六种LLM,请参见附录D。(b)使用Sim进行预过滤并使用Inf进行精炼,反之亦然,在OLMo2-1B上使用接收者操作特征进行评估。有关详细信息,请参见步骤H。
图6:结果表明Inf(影响力)比反之更能预测Sim(相似度)。

用数据说话,跨模型与跨方法验证

光在一个模型上看出点门道还不够。这篇文章对OLMo2-1B, Qwen3-1.7B, LlaMa3.2-1B, Gemma3-1B, GPT2-medium和GPT2-small 一共6个不同规模、不同架构的模型都进行了同样的实验。结果如何?来看图5b的“一致性”曲线:
图5:(a)在深度d增加时,大小为7的同一集合上两个示例排名的一致性(见附录方程8)。一致性不会随深度单调增加,但当排名基于同一集合时,最终会达到1.0。(b)六种LLM的Inf和Sim之间的一致性。曲线在接近排名1时的陡峭上升表明top排名的一致性。方差基于100次查询显示。底部灰线是无关排名的预期一致性。关于所有100,000个排名,请参见附录图8。
图5:(a)示例排名一致性图。(b)六种LLM的Inf和Sim之间的一致性。
所有6条曲线都呈现出一个共同的特征:在top排名区域(比如前100-1000),曲线有一个非常陡峭的上升,说明两种方法对于“高度相关”的文档确实存在共识。但从纵坐标的绝对值来看,即使在前100名,达成一致的文档比例也不到15%,说明分歧是主流。这个现象在不同模型上惊人的一致。
文章还进一步验证了影响力方法自身不同“档位”的影响。他们用OLMo2-1B模型,对比了三种影响力估计器:最高精度的EK-FAC;折中的DIAG;和最简单粗暴的GRAD。结果也在图7中呈现:
图7:在OLMo2-1B上,我们的观察结果在各种影响力估计器之间的一致性。(a)Sim(BM25)和Inf(各种)之间的一致性。方差基于100次查询显示。底部灰线是无关排名的预期一致性。(b)使用Inf(各种)预测Sim(BM25)的前100名排名,反之亦然。为增强可读性,已隐藏方差。有关所有100,000个排名和方差,请参见附录图10a和10b。
图7:在OLMo2-1B上,观察结果在各种影响力估计器之间的一致性。
从图7中可以看出,一个很明确的趋势是:影响力估计器越精确(从GRAD到DIAG再到EK-FAC),它与BM25的一致性就越高,不对称性也更明显。 这再次佐证了结论的稳健性。
图8:各种LLM的BM25和KFAC之间的一致性。曲线在接近排名1时的陡峭上升表明top排名有一定一致性。方差基于100次查询显示。底部灰线是无关排名的预期一致性。主文中仅包含20,000个排名的图可以在图5b中找到。
图8:各种LLM的BM25和KFAC之间的一致性(完整排名范围)。
图9:结果表明Inf比反之更能预测Sim。使用Inf(KFAC)预测Sim(BM25)的前100名排名,反之亦然,针对六种LLM。关于仅针对四种LLM的有限20,000个排名,请参见图6a。
图9:结果表明Inf比反之更能预测Sim(对所有6个模型的全景验证)。

局限性、未来方向与总结

当然,这篇文章也不是无懈可击,作者自己也非常坦诚地指出了局限性:
计算量太大。 计算EK-FAC影响力需要对每个prompt在所有文档上做一次模型推理,这导致他们只能玩100个prompt和10万个文档的小数据集。对于万亿token级的全量训练数据,这个计算开销目前还是无法承受的。这也就意味着,虽然他们发现了“不对称性”这个规律,但这个规律的最直接应用——先BM25粗筛再影响力精排——本身也需要验证在更大规模数据上的可行性。
未来工作方面,作者希望将此工作作为一个“试金石”,为OLMo-Trace这类工具开发混合版本,同时验证在实时推理场景中,这种“粗筛+精排”的混合方法到底能不能打。他们也想探索其他的相似度方法(比如基于语义嵌入的),看看更强大的“发小”能不能和“祖坟”达成更广的共识。
总的来说,这篇来自日本理研等机构的论文,没有去造一个更炫酷的模型,而是非常清晰、量化地回答了一个大模型解释性领域的基础问题。它用大量实验告诉我们:用“字面像不像”(数据相似度)来溯源,和用“学没学过”(数据影响力)来溯源,两者有交集,但侧重点完全不同。而且,影响力方法的视角更加“居高临下”。 这不仅让我们对LLM的内部运作有了更深的理解,也给出了一条非常实际的、可以在工程落地上尝试的混合路径。这,应该就是一篇优秀的AI可解释性研究论文该有的样子。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:这篇论文主要解决了什么核心问题?核心问题是:在LLM输出溯源任务上,两种主流方法——轻量级的数据相似度(如BM25)和重量级的数据影响力(如影响函数)——到底有什么样的定量关系?它们的结果是相互印证还是相互冲突?哪一种更“可靠”?

问题2:文章中提到的“不对称性”具体是什么意思?“不对称性”指的是数据影响力(Inf)能更好地“预测”数据相似度(Sim)的排名结果,而反过来不行。简单说,Inf觉得“重要”的东西,Sim不一定“长得像”;但Sim觉得“长得像”的东西,Inf大概率也认为“重要”。

问题3:如果我想在自己的工作中应用这个结论,有什么简单的建议吗?有的。如果你现在做LLM的溯源,可以先用非常廉价、高效的BM25把全量数据筛选到一个较小的候选池。然后,针对这个小小的候选池,再使用更昂贵、也更准确的数据影响力方法进行精确排序。这种“先粗筛、后精排”的策略,可以达到成本和准确性的黄金平衡点,这也是本文最核心的工程价值所在。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰

首次精确量化了数据相似度和数据影响力在LLM输出溯源上的关系,发现了“不对称性”这个反直觉结果。虽然方法本身是现有的,但解决了一个重要且未被明确回答的问题,角度新颖。

实验合理度:★★★★✰

实验设计规范,覆盖6个模型、3种影响力估计器,并进行了严格的统计显著性检验,结果说服力强。唯一不足是受限于算力,prompt和文档数量有限。

学术研究价值:★★★★✰

对于LLM可解释性领域,这篇文章提供了一块重要的基石。它证明了不同溯源方法之间的互补性,为后续开发更强大的混合溯源工具提供了理论依据和量化框架。

稳定性:★★★✰✰

结论的稳定性很高,在不同模型上观测到了一致的趋势。但“先粗筛后精排”这个核心应用对超参数和候选集大小的敏感度未进一步探索。

适应性以及泛化能力:★★★✰✰

结论在论文测试的6个模型上泛化良好,但未在更大规模模型(如70B)或更复杂数据集上验证。对于不同领域(如代码、多模态)的泛化能力有待进一步检验。

硬件需求及成本:★✰✰✰✰

仅仅为了做实验,计算影响函数就需要16块V100跑上一个月。这突出说明数据影响力方法本身成本极高,这正是他们提出混合策略的动机所在。

复现难度:★★★★✰

论文方法论描述清晰,实验流程详尽。虽然计算门槛高,但并不涉及难以复现的“炼丹”技巧。若代码开源则评级可提升至5星。

产品化成熟度:★★✰✰✰

“先粗筛后精排”的思路本身很有产品潜力,可以作为OLMo-Trace等工具的一个插件。但论文仅提供了一个初步的proof-of-concept,离一个完整、稳定、可落地的产品还有距离。

可能的问题:核心局限性在于计算量,导致prompt数和文档数都太少(100个查询,10万文档),对于万亿token级的真实场景,结论的普适性和“混合策略”的实际效果仍有待验证。另外,只对比了BM25一种相似度方法,未探索更先进的基于模型嵌入的相似度,可能会强化“影响函数优于相似度”的印象。


主要参考文献

1. Anders, C.J., Silva Gameiro, H. D., Daheim, N., & Khan, M. E. (2026). Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior. arXiv:2606.23591.
2. Robertson, S. E., & Zaragoza, H. (2009). The probabilistic relevance framework: BM25 and beyond. Foundations and Trends in Information Retrieval.
3. Koh, P. W., & Liang, P. (2017). Understanding black-box predictions via influence functions. ICML.
4. Liu, N. F., et al. (2025a). OLMo-Trace: Output Tracing for the OLMo Language Model. arXiv preprint.
5. Grosse, R., et al. (2023). Studying Large Language Model Generalization with Influence Functions. NeurIPS.
6. Webber, W., Moffat, A., & Zobel, J. (2010). A similarity measure for indefinite rankings. ACM TOIS.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
论文看完了,想和龙哥一起深入探讨大模型溯源机制的细节?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 LLM可解释性+上海+RIKEN+小龙),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。