← 返回 PaperDaily 视觉与图像

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败

历史文档像一本被水泡过的《永乐大典》,人名地名糊成一片,传统MLM模型只能干瞪眼。韩国国立江原大学的团队祭出大招——ARI让大语言模型学会“翻书查资料”,用RAG精准找回那些被岁月抹去的名字。在朝鲜王朝实录的修复中,ARI-32B(Qwen3 32B微调版)在命名实体恢复上直接把GPT-5.1按在地上摩擦,效果翻倍。这不仅是个技术活,更像是在帮AI配一副“历

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败
原论文信息如下:
论文标题:
Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
发表日期:
2026年07月
发表单位:
Kangwon National University (韩国国立江原大学)
原文链接:
https://arxiv.org/pdf/2607.21936v1.pdf
开源代码链接:
论文未提供

想象一下,你手里有一本传世古籍,被虫蚁蛀蚀、被水渍浸染,上面的字迹斑驳难辨。你是个历史学家,想通过上下文猜出被腐蚀的到底是什么字。比如:“甲午年,[??] 将军率兵出征。” 这个 [??] 可能是“李”,也可能是“王”,还可能是“张”…… 没有其他史料参考,纯粹瞎蒙。传统AI修复方法恰恰就是这样——它们只看这一页“古籍”的局部文字,顶多看看前后文,但遇到人名、地名这些需要史实背书的“硬骨头”时,基本就抓瞎了。
最近,韩国国立江原大学的Gabeen Kim和Kyeongpil Kang,针对这个问题搞了个大动作——他们提出了ARI(Archive Restoration Intelligence)框架,简单来说,就是让大语言模型(LLM)学会“翻书查资料”。这个“资料”就是检索增强生成(RAG)。融合了RAG的LLM不再只是凭“记忆力”瞎猜,而是会像学者一样,先去浩瀚的史料库中检索几篇最相关的文档,然后基于这些“参考文献”来预测被遮掩的字符。结果非常惊人:在修复朝鲜王朝实录这类韩文历史文档时,ARI-32B在命名实体(人名、地名、书名)恢复上的准确率,远超GPT-5.1和Gemini 2.5 Pro,直接让传统方法相形见绌。
图1:本文提出的模型与基线模型的性能对比。X轴和Y轴分别代表命名实体和随机掩码字符的恢复准确率。
图1:本文提出的模型与基线模型的性能对比。X轴和Y轴分别代表命名实体和随机掩码字符的恢复准确率。

历史文档修复之痛:为啥传统方法搞不定“人名地名”?

外部知识来助阵:LLM + RAG 如何变身修复专家?

ARI模型登场:从元数据到文档检索,一步步精准修复

效果惊人:在真实历史文档上,ARI完胜GPT-5.1和Gemini

局限与展望:时间漂移、图像缺失,未来还能怎么玩?

龙迷三问

龙哥点评

主要参考文献

历史文档修复之痛:为啥传统方法搞不定“人名地名”?

想象一下,你是一位历史学者,正在翻看一本五百年前的朝鲜王朝实录。页面被水渍浸染,虫蛀出大小不一的窟窿,文字断断续续。你需要根据上下文猜出空白处的字——比如“吏曹判书 [??] 初度呈辞”。这个[??]很可能是一个人的名字,但仅凭前后几个字,你根本无法确定是“李恒”还是“沈之源”。这就是修复历史文档的核心痛点:大多数被损毁的字符是命名实体(Named Entity,即人名、地名、书名等专有名词),它们不像普通动词或虚词那么有规律,需要外部历史知识来推断。
传统方法大多基于掩码语言建模(Masked Language Modeling, MLM),比如BERT。这类模型只依赖损坏文档本身的局部上下文来预测被遮挡的字符。打个比方:就像你只盯着这句话本身的几个词来猜,却不知道这个时代谁在做官、哪个地方发生了什么事。对于“甲午年,[??] 将军率兵出征”这样的句子,如果模型不知道甲午年是哪一年、当时朝廷里哪位将军带兵,它就只能在常见姓氏里瞎蒙——正确率自然很低。
论文作者统计了朝鲜王朝实录(AJD)和承政院日记(JRS)这两个大型语料库中的真实损坏情况。数据显示,JRS中有超过4万个损坏字符,平均每个损坏文档有3.77个被掩码字符。更关键的是,通过大型语言模型(如Gemini-2.5-Pro)对损坏字符进行命名实体类型分类,结果发现大约44.8%的损坏字符是命名实体,其中“人物(PER)”占比最高,其次是“地点(LOC)”和“时间(DAT)”。这意味着,修复工作不能靠猜,必须借助外部知识。
图2:真实历史文档损坏示例,掩码字符用□表示
图2:真实历史文档损坏示例,掩码字符用□表示
图3:损坏字符的分布饼图,包括命名实体的类别比例:PER(人物)、LOC(地点)、DAT(时间)、POH(出版历史)、ETC(其他)
图3:损坏字符的分布饼图,包括命名实体的类别比例:PER(人物)、LOC(地点)、DAT(时间)、POH(出版历史)、ETC(其他)
表1展示了两个语料库的原始数据统计,其中AJD约0.37M文档,JRS约1.75M文档;JRS包含11.1K个损坏文档(41.9K损坏字符),而AJD只有56个。JRS平均每个文档有3.77个损坏字符,这也说明实际挑战的规模。
表1:AJD和JRS原始语料统计,NEs和[D]分别代表命名实体和损坏字符
表1:AJD和JRS原始语料统计,NEs和[D]分别代表命名实体和损坏字符

外部知识来助阵:LLM + RAG 如何变身修复专家?

既然传统MLM方法不行,那换个思路:让AI像历史学家一样,先查资料再下结论。本文巧妙的利用了检索增强生成(Retrieval-Augmented Generation,RAG)技术。RAG的核心思想是:当模型需要回答问题时,不是凭空捏造,而是先从外部知识库中检索最相关的文档,把文档内容塞进提示词里,再让大语言模型基于这些“参考资料”生成答案。
具体到历史文档修复,论文把损坏文本所在的句子作为查询,从训练语料库(包含大量完好的历史文档片段)中检索出最相似的文档片段。这些片段可能包含相同的人物、地点或事件,能提供关键上下文线索。例如,如果损坏字符是“李”还是“王”,而检索到的文档中多次出现“吏曹判書李厚源”,那么模型就更倾向于预测“李”。
此外,论文还充分利用了**元数据**——文档本身的年份、月份、日期等信息。比如同一段文字,发生在朝鲜英祖年间还是正祖年间,会直接影响人物和地名的概率。论文在实验中验证了加入元数据后修复性能的提升。
表2展示了多种大语言模型在没有RAG情况下的基础修复性能。可以看出,即使只有基础提示(没有外部知识),Sonnet 4.5、Gemini-2.5-Pro等闭源模型在随机位置修复上可以达到30%左右的Top-1准确率,但在命名实体(NE)上表现差很多——最好的Sonnet 4.5也才13.3%。这说明仅靠内部知识远远不够。
表2:不同LLM在D_NE和D_Rand上的基础修复性能(Top-1准确率)
表2:不同LLM在D_NE和D_Rand上的基础修复性能(Top-1准确率)
作为对比,加入元数据后的效果在表3中呈现。以Qwen3 32B为例,单纯添加时间信息(如年份、月份)就在NE上从5.57提升到5.63,在随机位置上从13.37提升到14.83。虽然增益不大,但证明了时间信息的价值。
表3:基于是否包含元数据的修复性能对比
表3:基于是否包含元数据的修复性能对比
图5展示了论文使用的提示词示例。模型接收被损坏的文档,并在提示中明确标记出每个掩码字符的位置([D1], [D2]...),然后要求模型输出每个位置的预测字符。这种设计确保了生成过程的精确可控。
图5:基于LLM修复的基础提示词示例
图5:基于LLM修复的基础提示词示例

ARI模型登场:从元数据到文档检索,一步步精准修复

有了外部知识的思路,论文提出了一套完整的框架——ARI(Archive Restoration Intelligence)。整体架构如图4所示:输入不仅包括损坏文本本身,还包括任务描述、格式示例、检索出的相关文档以及元数据。这些信息组合成一个丰富的提示词,送入大语言模型(具体为Qwen3 32B),经过微调后输出每个掩码位置的预测字符。
图4:所提出的损坏文档修复框架概述。LLM的输入包括任务描述、格式示例、与损坏文本相关的文档以及元数据(如时间信息)。基于此结构,ARI专门针对历史文档修复任务进行了微调。
图4:所提出的损坏文档修复框架概述。LLM的输入包括任务描述、格式示例、与损坏文本相关的文档以及元数据(如时间信息)。基于此结构,ARI专门针对历史文档修复任务进行了微调。
框架的构建分三步走:
第一步:基础性能评估。论文先让多种大语言模型(包括开源和闭源)直接在基础提示下尝试修复,结果如上表2所示。发现闭源模型Sonnet 4.5表现最好,但NE准确率仅13.3%。这可以作为外部知识引入前的基准。
第二步:加入外部知识。包括元数据(时间信息)、few-shot示例和RAG检索文档。表4展示了加入不同策略后的性能提升。+ Metadata 后NE提升到5.63;+ 静态few-shot示例提到6.27;动态随机从语料库选2个示例(随机检索)提到8.55;使用嵌入检索(Gemini嵌入)提到19.88;使用BM25(词频检索)提到24.28;最后加上去重处理,NE达到27.85%,随机位置达到61.45%——相比基础线5.57/13.37简直是爆炸性提升!
第三步:微调专用模型ARI。论文选择了Qwen3 32B作为backbone,使用动态掩码策略(即每轮训练随机改变掩码位置)训练了约1500 H200 GPU小时。为了进一步提升NE修复能力,他们采用了命名实体优先掩码策略:25%的训练样本中,掩码优先施加在命名实体字符上,这进一步提升了NE修复精度。
表4:添加few-shot、RAG和去重对修复性能的影响
表4:添加few-shot、RAG和去重对修复性能的影响
去重策略也很有意思。论文发现,如果检索出的文档中有大量高度相似的复本(比如同一事件的多次记载),模型容易产生偏见。他们试验了不同的相似度阈值(图6),最终选择80%作为去重门槛,即删除与已有文档相似度超过80%的文档,在NE和随机位置上同时取得最佳效果。
图6:不同去重阈值下的修复性能。曲线表示D_NE和D_Rand修复性能的调和平均值。
图6:不同去重阈值下的修复性能。曲线表示D_NE和D_Rand修复性能的调和平均值。

效果惊人:在真实历史文档上,ARI完胜GPT-5.1和Gemini

论文在多个维度上评估了ARI的性能,包括自动测试(基于合成损坏)和专家评估(基于真实损坏文档)。结果相当有说服力。
自动测试结果(图1):ARI-32B在命名实体修复(D_NE)上达到约45%的Top-1准确率,在随机位置修复(D_Rand)上达到约75%,远超GPT-5.1(NE约10%,Rand约28%)和Gemini-2.5-Pro(NE约9.5%,Rand约32%)。即使与Sonnet 4.5相比(NE 13.3%,Rand 32.4%),ARI-32B也是全面的巨大提升。注意,图1在引言已经展示,这里不再重复。
更细致的分析按命名实体类别展开(图7)。ARI-32B在人物(PER)和地点(LOC)类别上均超过BERT-Res和Gemini-2.5-Pro,在类别“出版历史(POH)”上略逊于Gemini-2.5-Pro。原因可能是Gemini-2.5-Pro通过多语言预训练获取了大量中国经典知识,而ARI专精于朝鲜王朝史料,在涉及中国经典时知识覆盖不足。
图7:在D_NE数据集上按不同命名实体类别的Top-1准确率比较
图7:在D_NE数据集上按不同命名实体类别的Top-1准确率比较
专家评估结果(表5):让人信服的不仅是自动指标,论文还请了三位历史文献专家对100份真实损坏文档进行盲测。专家从候选字符中选择符合上下文且合理的字,以此计算准确率。ARI-32B在Top-1准确率(38.3%)上远超BERT-Res(20.7%)和Gemini-2.5-Pro(27.3%);nDCG@10达到0.477,BERT-Res为0.296。最关键的是**胜率(Win Ratio)**:专家认为ARI-32B的候选列表最有帮助,胜率为46.0%,Gemini为30.0%,BERT-Res为24.0%。这说明ARI不仅能更准地给出最佳候选,还能提供更优质的候选列表,真正减轻了历史学者的工作负担。
表5:ARI-32B、BERT-Res和Gemini-2.5-Pro在人类专家评估下的修复性能
表5:ARI-32B、BERT-Res和Gemini-2.5-Pro在人类专家评估下的修复性能
定性示例(表6):表6给出了三个典型示例,展示不同模型的实际输出。第一个例子中,只有ARI-32B正确恢复了“李厚源”、“吏曹判書”等人物名;第二个例子中,ARI-32B虽然与原文“子孫”不同,但预测的“後孫”在语义上完全等价;第三个例子中,ARI-32B准确恢复了“全羅道”、“光州”等地点名。这充分表明ARI-32B在需要外部知识的关键字符修复上具有显著优势。
表6:本文模型与基线模型的修复示例对比
表6:本文模型与基线模型的修复示例对比

局限与展望:时间漂移、图像缺失,未来还能怎么玩?

尽管效果惊艳,论文也坦诚指出了几个关键局限性:
时间域漂移问题:论文用更早的史料《高丽史》(Goryeosa)作为未知域测试。结果如图8所示,当检索文档与目标文档的时间跨度越大,性能下降越明显。例如,14世纪的文档参考19世纪的语料库,准确率明显低于15-16世纪的文档。这是因为语言和历史知识都随时间演变,检索到的参考文档与目标文档在风格和背景上存在差距。未来可以考虑使用跨时代的检索策略或重建历史知识图谱来缓解。
图8:跨未见时间域的修复性能,强调时间漂移的影响
图8:跨未见时间域的修复性能,强调时间漂移的影响
图像缺失:当前工作仅处理文本层面的修复,没有利用文档的视觉信息(如笔迹风格、字形痕迹、纸张纹理等)。在实际考古中,人眼往往能根据残存的笔画轮廓推断字型,但ARI完全忽略了这一信息。与多模态大模型结合(例如将扫描图像输入并融合文本检索)是极具潜力的方向。
计算成本:微调Qwen3 32B需要1500 H200 GPU小时,这对很多研究团队而言不是小数目。但考虑到参数规模,这个成本在可接受范围内。论文还提供了微调后的8B版本(ARI-8B),其性能已经接近甚至超过未微调的闭源模型,相当于用更少的资源获得实用工具。
未来展望:除了多模态融合外,还可以尝试将检索库扩展至更广的历史知识库(如百科全书、古籍数据库),甚至利用知识图谱显式编码实体关系。此外,论文目前只使用Top-K(K=20)个检索文档,如何自适应选择最佳数量的文档也是值得探索的方向。附录中的图9和图10表明,BM25与嵌入检索混合使用时,50%:50%比例效果最佳,检索文档数量在40左右达到平台期——这些发现为工程化部署提供了指导。
图9:不同BM25与嵌入检索混合比例下的修复性能
图9:不同BM25与嵌入检索混合比例下的修复性能

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?本文解决的是历史文档中因物理损坏(水渍、虫蛀、褪色等)导致字符缺失的修复问题。特别针对那些需要外部历史知识才能恢复的命名实体(人名、地名、书名等)。传统MLM方法仅利用文档内部上下文,无法利用外部知识,效果很差。本文通过LLM+RAG框架,让模型在修复时能检索并利用相关历史文档作为参考,显著提升修复准确率。

ARI-8B和ARI-32B有什么区别?两者都是本文提出的修复模型,但基于不同的Base模型微调:ARI-8B基于Qwen3 8B,计算成本低(约400 GPU小时),适合资源受限场景;ARI-32B基于Qwen3 32B,成本约1500 GPU小时,但性能更强。在自动测试中,ARI-8B的NE准确率约为30%(接近Sonnet 4.5),而ARI-32B达到45%,因此推荐使用32B版本。

BM25和嵌入检索哪个更好?为什么论文最终选择BM25?论文实验中,BM25在NE和随机位置上均优于嵌入检索(BM25: NE 24.28, Rand 60.36;嵌入: NE 19.88, Rand 59.91)。因为汉字是表意文字,每个字符承载独立语义,BM25这种基于精确词匹配的检索方法能更好地捕捉相同的专有名词“字面”匹配,而嵌入检索可能丢失精确字符信息。此外,BM25计算简单、可解释性强,适合大规模历史语料。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将RAG与LLM微调结合用于历史文档修复,并系统分析了元数据、few-shot、去重、掩码策略等因素的影响。虽然RAG不是全新概念,但针对历史领域命名实体修复的专门应用和全面实验设计具有创新价值。

实验合理度:★★★★★

实验设计非常完整:自动测试(含合成损坏)和专家评估(含真实损坏)双线验证;对比了多个开源/闭源LLM;消融实验覆盖了元数据、few-shot、RAG、去重、掩码策略、检索数量等每个关键变量;还评估了时间移漂移的影响。专家评估采用盲测,结果可信度高。

学术研究价值:★★★★☆

为历史文档修复领域提供了一个新的基准方法,证明了外部知识检索对提升命名实体修复的关键作用。对RAG在专业领域(尤其是低资源语言、传统语料)的应用提供了有价值的参考。

稳定性:★★★★☆

在自动和专家评估中表现出稳定的性能提升。时间移漂移分析显示,当检索文档语义相近时性能稳定;但文档时间跨度大时会下降,说明依赖检索质量。在实际应用中需要确保检索库覆盖足够广。

适应性以及泛化能力:★★★☆☆

论文仅在朝鲜王朝语料到高丽王朝语料上进行跨域测试,未被其他语种验证。对于汉字文化圈(中文、日文等)的历史文档修复,理论上可迁移但需微调。对非汉字语言(如西方中世纪手稿)可能不直接适用。

硬件需求及成本:★★★★☆

微调需要约1500 H200 GPU小时(32B版本),8B版本约400小时,成本合理。推理时,检索步骤可离线完成(只需要BM25),推理需要加载LLM(Qwen3 32B)消耗显存较多,但现代GPU可以应对。专家评估中使用了字节级约束解码生成Top-K候选,推理资源要求不高。

复现难度:★★★★☆

论文已公开模型和代码(链接见原文),数据是公开的朝鲜王朝实录和承政院日记,复现条件良好。但微调需要H200 GPU资源,部分团队可能不具备。

产品化成熟度:★★★★☆

已提供专家评估界面(图13),可在真实场景中辅助历史学者。但完全产品化还需要整合多模态(图像笔画)、扩展多语言、建立更丰富的知识库。对于韩文汉字历史文档的修复,已经非常接近实用。

可能的问题:论文局限于文本修复,忽略了图像信息(如笔迹轮廓);时间域漂移问题未解决;只验证了韩语汉字语料,泛化性待验证。将外部知识检索与多模态视觉信息结合,才是真正面向古籍修复的完整解决方案。


主要参考文献

[1] Kim, G., & Kang, K. (2026). Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models. arXiv:2607.21936.
[2] Kang, K., et al. (2021). Historical Document Restoration by K. Kang et al. (2021). (论文中引用的MLM基准方法)
[3] Assael, Y., et al. (2019). Pythia: Restoring Characters in Greek Epigraphy.
[4] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. (RAG原文)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
史海钩沉,字湮难寻。ARI让AI学会查阅史书,补全那些被岁月抹去的人名与地名。想和龙哥一起探讨更多“让AI读懂历史”的妙招吗?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 古籍修复+上海+江原大学+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。