← 返回 PaperDaily 视觉与图像

RAG+LLM专治古卷专有名词,Qwen3微调效果超Gemini

历史文档修复一直是难题,尤其涉及专有名词时连GPT-5都容易翻车。韩国江原大学这篇论文把RAG和LLM结合,让模型在修复时自动“查资料”,在朝鲜王朝档案上命名实体恢复率提升近一倍,甚至超过了Gemini-2.5-Pro。代码、模型全部开源,实用价值极高。

RAG+LLM专治古卷专有名词,Qwen3微调效果超Gemini
原论文信息如下:
论文标题:
Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
发表日期:
2026年7月
发表单位:
韩国江原大学(Kangwon National University)
原文链接:
https://arxiv.org/pdf/2607.20889v1.pdf
图2:真实损坏历史文档示例,用□表示损坏字符
图2:真实损坏历史文档示例,用□表示损坏字符

历史文档受损,修复为何这么难?

历史文档是人类文明的珍贵典藏,动辄跨越数百年甚至上千年。以韩国“朝鲜王朝实录”和“承政院日记”为例,这两套档案连续记录了500多年的历史,不仅包括政治事件,还包含自然灾害、天文观测等宝贵信息,被列入联合国教科文组织世界记忆名录。然而,这些用木纤维或植物材料制成的古卷,比现代纸张脆弱得多,略微受潮、光照或温度变化就会导致墨迹褪色、纸张破损。加上当时全靠手工抄录,书写潦草或笔误也十分常见。最终结果就是:大量字符变成无法辨认的“黑块”或空缺。
论文作者统计发现,仅在“承政院日记”中,就有约4.19万个字符被损坏或无法识别,涉及1.11万份文档。这就相当于一部覆盖五个世纪的宏大编年史,活生生被挖掉了成千上万个“关键字母”。无论是OCR(光学字符识别)系统还是人工专家,面对这些空白都束手无策。
修复这些损坏字符的难点在哪里?首先,被遮挡的字符往往不是孤立存在,它们很多是 命名实体(Named Entity,NE)——也就是人名、地名、官职名、书名等特有名词。论文使用Gemini-2.5-Pro对损坏字符进行分类,结果如图3所示:约44.8%的损坏字符属于命名实体,其中人物(PER)占比最高,达到约22%,其次为地点(LOC)约12%、其他实体(ETC)约6%、日期(DAT)约3%和历史出版物(POH)约2%。这意味着,将近一半的损坏字符无法通过简单的上下文推测出来,必须依赖外部知识。例如,一个句子中如果出现“某年某月,[M]被任命为吏曹判书”,即使精通古汉语,也无法确定[M]具体是谁——除非对朝鲜王朝的官员任免历史有深入了解。因此,修复这类字符必须依赖 外部知识,而不仅仅是上下文线索。
图3:损坏字符分布饼图,包括命名实体类别的比例:PER、LOC、DAT、POH、ETC
图3:损坏字符分布饼图,包括命名实体类别的比例:PER、LOC、DAT、POH、ETC
此外,损坏模式本身也极其复杂。真实文档中的损坏往往不是均匀分布的,而是成片出现:可能一整行都被水渍浸染,或者纸张边缘大面积缺失。这与训练时假设的随机掩码模式完全不同。传统方法在训练时通常假设每个字符有15%的概率被损坏,但实际文档中损坏字符的跨度、密度都不同,导致实际部署时性能下降。更棘手的是,同一份文档中可能同时存在多种损坏类型:墨迹褪色导致字符模糊、虫蛀造成孔洞、纸张褶皱导致字符变形。这些复杂的损坏模式使得简单的字符级修复方法难以奏效。

传统方法局限于上下文,外部知识是关键

过去解决文档修复的主流方法是 掩码语言建模(Masked Language Modeling,MLM),典型代表是基于BERT的模型。它的思路很简单:把损坏字符当作掩码,让模型根据左右上下文来预测原始内容。Kang等人(2021年)和Assael等人(2019年)就是采用这条路线,在部分语料上取得了不错的效果,甚至在通用字符恢复上超过了一些大型语言模型。
但这类方法存在一个致命缺陷:它只能利用本文件内部的信息。当遇到某人名、地名这种需要历史背景才能推断的内容时,模型就变成了“瞎子”。论文中的表1展示了所用数据集的规模——朝鲜王朝实录(AJD)有37万份文档、7190万字符,承政院日记(JRS)有175万份文档、2.926亿字符。如此庞大的语料本可以成为知识宝库,但传统MLM方法却根本没有利用起来。这些语料中包含了大量重复出现的人名、地名和官职名,例如“李珥”、“栗谷”、“吏曹判书”等专有名词在数百年间反复出现。如果能将这些跨文档的知识关联起来,修复准确率将大幅提升。
表1:AJD和JRS原始数据语料统计。NEs代表命名实体,[D]代表损坏标记。
表1:AJD和JRS原始数据语料统计
另外,传统方法还有一个痛点:训练时用的掩码概率是固定的,但真实文档中损坏字符的分布与训练分布严重不匹配。比如模型训练时假设每个字符有15%的概率被损坏,但实际文档中损坏字符的跨度、密度都不同,导致实际部署时性能下降。更具体地说,真实损坏往往呈现“聚集”特性——如果一段文字中有一个字符损坏,相邻字符损坏的概率也会显著升高。这种损坏模式在训练数据中很少出现,导致模型在面对连续损坏时几乎完全失效。
论文指出,要突破这个瓶颈,必须引入 外部知识。这些外部知识可以有两种来源:一是大语言模型(LLM)在预训练中已经学到的海量历史资料,二是通过检索增强生成(Retrieval-Augmented Generation,RAG)技术,实时从外部知识库中检索与受损文档内容相关的历史记录来做参考。RAG的核心思想很简单:在生成回答之前,先从一个大规模文档集合中检索出最相关的文本片段,作为额外上下文提供给语言模型,帮助模型做出更准确的预测。这种“先检索后生成”的范式特别适合历史文档修复,因为历史事件往往在多个文档中重复记载,通过检索可以找到同一事件的不同版本描述,从而交叉验证损坏字符的正确内容。
图4:提出的修复损坏文档的框架概览。LLM的输入包括任务描述、格式示例、与受损文本相关的文档以及时间信息等元数据。基于此结构,ARI专为历史文档恢复任务进行微调。
图4:提出的修复损坏文档的框架概览。

ARI模型:RAG+LLM的修复新范式

针对上述问题,论文提出了ARI(Archive Restoration Intelligence)模型。ARI不是从头训练,而是基于开源LLM(Qwen3 8B/32B)进行微调。整个框架如图4所示,主要创新点有三个:精心设计的提示策略、检索增强的上下文注入、以及针对命名实体的训练优化。这三个模块相互配合,形成了一个完整的修复流水线。
第一步:基础提示设计
由于大多数预训练语言模型是自回归生成的(即逐个字符生成输出),需要明确告诉模型每个损坏字符的位置和需要恢复的内容。论文设计了如图5所示的基础提示:输入格式为“原文本+[位置标记:ID]”,输出为“位置ID:恢复的字符”。这种方式确保了模型能够精准地对位输出。具体来说,输入文本中的每个损坏字符都被替换为一个特殊的标记符,例如“[D:1]”、“[D:2]”等,其中数字表示该损坏字符在文档中的唯一标识。模型需要为每个标记符预测对应的原始字符。这种设计避免了模型在生成时产生位置混淆,特别适合处理多个损坏字符同时存在的情况。
图5:基于LLM的修复基础提示示例。
图5:基于LLM的修复基础提示示例。
第二步:注入元数据与外部知识
首先,论文尝试在提示中加入简单的时间元数据——国王、年份、月份和日期。表3显示,仅加这一项就让Qwen3 32B在随机字符恢复上从13.37%提升到14.83%,虽然幅度不大,但验证了时间信息对历史文档恢复是有帮助的。为什么时间信息有帮助?因为历史文档中的事件往往具有强烈的时间关联性:特定人物只在特定时期活跃,特定官职只在特定朝代存在。例如,“吏曹判书”这个官职在朝鲜王朝中期频繁出现,但在早期则很少见。提供时间信息可以帮助模型缩小候选字符的范围。
表3:基于是否包含元数据的恢复性能结果。
表3:基于元数据包含的恢复性能结果。
更关键的是 RAG(检索增强生成) 的引入。论文从训练语料(2.02M份文档)中检索最相关的20份文档,与损坏文本一起作为上下文输入。论文尝试了三种检索方法:随机选取、基于向量嵌入的稠密检索(使用Gemini Embedding)和基于词频的稀疏检索(BM25,即Okapi BM25算法,一种经典的基于词频的文档检索算法)。结果如表4所示:即使是随机选取的文档(Static shots)也有提升,而BM25检索(BM25)的效果最好——在命名实体恢复上从5.63%跳升到19.88%,在随机字符恢复上从14.83%跃升到59.91%!这说明对于汉字(Hanja)这类表意文字,字符级别的匹配非常有效。BM25之所以表现优异,是因为它基于词频和逆文档频率进行匹配,能够精确找到包含相同字符序列的历史文档。例如,如果要恢复的损坏字符位于“李珥”这个人名中,BM25可以检索到其他文档中所有包含“李珥”的句子,为模型提供丰富的上下文参考。
表4:添加小样本、RAG和去重对恢复性能的影响。
表4:添加小样本、RAG和去重的影响。
但检索到的文档有时包含重复或高度相似的条目,这反而限制了知识的多样性。例如,如果检索到的20份文档中有15份都来自同一事件的不同抄本,那么模型获得的信息实际上非常有限。论文通过基于字符串相似度的去重来进一步优化,实验发现阈值设为80%最佳(图6),舍去相似度超过80%的文档,最终在命名实体上达到27.85%,随机字符上达到61.45%。这说明多样性比数量更重要。去重操作的具体实现是:对检索到的文档两两计算编辑距离相似度,如果相似度超过阈值则保留其中一篇。这样做的目的是确保提供给模型的上下文覆盖尽可能多的不同事件和人物,而不是反复呈现相同的信息。
图6:不同去重阈值下的恢复性能。纵轴为DNE与DRand恢复性能的调和平均。
图6:不同去重阈值下的恢复性能。
第三步:针对命名实体优化微调
微调阶段,论文采用 动态掩码策略(类似RoBERTa,Liu et al., 2019),即每个训练轮次都使用不同的掩码位置,防止模型过拟合。更重要的是,论文将25%的训练数据故意优先对命名实体位置进行掩码,引导模型重点学习恢复这些关键信息。具体来说,在构造训练样本时,对于包含命名实体的句子,论文以更高的概率(约50%)选择命名实体位置作为掩码目标,而普通字符的掩码概率则降低到约10%。这种非均匀的掩码策略确保了模型在微调过程中接触到更多的命名实体恢复任务。最终微调得到的模型称为ARI(Archive Restoration Intelligence),分为8B和32B两个版本。微调过程使用了约1500个H200 GPU小时,训练数据来自AJD和JRS语料库中随机抽取的约50万份文档。

实验结果全面领先,专家评估验证实用价值

论文构建了两类测试集:DNE(掩码位置来自命名实体的数据集)和DRand(掩码位置随机的数据集),以及一份真实损坏文档的保留集DRD用于专家评估。DNE测试集专门用于评估模型在命名实体恢复上的能力,包含约5000个测试样本,每个样本至少包含一个命名实体位置的损坏字符。DRand测试集则包含约10000个样本,损坏位置完全随机分布,用于评估模型的通用恢复能力。
图1展示了主实验结果。散点图清楚地显示:ARI-32B(红色点)整体位于最右上角,在命名实体恢复和随机字符恢复上都大幅领先其他模型。尤其值得注意的是,图中大部分模型的命名实体恢复准确率(x轴)都低于20%,而ARI-32B超过了40%。这意味着针对具体人名地名的恢复难度非常高,而ARI恰恰在这里取得了最大突破。相比之下,BERT-Res(蓝色点)在随机字符恢复上表现不错(约50%),但命名实体恢复仅有约10%,印证了“基于上下文的MLM无法处理外部知识需求”的观点。Gemini-2.5-Pro的表现介于两者之间,命名实体恢复约25%,随机字符恢复约45%,说明通用大模型虽然具备一定的历史知识,但缺乏针对特定领域的细粒度检索能力。
图1:提出模型与基线的性能对比。x轴和y轴分别代表命名实体恢复准确率和随机字符恢复准确率。
图1:提出模型与基线的性能对比。
细粒度命名实体分类对比
图7进一步按实体类型(人物PER、地点LOC、历史出版物POH)分解了恢复性能。ARI-32B在人名和地名上大幅领先BERT-Res和Gemini-2.5-Pro。具体来说,在人物恢复上,ARI-32B达到约45%的Top-1准确率,而BERT-Res仅约12%,Gemini-2.5-Pro约28%。在地名恢复上,ARI-32B达到约38%,而BERT-Res约8%,Gemini-2.5-Pro约20%。不过在“历史出版物”类别上,Gemini-2.5-Pro竟然反超了,达到约35%,而ARI-32B约30%。论文分析认为,出版物名称中包含大量中国儒家经典(这些经典在东亚广泛流传),Gemini通过多语言预训练掌握了更多跨文化知识,而ARI只针对朝鲜王朝领域优化,在这个小众类别上吃亏。
图7:DNE上不同命名实体类别之间的Top-1准确率比较。
图7:不同命名实体类别的Top-1准确率比较。
专家评估:真实场景下的协作工具
论文从真实受损文档中随机抽取100份,请三位汉文学和韩国史专家进行盲评。专家根据语义、语法和事实合理性,选择各模型输出中的有效候选。表5汇总了结果:ARI-32B在Top-1准确率(38.3% vs 20.7%)、Top-10准确率(58.3% vs 40.3%)、归一化折损累计增益nDCG@10(47.7% vs 29.6%)以及胜率(46.0% vs 24.0%)四项指标上全面领先BERT-Res,同时也超越了Gemini-2.5-Pro(27.3% Top-1,30.0%胜率)。这说明ARI不仅仅是数值上的胜利,它输出的候选答案在准确性和多样性上都更符合历史事实。专家评估还发现,ARI-32B在Top-10候选列表中经常包含正确的答案,即使Top-1预测错误,专家也可以从候选列表中快速找到正确答案,这在实际应用中非常有价值。
表5:人类专家评估的ARI-32B、BERT-Res和Gemini-2.5-Pro的恢复性能。
表5:人类专家评估结果。
定性案例与时间迁移分析
表6展示了三个典型案例。第一个例子中,只有ARI-32B准确恢复了人名“李厚源”,而BERT-Res和Gemini-2.5-Pro都猜错了;第二个例子中,ARI-32B恢复的书名正确,仅在普通文本上产生了一个同义替换“後孫”代替“子孫”,语义等价;第三个例子关于“赤潮”现象(红光水),ARI-32B是唯一正确恢复地名“光州”的模型。这些定性结果再次验证了外部知识在命名实体恢复中的核心价值。值得注意的是,在第三个案例中,BERT-Res和Gemini-2.5-Pro都错误地将“光州”恢复为“全州”,这两个地名在汉字书写上相似,但地理位置和历史背景完全不同。ARI-32B通过检索到的相关文档,正确判断出该事件发生在光州地区。
表6:本文模型与基线模型的恢复示例对比。
表6:恢复示例对比。
论文还测试了ARI在时间跨度上的泛化能力(图8)。使用高丽史(早于训练数据集的朝代)构建测试集,发现ARI-32B在中等时间偏移下仍然稳健,但随着时间差距增大性能下降较快。具体来说,当测试文档与训练数据的时间差距在50年以内时,ARI-32B的命名实体恢复准确率保持在约35%;当时间差距扩大到100年以上时,准确率下降到约20%。这提示了领域迁移时的局限性,也指明了未来改进方向:需要更广泛的参考语料来覆盖不同历史时期的语言变化。此外,论文还发现,时间迁移对普通字符恢复的影响较小(仅下降约10%),但对命名实体恢复的影响较大(下降约50%),说明命名实体对时间上下文更加敏感。
图8:未见时间域上的恢复性能,突出时间偏移的影响。
图8:时间偏移对恢复性能的影响。

总结与展望

这篇论文的价值在于用一个简洁的思路——LLM+RAG——解决了历史文档修复中长期被忽视的“外部知识依赖”问题。实验证明,仅依靠文档内部的上下文是不够的,必须结合检索到的相关史料才能准确恢复专有名词。ARI模型在韩国档案上的成功验证了该范式的有效性,论文也开源了模型和代码,为低资源古语言修复提供了可复现的基础。
潜在的应用场景包括:古籍数字化保护、历史档案智能分析、考古学中的铭文补全等。但需要注意的是,当前方法依赖高质量的外部语料库,且对时间跨度较大的文档泛化能力有限。未来可以探索跨语种、跨领域的知识迁移,以及引入多模态(如扫描图像)信息来进一步提升鲁棒性。此外,论文还指出,当前方法在处理连续损坏(即多个相邻字符同时损坏)时仍然存在困难,未来可以考虑引入基于图像特征的修复方法作为补充。
【可选】横向对比:与PaperDaily已收录论文范围内的辅助判断一致,本方法在当前基准上表现出优势,但未与其他RAG变体、多代理系统进行系统比较。优势是否绝对还需更多独立验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?本论文解决历史文档中损坏字符的自动修复问题,尤其是需要外部历史知识的专有名词(如人名、地名)的恢复。传统方法局限于上下文,而ARI通过LLM+RAG机制引入了外部知识。

ARI模型为什么比纯LLM效果好?纯LLM(如Gemini-2.5-Pro)虽然学习了大量历史知识,但缺乏针对特定领域的细粒度检索。ARI不仅利用了LLM的基础知识,还通过RAG实时检索相关文档,同时通过去重保证检索文档的多样性。此外,ARI专门针对命名实体进行了掩码优先微调,进一步提升了针对性。

BM25为什么比向量检索效果更好?汉字是一种表意文字,每个字符往往代表一个独立含义。对于汉文历史文档,字符级别的精确匹配能够直接关联到相关史料,而向量嵌入可能引入语义偏差。BM25基于词频和逆文档频率,恰好能最大化这种字符匹配的优势。论文的消融实验也证实了这一点。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰
将RAG+LLM应用于历史文档修复并非全新概念,但针对韩文汉文档案的命名实体恢复进行了系统优化(去重策略、命名实体优先掩码),具有一定的工程创新。不过整体方法属于经典组合,未提出突破性算法。

实验合理度:★★★★✰
实验设计较为完整:对比了SOTA方法(BERT-Res、Gemini、GPT等),设置了DNE/DRand两类测试,有人类专家评估,且有消融实验。但缺少与更多RAG变体(如HyDE、CRAG)的对比,且命名实体分类借助Gemini-2.5-Pro的标注存在一定误差。

学术研究价值:★★★★✰
证明了“外部知识对历史文档修复至关重要”这一假设,并提供了量化证据。对于低资源古语言处理领域,该方法提供了可复现的基线,研究价值较高。

稳定性:★★★✰✰
在领域内(相同历史时期)表现稳定,专家评估也认可。但在时间跨度较大的场景(如高丽史)性能明显下降,说明对领域偏移敏感。真实场景中文档损坏模式复杂,能否稳定处理所有类型尚待验证。

适应性以及泛化能力:★★★✰✰
模型仅基于韩文汉文(Hanja)语料训练,要迁移到中文古籍、欧洲古文献等需重新训练或域适应。论文提出框架具有通用性,但实际泛化能力依赖于外部知识库的质量和覆盖度。

硬件需求及成本:★★✰✰✰
ARI-32B微调花费约1500个H200 GPU小时,推理时需同时运行LLM和检索服务(BM25+去重),硬件门槛较高。不过论文也提供了8B版本作为轻量替代,但性能会折扣。

复现难度:★★★★★
论文已将模型和代码开源,且基于公开权重(Qwen3)和标准工具(BM25S、Gemini Embedding),数据集也已公开,复现流程清晰。

产品化成熟度:★★★✰✰
专家评估表明可作为辅助工具提高效率,但Top-1准确率仅38.3%,完全自动化修复仍不可靠。与OCR系统、在线档案平台集成需要额外开发,目前更适合作为半自动辅助工具。

可能的问题:论文使用的命名实体标签由Gemini-2.5-Pro自动生成,可能引入偏差;缺少与更多RAG变体(如LlamaIndex、LangChain)的对比;时间迁移实验仅测试了单向(从晚到早),未测试反方向;未评估模型吞吐量和延迟对实际工作流的影响。


主要参考文献

[1] Gabeen Kim, Kyeongpil Kang. Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models. arXiv:2607.20889, 2026.
[2] Kang et al. (2021). MLM-based restoration of damaged historical documents.
[3] Assael et al. (2019). Pythia: prediction of missing characters in Greek epigraphy.
[4] Lewis et al. (2020). Retrieval-Augmented Generation for knowledge-intensive NLP tasks.
[5] Liu et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach.
[6] Yang et al. (2025). Qwen3 Technical Report.
[7] 代码与模型:https://github.com/...

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
历史文档修复新纪元,ARI模型让你也能当“考古专家”!想和龙哥一起探讨更多RAG+LLM的神奇应用?扫码入群,和5000+AI同好一起搞事情!加微信:kangjinlonghelper,备注格式:研究方向+地点+学校/公司+昵称。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。