论文构建了两类测试集:DNE(掩码位置来自命名实体的数据集)和DRand(掩码位置随机的数据集),以及一份真实损坏文档的保留集DRD用于专家评估。DNE测试集专门用于评估模型在命名实体恢复上的能力,包含约5000个测试样本,每个样本至少包含一个命名实体位置的损坏字符。DRand测试集则包含约10000个样本,损坏位置完全随机分布,用于评估模型的通用恢复能力。
图1展示了主实验结果。散点图清楚地显示:ARI-32B(红色点)整体位于最右上角,在命名实体恢复和随机字符恢复上都大幅领先其他模型。尤其值得注意的是,图中大部分模型的命名实体恢复准确率(x轴)都低于20%,而ARI-32B超过了40%。这意味着针对具体人名地名的恢复难度非常高,而ARI恰恰在这里取得了最大突破。相比之下,BERT-Res(蓝色点)在随机字符恢复上表现不错(约50%),但命名实体恢复仅有约10%,印证了“基于上下文的MLM无法处理外部知识需求”的观点。Gemini-2.5-Pro的表现介于两者之间,命名实体恢复约25%,随机字符恢复约45%,说明通用大模型虽然具备一定的历史知识,但缺乏针对特定领域的细粒度检索能力。图1:提出模型与基线的性能对比。细粒度命名实体分类对比图7进一步按实体类型(人物PER、地点LOC、历史出版物POH)分解了恢复性能。ARI-32B在人名和地名上大幅领先BERT-Res和Gemini-2.5-Pro。具体来说,在人物恢复上,ARI-32B达到约45%的Top-1准确率,而BERT-Res仅约12%,Gemini-2.5-Pro约28%。在地名恢复上,ARI-32B达到约38%,而BERT-Res约8%,Gemini-2.5-Pro约20%。不过在“历史出版物”类别上,Gemini-2.5-Pro竟然反超了,达到约35%,而ARI-32B约30%。论文分析认为,出版物名称中包含大量中国儒家经典(这些经典在东亚广泛流传),Gemini通过多语言预训练掌握了更多跨文化知识,而ARI只针对朝鲜王朝领域优化,在这个小众类别上吃亏。图7:不同命名实体类别的Top-1准确率比较。专家评估:真实场景下的协作工具论文从真实受损文档中随机抽取100份,请三位汉文学和韩国史专家进行盲评。专家根据语义、语法和事实合理性,选择各模型输出中的有效候选。表5汇总了结果:ARI-32B在Top-1准确率(38.3% vs 20.7%)、Top-10准确率(58.3% vs 40.3%)、归一化折损累计增益nDCG@10(47.7% vs 29.6%)以及胜率(46.0% vs 24.0%)四项指标上全面领先BERT-Res,同时也超越了Gemini-2.5-Pro(27.3% Top-1,30.0%胜率)。这说明ARI不仅仅是数值上的胜利,它输出的候选答案在准确性和多样性上都更符合历史事实。专家评估还发现,ARI-32B在Top-10候选列表中经常包含正确的答案,即使Top-1预测错误,专家也可以从候选列表中快速找到正确答案,这在实际应用中非常有价值。表5:人类专家评估结果。定性案例与时间迁移分析表6展示了三个典型案例。第一个例子中,只有ARI-32B准确恢复了人名“李厚源”,而BERT-Res和Gemini-2.5-Pro都猜错了;第二个例子中,ARI-32B恢复的书名正确,仅在普通文本上产生了一个同义替换“後孫”代替“子孫”,语义等价;第三个例子关于“赤潮”现象(红光水),ARI-32B是唯一正确恢复地名“光州”的模型。这些定性结果再次验证了外部知识在命名实体恢复中的核心价值。值得注意的是,在第三个案例中,BERT-Res和Gemini-2.5-Pro都错误地将“光州”恢复为“全州”,这两个地名在汉字书写上相似,但地理位置和历史背景完全不同。ARI-32B通过检索到的相关文档,正确判断出该事件发生在光州地区。表6:恢复示例对比。
论文还测试了ARI在时间跨度上的泛化能力(图8)。使用高丽史(早于训练数据集的朝代)构建测试集,发现ARI-32B在中等时间偏移下仍然稳健,但随着时间差距增大性能下降较快。具体来说,当测试文档与训练数据的时间差距在50年以内时,ARI-32B的命名实体恢复准确率保持在约35%;当时间差距扩大到100年以上时,准确率下降到约20%。这提示了领域迁移时的局限性,也指明了未来改进方向:需要更广泛的参考语料来覆盖不同历史时期的语言变化。此外,论文还发现,时间迁移对普通字符恢复的影响较小(仅下降约10%),但对命名实体恢复的影响较大(下降约50%),说明命名实体对时间上下文更加敏感。图8:时间偏移对恢复性能的影响。
[1] Gabeen Kim, Kyeongpil Kang. Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models. arXiv:2607.20889, 2026.[2] Kang et al. (2021). MLM-based restoration of damaged historical documents.[3] Assael et al. (2019). Pythia: prediction of missing characters in Greek epigraphy.[4] Lewis et al. (2020). Retrieval-Augmented Generation for knowledge-intensive NLP tasks.[5] Liu et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach.[6] Yang et al. (2025). Qwen3 Technical Report.[7] 代码与模型:https://github.com/...