← 返回 PaperDaily 视觉与图像

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角

当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
原论文信息如下:
论文标题:
Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion
发表日期:
2026年8月
发表单位:
乌普萨拉大学、隆德大学
原文链接:
https://arxiv.org/pdf/2608.07249v1.pdf
开源代码链接:
https://github.com/ericu9500/stoicheia
开源数据集链接:
https://huggingface.co/collections/Ericu950/stoicheia-6a6fbf9800c82d93020a7ceb

古希腊文本修复的新突破:Stoicheia如何实现字符级扩散模型

想象一下,你手里有一块残破的石碑,上面的古希腊文字因为年代久远出现了几处缺损。你大概能猜出部分内容,但怎么才能让AI也像一位优秀的古典学家那样,根据上下文、语法规则和文体习惯,把缺失的字母甚至整段文字准确补全?更进一步,如果要求这个AI必须在“从未见过这段文字”的前提下完成修复,难度瞬间又上了一个台阶。传统的大语言模型会直接翻车——因为它们很可能已经把这段残文的完整版背了下来。
这篇论文给出的答案是Stoicheia——一个405M参数的字符级掩码扩散编码器。它不玩子词,不提token,直接从字母级别工作,而且把输入分解成五个相互对齐、可独立掩码的“平面”:字母、词语与句子边界、变音符号(重音、气符、iota下标、分音符)、大小写、标点。一个模型骨架就能同时处理残缺补全、重新分词、加标音和加标点,还不用为每个任务单独换一套分词器。
传统NLP模型依赖子词分词,但在古希腊语修复场景里,这恰恰是最大的麻烦。一处残缺的长度是按字母算的,一个音节的格律轻重是按音素决定的——子词边界根本对不上。Stoicheia把“字符级分辨率”焊死在输入端,从根本上绕开了这个问题。训练语料是开放的、版本可控的约3.61亿词规模语料库,并发布了11个检查点:10个是轮转去污染的(保证任意一段文学作品,至少有一个模型从未见过它),另外1个完全没有接触过文献类文本,专门用于碑铭和纸莎草的修复任务。
这套设计的目标不只是“做得更好”,更是要保证“做得可验证”。在Ithaca自己的测试集上,用完全相同的冻结样本和严格评分,Stoicheia把字符错误率(CER,即预测结果与真实文本之间的编辑距离占真实长度的比例)从Ithaca的24.6和Aeneas(2025)的23.5压低到15.5,Top-1准确率从63.0和64.0拉高到74.5。这就不只是微调了几个点的问题,而是实打实地跨了一个台阶。

五大可独立掩码平面:重新定义编辑分层

刚才提到“五个平面”,这可能是Stoicheia最有学理味道的设计。它的输入不是把文本压成一串字符向量,而是拆成五个对齐的层次:

字母平面(base letter identity):24个符号的最小字母表,融合了中间形、新月形和词尾sigma。

边界平面(word/sentence boundary):标注词边界和句子边界。

变音符号平面(diacritics):重音、气符、iota下标、分音符。

大小写平面(capitalization):大写/小写信息。

标点类别平面(punctuation category):标点的类型。

这就像Photoshop里把图像拆成不同图层来编辑。对古籍研究来说,这种分层是刚需:古代铭文本身不分词、没有重音,现代整理本里那些空格和符号都是后人加的。过去模型把“带重音、已分词”的文本当作不可分割的输入,等于把编辑部里的一整套传统判断硬编码进了权重里。现在五个平面可以独立掩码,你在修复残损铭文时,可以让“字母平面”部分损坏、“边界平面”完全未知、“变音符号平面”直接忽略——这正好对应了真实残卷的状态。
注意力机制也是“分层的”:每四个block里有三个只关注256个字符范围内的局部上下文,剩下一个做全局注意力。这个设计平衡了效率和长距离依赖——毕竟修复一处缺损,遥远段落里的同源表达同样是线索。具体来说,模型采用类似Longformer或BigBird的稀疏注意力模式,但这里的“局部窗口”是固定为256个字符,而“全局注意力”则每隔4层出现一次,确保信息能够在整个序列中流通。这种混合注意力机制使得模型在拥有足够上下文感知能力的同时,避免了全量注意力带来的二次方计算开销,让训练和推理在长文本上变得可行。

弹性掩码机制:教会模型变长填充

Stoicheia本质是一个掩码扩散模型。它在训练时把输入文本以随机比例“污染”掉——即把某些位置打上掩码——然后要求模型预测被遮挡位置的真实内容。这看起来和BERT没什么两样,但掩码扩散在生成能力上要硬核得多,它能做变长填充(比如,一段长10个字母的缺损,模型需要生成10个字符而不是只输出“这个位置缺了几个词”的embedding)。
关键诀窍在“弹性掩码”(elastic masking):设真实缺损长度是L,训练时不是放L个掩码符号,而是放M个(M≥L)。模型需要预测L个真实字符,外加M-L个特殊空符号∅。这样一来,模型在未知长度的情况下也能推测“这里到底缺了几个字”——是1个还是5个。这对修复现实世界的碑文尤为重要:石头断裂处可不会贴心地告诉你缺了几个字母。论文在实验设计里还加入了几种精心设计的损坏模式:跨词边界的连续跨度(对应石材断裂)、整词覆盖、锚定词头/词中/词尾的部分覆盖、分散的单字符破坏,以及没有掩码标记的“静默替换”(比如石头风化导致某些字母看起来像别的字母)。静默替换相当于让模型学会纠错而不只是填空。
在推理阶段,模型采用迭代解码策略。与自回归模型从左到右逐个生成字符不同,Stoicheia从一个全掩码的序列开始,在每一轮迭代中并行预测所有掩码位置,然后根据置信度选择一部分高置信度的预测作为“已知”信息,更新掩码状态,进入下一轮迭代。这个过程类似于扩散模型的去噪过程,通常只需要4-8轮迭代就能收敛到高质量的结果,远快于自回归模型的逐字生成,同时还能利用双向上下文信息,避免错误传播。

三重实验验证:修复、解析与格律扫描全面领先

论文做了三组实验,每一组都带了一个“随机初始化对照组”——也就是同样的架构和训练流程,只是把预训练权重换成随机数。这样就能把“预训练带来的提升”从模型本身的能力中剥离出来。
第一项:残损碑铭和纸莎草的修复。按照Ithaca的惯例,按PHI或TM编号的最后一位数字做十折轮转,每折模型看90%的数据,测试剩下10%。结果在下表(表1)里:v2版本在碑铭上CER 16.10,纸莎草上10.01,Top-1分别达73.33和81.53。而换上随机初始化后,CER直接恶化到23.00和14.16。十折全部方向一致,配对检验p=0.00195(10折的检验下限)。
在Ithaca自己固定的测试集上(表2),拿Ithaca官方模型、Aeneas(2025)官方代码和Stoicheia的digit-3折模型比,同一份冻结的三千个样本、束宽20。Stoicheia v2的CER是15.5,Top-1是74.5。McNemar精确检验p=9.7×10⁻⁵⁵(对Ithaca),这个量级的统计显著性基本就是碾压。
表1:十折轮转结果(百分比,均值±标准差;每折每领域1000个固定样本)
表1:十折轮转结果(百分比,均值±标准差;每折每领域1000个固定样本)。每折按PHI/TM编号的最后一位数字留出测试集与开发集。
表2:在Ithaca测试集上的同条件对比(百分比)
表2:在Ithaca测试集上的同条件对比(百分比):全部系统读取同一份冻结的3000个样本(每个缺口长度L=1–10各300个),束宽统一为20。表中的数字全部在本论文的评测环境中重新计算,与Ithaca和Aeneas论文原表不可直接比较。
还有一个更刺激的测试:从公开语料中找出几篇“所有系统训练之后才完成编辑”的铭文和纸莎草。比如2026年新刊布的铭文,理论上Ithaca和Llama都没“背过”,Stoicheia当然也没见过。在这两批材料上(表3、表4),Stoicheia的CER比Ithaca低了12个百分点,Top-1高出超过16个点。连8B参数的指令微调Llama 3.1也被甩在后面。
表3:近期编辑的碑铭(6篇文献,共4111个缺口)
表3:近期编辑的碑铭(6篇文献,共4111个缺口;%):这些文献的编辑时间晚于所有对比系统的训练数据收集时间,每行读取完全相同的样本(Cullhed, 2026),使用Levenshtein CER并按发布版相同的归一化规则评分。下方三行是本文结果:v2、v1及v1的随机初始化对照。与上面的协议不可直接比较。
表4:近期出版的纸莎草文献(两件乌普萨拉纸莎草,共1620个缺口)
表4:近期出版的纸莎草文献(两件乌普萨拉纸莎草,共1620个缺口;已发布Llama预测覆盖1614个)。Ithaca与Aeneas仅针对碑铭训练,不参加此项。评分方式与表3相同。
第二项:形态句法标注与依存解析。这直接比的是硬实力:Stoicheia与Ancient Greek BERT、GreBERTa、PhilBERTa、Logion、XLM-R、mBERT等一众子词编码器在同一套流程下竞争,所有超参固定,只换骨干。Lexical LAS(带标签依存分数)达到83.81,压过调过学习率的PhilBERTa(82.89)约0.92个点,比GreBERTa高1.29,比Logion高2.35,比mBERT高16.85。UAS(不带标签的依存分数)89.13,XPOS(词性标注准确率)93.30,UPOS 96.94。更重要的是,随机初始化对照在200轮后还差了12.9个LAS点——这说明预训练在这个任务上买了超过100倍的账。
表5:在Celano(2025)的5折划分上进行的标注与解析结果(%)
表5:在Celano(2025)的5折划分上进行的标注与解析结果(%):在AGDT、Gorman和Pedalion树库(126万词)上,使用共享的保留测试划分;整个流程唯一改变的是骨干网络。每行是十次运行(5折×2种子)的结果;LAS为均值±标准差,Lemma为均值(标准差在0.14-0.44之间)。“Tuned”行使用各基线自己调出的最优学习率;UPOS因篇幅省略(本文96.94对96.41)。最后一块是这类数据上此前公布的最好结果,来自两种独立架构,因此流程不匹配。
第三项:长音标记与格律扫描(macronization and metrical scansion)。古希腊语的α、ι、υ存在“长短两读”的问题,不标长音就无法判断格律。Stoicheia直接把每个字符看作决策单元,在Norma数据集上的平衡准确率93.31,比随机初始化高出整整6个点;宏音化任务对比之前的Transformer模型(90.55)也提升了约3个点。这个任务最直观地体现了字符级模型的优势:没有任何子词分词器能在单独一个元音字母上精确落刀。
表6:预训练消融实验(%,Norma测试集,n=2,660个位置)
表6:预训练消融实验(%,Norma测试集,n=2,660个位置),每组六个种子;±为种子间标准差。最后一列:宏音化任务为宏平衡准确率,格律扫描任务为音节边界F1值。
表7:在Norma数据集的1,916个测试位置上的宏音化结果
表7:在Norma数据集的1,916个测试位置上的宏音化结果——与表6使用不同的测试集和指标。外部基线来自Cleland和Cullhed(2026);本论文结果是六种子均值(93.37±1.87;按开发集选出的种子为94.52)。

开放数据与去污染保证:数字语文学的可持续路径

大型语言模型在这方面经常被诟病“只开源模型、不开源数据”,导致训练数据的细节无从考证。Stoicheia不仅开源,还解决了一个更深层次的方法论问题:防止“数据泄漏”。过去用Ithaca去修复铭文,理论上靠谱,但Ithaca的训练数据覆盖了大约80%的铭文语料;研究者面对任何一段旧铭文,都无从证明模型提出的修复方案是真的“推导”出来的,还是背了标准答案。Stoicheia的做法是:发布10个轮转模型加1个无文献暴露模型,让研究者可以为任意一段文本选一个“没读过”的模型来处理——彻底切断记忆污染。
语料构建也相当扎实:Internet Archive的232M词和PleiAs希腊语PD的89M词来自重新OCR(用专门精调的视觉语言模型,产出量约为原文本层的四倍),配合一套基于Hunspell词典的规范化与纠错流程。还有机器翻译的“青铜级”合成语料作为蒸馏信号,以及按质量分级的“黄金/白银”分层退火训练。整个流程是开源、版本钉死的,这在历史上还是头一回。
具体来说,去污染流程包含以下几个关键步骤:首先,所有训练语料被收集并统一格式化为标准化的文本文件,每个文件都带有唯一的文档ID和版本号。其次,采用13步文档聚类和去重管道,利用MinHash和SimHash算法对文档进行近似去重,同时结合基于编辑距离的精确匹配,确保同一作品的不同版本、摘录、翻译片段等都被识别并归入同一簇。然后,每个文档簇被随机分配到一个fold(共10个fold),对应的模型在训练时精确排除该fold的所有文档。最后,还额外训练了一个“无文献暴露”模型,该模型在训练时完全排除了所有文学类文本,只使用碑铭、纸莎草等非文学语料,专门用于处理那些可能被文学语料“污染”的修复任务。

局限与展望:从机器修复到人工验证

不过,Stoicheia也远非万能。原文里已经坦率地指出了几个边界:一是预训练数据依然混入了许可受限的语料(如Database of Byzantine Book Epigrams的CC-BY-NC-SA条款),在资源共享上还有一道坎;二是文档级去污染虽然能保证“整篇没见过”,但无法阻止近义词、改述式的“软记忆”;三是Ithaca的固定测试集只有一折,Stoicheia与Aeneas的对比只能在这一折上进行,跨折稳定性依然存疑;四是训练成本相当可观——128块NVIDIA GH200跑约42小时一个checkpoint,普通实验室复现的代价不小。
龙哥表情包
从实际使用的角度说,Stoicheia并不是用来替代古典学者的。它更像一台高倍显微镜:把残损文本的多种可能补法按概率排序,交给人来做最终裁决。论文也明确提示了,本文在“近期编辑文档”上的性能数字描述的是这六篇铭文和两件纸莎草的材料,不能直接泛化为整个文献语料。
此外,论文还讨论了模型在方言碑铭上的潜在问题。古希腊语存在多种方言(如阿提卡方言、爱奥尼亚方言、多利亚方言等),不同方言在词汇、语法和拼写习惯上存在显著差异。虽然Stoicheia的预训练语料覆盖了主要方言,但模型在特定方言的碑铭上的表现可能不如通用文本。论文建议,对于方言特征明显的碑铭,研究者应优先选择无文献暴露模型,或者结合方言词典进行后处理校正。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?乌普萨拉大学推出Stoicheia:405M参数字符级掩码扩散模型,输入分解为五个可独立掩码平面,支持文本修复、句法解析与格律扫描。
这篇工作最值得看的点是什么?在Ithaca测试分割上,CER从24.6(Ithaca)和23.5(Aeneas)降至15.5,Top-1准确率从63.0和64.0提升至74.5;在解析任务上LAS达83.81,超过所有基线;在macronization上平衡准确率达93.31,超过所有对比系统
这篇工作的边界或风险在哪里?优点:开放数据、字符级分辨率、可分离编辑层、保证模型对特定文本的未知性;缺点:大部分预训练语料为机器修复、去污染保证仅针对字符串而非知识、人工缺口不等于真实损坏、模型总是回答且不提供置信度、平面和目标未消融
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个405M参数、字符级掩码扩散Transformer编码器,将输入分解为五个可独立掩码的对齐平面(字母、词/句边界、变音符号、大小写、标点),通过弹性掩码和扩散训练实现文本修复、解析和格律扫描的统一处理。

实验合理度:★★★★☆

字符错误率(CER)、Top-1准确率、Top-20准确率、LAS、UAS、XPOS、UPOS、词元化准确率、平衡准确率、宏F1、音节边界F1

学术研究价值:★★★★☆

提出一个405M参数、字符级掩码扩散Transformer编码器,将输入分解为五个可独立掩码的对齐平面(字母、词/句边界、变音符号、大小写、标点),通过弹性掩码和扩散训练实现文本修复、解析和格律扫描的。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

每个模型约42小时在128块NVIDIA GH200 GPU上训练,约5.4K GPU小时/模型,总计约59K GPU小时

复现难度:★★★☆☆

https://github.com/ericu9500/stoicheia

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:大部分预训练语料为机器修复、去污染保证仅针对字符串而非知识、人工缺口不等于真实损坏、模型总是回答且不提供置信度、平面和目标未消融

主要参考文献

[1] Cullhed, E., & Thörn Cleland, A. (2026). Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion. arXiv:2608.07249v1.
[2] Assael, Y., Sommerschield, T., & Prag, J. (2019). Restoring ancient text using deep learning: a case study on Greek epigraphy. EMNLP.
[3] Assael, Y., et al. (2022). Restoring and attributing ancient texts using deep neural networks. Nature.
[4] Assael, Y., et al. (2025). Aeneas: A Latin model for epigraphic restoration. Google DeepMind.
[5] Celano, G. A. (2024). Opera Graeca Adnotata. GitHub repository.
[6] Cleland, A. T., & Cullhed, E. (2026). 希腊语长音与格律预测的Transformer方法。
[7] Cowen-Breen, C., et al. (2023). Logion: A pretrained model for Ancient Greek. University of Cambridge.

融会贯通

结合PaperDaily已收录论文可观察到,在AI for Humanities这个赛道上,过去的很多工作要么精度不够,要么数据封闭,要么无法解决记忆污染问题。Stoicheia把这三座山一起掀了,给后续所有同类研究立了一条“新行规”:模型要可复现、数据要可溯源、单一文本要能找到未见过它的模型。这对领域来说,比单纯刷几个点的精度重要得多。
不过也要提醒一句:不同工作之间的实验设置、评测协议和数据集版本差异很大,上面的对比主要基于论文报告的数字,不能完全等同于绝对的“全面领先”。尤其是“近期编辑文档”上的优势,样本量小且文档集中,未来还需要更多新材料来验证泛化能力。总的来说,这是一篇把工程、学术和伦理要求协调得很好的工作——推荐关注。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
📜 古希腊残卷都能修,AI论文还有什么不能读?加入龙哥读论文粉丝群,一起从字符级细节读懂每篇硬核研究!扫码或添加龙哥助手微信号:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称,更快通过邀请进群~ 图像处理、大模型、自动驾驶等多领域专群等你来聊!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。