← 返回 PaperDaily
视觉与图像
残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 5
查看原文
原论文信息如下:
古希腊文本修复的新突破:Stoicheia如何实现字符级扩散模型
想象一下,你手里有一块残破的石碑,上面的古希腊文字因为年代久远出现了几处缺损。你大概能猜出部分内容,但怎么才能让AI也像一位优秀的古典学家那样,根据上下文、语法规则和文体习惯,把缺失的字母甚至整段文字准确补全?更进一步,如果要求这个AI必须在“从未见过这段文字”的前提下完成修复,难度瞬间又上了一个台阶。传统的大语言模型会直接翻车——因为它们很可能已经把这段残文的完整版背了下来。
这篇论文给出的答案是Stoicheia ——一个405M参数的字符级掩码扩散编码器。它不玩子词,不提token,直接从字母级别工作,而且把输入分解成五个相互对齐、可独立掩码的“平面”:字母、词语与句子边界、变音符号(重音、气符、iota下标、分音符)、大小写、标点。一个模型骨架就能同时处理残缺补全、重新分词、加标音和加标点,还不用为每个任务单独换一套分词器。
传统NLP模型依赖子词分词,但在古希腊语修复场景里,这恰恰是最大的麻烦。一处残缺的长度是按字母算的,一个音节的格律轻重是按音素决定的——子词边界根本对不上。Stoicheia把“字符级分辨率”焊死在输入端,从根本上绕开了这个问题。训练语料是开放的、版本可控的约3.61亿词规模语料库,并发布了11个检查点:10个是轮转去污染的(保证任意一段文学作品,至少有一个模型从未见过它),另外1个完全没有接触过文献类文本,专门用于碑铭和纸莎草的修复任务。
这套设计的目标不只是“做得更好”,更是要保证“做得可验证”。在Ithaca自己的测试集上,用完全相同的冻结样本和严格评分,Stoicheia把字符错误率(CER,即预测结果与真实文本之间的编辑距离占真实长度的比例)从Ithaca的24.6和Aeneas(2025)的23.5压低到15.5,Top-1准确率从63.0和64.0拉高到74.5。这就不只是微调了几个点的问题,而是实打实地跨了一个台阶。
刚才提到“五个平面”,这可能是Stoicheia最有学理味道的设计。它的输入不是把文本压成一串字符向量,而是拆成五个对齐的层次:
字母平面(base letter identity) :24个符号的最小字母表,融合了中间形、新月形和词尾sigma。
边界平面(word/sentence boundary) :标注词边界和句子边界。
变音符号平面(diacritics) :重音、气符、iota下标、分音符。
大小写平面(capitalization) :大写/小写信息。
标点类别平面(punctuation category) :标点的类型。
这就像Photoshop里把图像拆成不同图层来编辑。对古籍研究来说,这种分层是刚需:古代铭文本身不分词、没有重音,现代整理本里那些空格和符号都是后人加的。过去模型把“带重音、已分词”的文本当作不可分割的输入,等于把编辑部里的一整套传统判断硬编码进了权重里。现在五个平面可以独立掩码,你在修复残损铭文时,可以让“字母平面”部分损坏、“边界平面”完全未知、“变音符号平面”直接忽略——这正好对应了真实残卷的状态。
注意力机制也是“分层的”:每四个block里有三个只关注256个字符范围内的局部上下文,剩下一个做全局注意力。这个设计平衡了效率和长距离依赖——毕竟修复一处缺损,遥远段落里的同源表达同样是线索。具体来说,模型采用类似Longformer或BigBird的稀疏注意力模式,但这里的“局部窗口”是固定为256个字符,而“全局注意力”则每隔4层出现一次,确保信息能够在整个序列中流通。这种混合注意力机制使得模型在拥有足够上下文感知能力的同时,避免了全量注意力带来的二次方计算开销,让训练和推理在长文本上变得可行。
Stoicheia本质是一个掩码扩散模型。它在训练时把输入文本以随机比例“污染”掉——即把某些位置打上掩码——然后要求模型预测被遮挡位置的真实内容。这看起来和BERT没什么两样,但掩码扩散在生成能力上要硬核得多,它能做变长填充(比如,一段长10个字母的缺损,模型需要生成10个字符而不是只输出“这个位置缺了几个词”的embedding)。
关键诀窍在“弹性掩码”(elastic masking):设真实缺损长度是L,训练时不是放L个掩码符号,而是放M个(M≥L)。模型需要预测L个真实字符,外加M-L个特殊空符号∅。这样一来,模型在未知长度的情况下也能推测“这里到底缺了几个字”——是1个还是5个。这对修复现实世界的碑文尤为重要:石头断裂处可不会贴心地告诉你缺了几个字母。论文在实验设计里还加入了几种精心设计的损坏模式:跨词边界的连续跨度(对应石材断裂)、整词覆盖、锚定词头/词中/词尾的部分覆盖、分散的单字符破坏,以及没有掩码标记的“静默替换”(比如石头风化导致某些字母看起来像别的字母)。静默替换相当于让模型学会纠错而不只是填空。
在推理阶段,模型采用迭代解码策略。与自回归模型从左到右逐个生成字符不同,Stoicheia从一个全掩码的序列开始,在每一轮迭代中并行预测所有掩码位置,然后根据置信度选择一部分高置信度的预测作为“已知”信息,更新掩码状态,进入下一轮迭代。这个过程类似于扩散模型的去噪过程,通常只需要4-8轮迭代就能收敛到高质量的结果,远快于自回归模型的逐字生成,同时还能利用双向上下文信息,避免错误传播。
论文做了三组实验,每一组都带了一个“随机初始化对照组”——也就是同样的架构和训练流程,只是把预训练权重换成随机数。这样就能把“预训练带来的提升”从模型本身的能力中剥离出来。
第一项:残损碑铭和纸莎草的修复。 按照Ithaca的惯例,按PHI或TM编号的最后一位数字做十折轮转,每折模型看90%的数据,测试剩下10%。结果在下表(表1)里:v2版本在碑铭上CER 16.10,纸莎草上10.01,Top-1分别达73.33和81.53。而换上随机初始化后,CER直接恶化到23.00和14.16。十折全部方向一致,配对检验p=0.00195(10折的检验下限)。
在Ithaca自己固定的测试集上(表2),拿Ithaca官方模型、Aeneas(2025)官方代码和Stoicheia的digit-3折模型比,同一份冻结的三千个样本、束宽20。Stoicheia v2的CER是15.5,Top-1是74.5。McNemar精确检验p=9.7×10⁻⁵⁵(对Ithaca),这个量级的统计显著性基本就是碾压。
还有一个更刺激的测试:从公开语料中找出几篇“所有系统训练之后才完成编辑”的铭文和纸莎草。比如2026年新刊布的铭文,理论上Ithaca和Llama都没“背过”,Stoicheia当然也没见过。在这两批材料上(表3、表4),Stoicheia的CER比Ithaca低了12个百分点,Top-1高出超过16个点。连8B参数的指令微调Llama 3.1也被甩在后面。
第二项:形态句法标注与依存解析。 这直接比的是硬实力:Stoicheia与Ancient Greek BERT、GreBERTa、PhilBERTa、Logion、XLM-R、mBERT等一众子词编码器在同一套流程下竞争,所有超参固定,只换骨干。Lexical LAS(带标签依存分数)达到83.81,压过调过学习率的PhilBERTa(82.89)约0.92个点,比GreBERTa高1.29,比Logion高2.35,比mBERT高16.85。UAS(不带标签的依存分数)89.13,XPOS(词性标注准确率)93.30,UPOS 96.94。更重要的是,随机初始化对照在200轮后还差了12.9个LAS点——这说明预训练在这个任务上买了超过100倍的账。
第三项:长音标记与格律扫描(macronization and metrical scansion)。 古希腊语的α、ι、υ存在“长短两读”的问题,不标长音就无法判断格律。Stoicheia直接把每个字符看作决策单元,在Norma数据集上的平衡准确率93.31,比随机初始化高出整整6个点;宏音化任务对比之前的Transformer模型(90.55)也提升了约3个点。这个任务最直观地体现了字符级模型的优势:没有任何子词分词器能在单独一个元音字母上精确落刀。
大型语言模型在这方面经常被诟病“只开源模型、不开源数据”,导致训练数据的细节无从考证。Stoicheia不仅开源,还解决了一个更深层次的方法论问题:防止“数据泄漏”。过去用Ithaca去修复铭文,理论上靠谱,但Ithaca的训练数据覆盖了大约80%的铭文语料;研究者面对任何一段旧铭文,都无从证明模型提出的修复方案是真的“推导”出来的,还是背了标准答案。Stoicheia的做法是:发布10个轮转模型加1个无文献暴露模型,让研究者可以为任意一段文本选一个“没读过”的模型来处理——彻底切断记忆污染。
语料构建也相当扎实:Internet Archive的232M词和PleiAs希腊语PD的89M词来自重新OCR(用专门精调的视觉语言模型,产出量约为原文本层的四倍),配合一套基于Hunspell词典的规范化与纠错流程。还有机器翻译的“青铜级”合成语料作为蒸馏信号,以及按质量分级的“黄金/白银”分层退火训练。整个流程是开源、版本钉死的,这在历史上还是头一回。
具体来说,去污染流程包含以下几个关键步骤:首先,所有训练语料被收集并统一格式化为标准化的文本文件,每个文件都带有唯一的文档ID和版本号。其次,采用13步文档聚类和去重管道,利用MinHash和SimHash算法对文档进行近似去重,同时结合基于编辑距离的精确匹配,确保同一作品的不同版本、摘录、翻译片段等都被识别并归入同一簇。然后,每个文档簇被随机分配到一个fold(共10个fold),对应的模型在训练时精确排除该fold的所有文档。最后,还额外训练了一个“无文献暴露”模型,该模型在训练时完全排除了所有文学类文本,只使用碑铭、纸莎草等非文学语料,专门用于处理那些可能被文学语料“污染”的修复任务。
不过,Stoicheia也远非万能。原文里已经坦率地指出了几个边界:一是预训练数据依然混入了许可受限的语料(如Database of Byzantine Book Epigrams的CC-BY-NC-SA条款),在资源共享上还有一道坎;二是文档级去污染虽然能保证“整篇没见过”,但无法阻止近义词、改述式的“软记忆”;三是Ithaca的固定测试集只有一折,Stoicheia与Aeneas的对比只能在这一折上进行,跨折稳定性依然存疑;四是训练成本相当可观——128块NVIDIA GH200跑约42小时一个checkpoint,普通实验室复现的代价不小。
此外,论文还讨论了模型在方言碑铭上的潜在问题。古希腊语存在多种方言(如阿提卡方言、爱奥尼亚方言、多利亚方言等),不同方言在词汇、语法和拼写习惯上存在显著差异。虽然Stoicheia的预训练语料覆盖了主要方言,但模型在特定方言的碑铭上的表现可能不如通用文本。论文建议,对于方言特征明显的碑铭,研究者应优先选择无文献暴露模型,或者结合方言词典进行后处理校正。
龙迷三问
这篇论文到底在解决什么问题? 乌普萨拉大学推出Stoicheia:405M参数字符级掩码扩散模型,输入分解为五个可独立掩码平面,支持文本修复、句法解析与格律扫描。
这篇工作最值得看的点是什么? 在Ithaca测试分割上,CER从24.6(Ithaca)和23.5(Aeneas)降至15.5,Top-1准确率从63.0和64.0提升至74.5;在解析任务上LAS达83.81,超过所有基线;在macronization上平衡准确率达93.31,超过所有对比系统
这篇工作的边界或风险在哪里? 优点:开放数据、字符级分辨率、可分离编辑层、保证模型对特定文本的未知性;缺点:大部分预训练语料为机器修复、去污染保证仅针对字符串而非知识、人工缺口不等于真实损坏、模型总是回答且不提供置信度、平面和目标未消融
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一个405M参数、字符级掩码扩散Transformer编码器,将输入分解为五个可独立掩码的对齐平面(字母、词/句边界、变音符号、大小写、标点),通过弹性掩码和扩散训练实现文本修复、解析和格律扫描的统一处理。
实验合理度: ★★★★☆
字符错误率(CER)、Top-1准确率、Top-20准确率、LAS、UAS、XPOS、UPOS、词元化准确率、平衡准确率、宏F1、音节边界F1
学术研究价值: ★★★★☆
提出一个405M参数、字符级掩码扩散Transformer编码器,将输入分解为五个可独立掩码的对齐平面(字母、词/句边界、变音符号、大小写、标点),通过弹性掩码和扩散训练实现文本修复、解析和格律扫描的。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
每个模型约42小时在128块NVIDIA GH200 GPU上训练,约5.4K GPU小时/模型,总计约59K GPU小时
复现难度: ★★★☆☆
https://github.com/ericu9500/stoicheia
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 大部分预训练语料为机器修复、去污染保证仅针对字符串而非知识、人工缺口不等于真实损坏、模型总是回答且不提供置信度、平面和目标未消融
主要参考文献
[1] Cullhed, E., & Thörn Cleland, A. (2026). Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion. arXiv:2608.07249v1.
[2] Assael, Y., Sommerschield, T., & Prag, J. (2019). Restoring ancient text using deep learning: a case study on Greek epigraphy. EMNLP.
[3] Assael, Y., et al. (2022). Restoring and attributing ancient texts using deep neural networks. Nature.
[4] Assael, Y., et al. (2025). Aeneas: A Latin model for epigraphic restoration. Google DeepMind.
[5] Celano, G. A. (2024). Opera Graeca Adnotata. GitHub repository.
[6] Cleland, A. T., & Cullhed, E. (2026). 希腊语长音与格律预测的Transformer方法。
[7] Cowen-Breen, C., et al. (2023). Logion: A pretrained model for Ancient Greek. University of Cambridge.
结合PaperDaily已收录论文可观察到,在AI for Humanities这个赛道上,过去的很多工作要么精度不够,要么数据封闭,要么无法解决记忆污染问题。Stoicheia把这三座山一起掀了,给后续所有同类研究立了一条“新行规”:模型要可复现、数据要可溯源、单一文本要能找到未见过它的模型。这对领域来说,比单纯刷几个点的精度重要得多。
不过也要提醒一句:不同工作之间的实验设置、评测协议和数据集版本差异很大,上面的对比主要基于论文报告的数字,不能完全等同于绝对的“全面领先”。尤其是“近期编辑文档”上的优势,样本量小且文档集中,未来还需要更多新材料来验证泛化能力。总的来说,这是一篇把工程、学术和伦理要求协调得很好的工作——推荐关注。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!