← 返回 PaperDaily 视觉与图像

1B模型把僧伽罗语OCR打到1.05%:还顺手赢了Google

这篇论文最有意思的地方,不是又做了一个 OCR,而是把“真实世界里的老旧僧伽罗语文档”这件麻烦事正面接住了。数据集、QLoRA 微调、跨年代评估三件事一起上,最后还把 Google Document AI 挤在了后面,挺硬核。

1B模型把僧伽罗语OCR打到1.05%:还顺手赢了Google
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又做了一个 OCR,而是把“真实世界里的老旧僧伽罗语文档”这件麻烦事正面接住了。数据集、QLoRA 微调、跨年代评估三件事一起上,最后还把 Google Document AI 挤在了后面,挺硬核。


原论文信息如下:
论文标题:
Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis
发表日期:
2026年06月
发表单位:
School of Computing, Informatics Institute of Technology, Sri Lanka;Department of Computer Science & Engineering, University of Moratuwa, Sri Lanka
原文链接:
https://arxiv.org/pdf/2606.29378v1.pdf
开源数据集链接:
https://huggingface.co/datasets/sinhala-ocr-lk-acts-1010

僧伽罗语OCR的“破冰者”:首个真实整页级数据集发布

这篇论文最值钱的地方,不是简单把一个 OCR 模型跑通了,而是先把“真实世界里的僧伽罗语整页文档”这件事正式搬上台面。以前很多研究都在合成图上比成绩,纸面上看着挺热闹,真到老旧扫描件、旧字体、脏背景、排版残缺这些现实问题一来,模型就开始装死。作者这次直接拿斯里兰卡政府法案文档开刀,做出了首个公开的页级僧伽罗语 OCR 数据集 sinhala-ocr-lk-acts-1010,这一步比“又训了个模型”更关键,因为没有数据,后面的比较基本都是空中楼阁。
封面图
图1:构建僧伽罗语政府法案 OCR 数据集的文档处理流程。先抓取原始 PDF,再做页面切分、自动转写、人工校正,最后形成可复现的数据集。
这里先把几个基础概念说人话。OCR 是 Optical Character Recognition,中文就是“光学字符识别”,目标是把图片里的字变成可编辑文本。页级 OCR 的意思不是一行一行切着识别,而是直接把整页文档喂给模型,让模型一次性看完整页内容。这样做的好处很直白:少了版面检测、行切分、字符拼接这些中间环节,错误不会像多米诺骨牌一样层层传染。对于僧伽罗语这种字形复杂、连写多、相似字符多的文字,少走一步弯路,往往就少掉一大截麻烦。
数据集的构建也不是随便抓几张图就完事。作者从斯里兰卡政府文档仓库里筛出僧伽罗语法案 PDF,再把长文档切块,交给 Google Document AI 生成初始文本,随后逐页人工修正。这个流程有点像“先请一个不太靠谱的实习生打底,再由资深编辑逐字审稿”,虽然费工,但能把真实扫描件里的连字错误、字符替换、空格混乱和断行问题尽量压下去。最终得到 1,010 个页级图文对,按 707/101/202 划分训练、验证和测试集,并且覆盖 1981–1989、2000–2009、2010–2019 三个时期。
图2:标注页面样本在不同出版年份中的分布
图2:标注页面样本在不同出版年份中的分布。可以看到样本主要覆盖 1980 年代和 2000 年后两个阶段,这也正好给后面的“跨年代评估”埋下了伏笔。
从工程角度看,这个数据集的意义很现实:它不是实验室里打印出来的整齐样张,而是真实政府公文的扫描件,里面有老化、噪声、墨迹扩散和版面退化。也就是说,模型不是在做“识字游戏”,而是在对付历史文档数字化这个硬骨头。论文还把数据集公开到 Hugging Face,至少在可复现性上,姿态是到位的。

小样本大作为:QLoRA微调VLM实现1.05%超低CER

方法层面,这篇论文没有去造一个全新的 OCR 架构,而是选了三类现成但很强的页级视觉语言模型:DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B。这里的关键不是“模型名字够新”,而是它们都适合做页级文档识别,而且还能通过 LoRAQLoRA 进行低成本微调。
LoRA 的全称是 Low-Rank Adaptation,中文可理解为“低秩适配”。它的思路很朴素:不把大模型全量参数都改一遍,而是在关键层旁边加一组小的可训练矩阵,让模型用很少的新增参数去适应新任务。QLoRA 则是在这个基础上再把底座权重量化到 4bit,进一步降低显存占用。简单说,原来是“请一整支装修队重装房子”,现在变成“只改几个关键开关”,省钱、省显存,也更适合小数据场景。
表2:八组微调实验配置汇总
表2:八组微调实验配置汇总。不同实验在 GPU、量化方式、LoRA 秩和输入分辨率上做了变化,用来观察“模型大小、分辨率、正则化”到底谁更能救场。
这篇论文最有意思的点之一,是它没有迷信“大模型天然就更强”。实验里,DeepSeek-OCR V1、V2 和 LightOnOCR-2-1B 在零样本状态下几乎都不行,说明这些模型虽然在通用文档理解上很能打,但对僧伽罗语的预训练覆盖明显不够。换句话说,模型不是不会看字,而是压根没怎么见过这种字。零样本结果非常扎心:有的模型 CER 甚至接近“看不懂”的级别,说明低资源语言 OCR 不能靠玄学,还是得补域内数据。
表3:微调前的零样本性能
表3:微调前的零样本性能。可以看到三种模型在僧伽罗语真实文档上几乎都“翻车”,这恰好证明了后续微调不是锦上添花,而是救命操作。
真正的转折点出现在 QLoRA 微调之后。三种模型都出现了大幅提升,其中 LightOnOCR-2-1B 在实验 7 中表现最好,CER 降到 1.05%,WER 降到 5.63%。这个结果很有画面感:一个只有 1B 参数左右的开源模型,靠 707 张训练样本,居然能把真实僧伽罗语整页 OCR 做到接近可用甚至很好用的程度。这里真正起作用的,不只是“模型大”,而是“分辨率够高、数据够真、适配够准”。
表4:QLoRA适配后的模型表现
表4:QLoRA 适配后的模型表现。LightOnOCR-2-1B 在更高输入分辨率下明显受益,说明细小笔画和附加符号对僧伽罗语识别非常关键。
这里还有一个很工程化的结论:输入分辨率真的不是摆设。实验 7 把长边分辨率提高到 1540px 后,模型对细粒度笔画和变音符号的识别明显更稳。对于复杂文字系统,分辨率低了,字就像被压扁的蟹黄包,轮廓还在,细节全没了。论文还观察到,在小数据上,过强正则化未必有利,某些配置加了 dropout 反而不如更合适的低秩设置,这说明“把正则化往死里加”并不总是聪明选择。

时间的考验:首次历时性评估揭示OCR性能退化规律

这篇论文另一个很硬的点,是它第一次把僧伽罗语 OCR 放到“跨年代”视角下看。很多模型在现代打印件上表现不错,一碰到 1980 年代那种纸张老化、墨迹扩散、扫描噪声重的文档,立刻就原形毕露。作者把测试集按时期切成三段,再看不同模型的 CER、WER 变化,结果非常一致:文档越老,识别越难,错误率越高。
表6:不同年代区间的CER与WER加权均值
表6:不同年代区间的 CER 与 WER 加权均值。老文档对所有模型都更难,说明“时间”本身就是 OCR 的敌人之一。
图3:不同年代的CER变化
图3:不同年代的 CER 变化。可以直观看到,1980 年代文档最难,现代文档最容易,退化趋势非常清晰。
图4:不同年代的WER变化
图4:不同年代的 WER 变化。词级错误在老文档上同样明显抬头,说明退化不是个别字符问题,而是整页文本稳定性都在下降。
这个历时性分析的价值,绝不只是“多做了一个实验”。它告诉行业一个很现实的事:如果训练和评测总盯着现代干净样本,模型就会在历史文档上严重高估。论文里 Tesseract v5 和 Subasa-OCR 在 1980 年代文本上的 WER 高得离谱,意味着大约七成词都可能错;Surya-OCR 虽然比老牌工具强,但在真实旧档案上也远不如合成图上的成绩。这个差距说明,合成数据 benchmark 往往会把真实世界难度低估得很厉害。

开源战胜商业:LightOnOCR-2-1B全面超越Google Document AI

如果只看最核心的指标,这篇论文确实打出了一记漂亮的反差:LightOnOCR-2-1B 微调后在测试集上的 CER 达到 1.05%,比商业系统 Google Document AI2.06% 还要低。换句话说,开源 1B 模型在这个具体任务上把商业 OCR 挤到了后面。
表5:与现有OCR引擎的对比
表5:与现有 OCR 引擎的对比。LightOnOCR-2-1B 在主指标 CER 上领先,说明针对真实僧伽罗语页级文档的定制微调很有效。
不过这里也要说得客观一点。Google Document AI 在 METEOR 上略有优势,这说明它在某些文本相似度和流畅性指标上并不差;但 OCR 真正落地时,最怕的是字符级错误累积,尤其是法律文书、档案检索、可搜索 PDF 这类场景,CER 往往比“看起来顺不顺”更重要。也就是说,这次不是商业系统被“全面碾压”,而是在这个真实任务的关键指标上,开源模型更贴近实用需求。
更关键的是成本逻辑。商业 API 往往要按调用付费,批量处理历史档案时成本很容易失控;而 LightOnOCR-2-1B 这种可本地部署、还能用 QLoRA 低成本适配的方案,显然更适合政府档案馆、图书馆、研究机构这类长期项目。对这些场景来说,模型不是越“豪华”越好,而是越能稳定批量干活越值钱。

不仅是OCR:为新语言、旧文档的数字化铺平道路

这篇论文真正给行业的启发,不只是“僧伽罗语做出来了”,而是把一条可复制的路线摆得很清楚:先拿真实文档建数据,再用页级 VLM 做底座,最后用 QLoRA 低成本适配。对于很多低资源语言、历史档案语言、地方文字系统来说,这套路径比从零训练一个传统 OCR 系统更现实。
当然,论文也不是没有边界。数据集目前只覆盖政府法案,文体比较单一;1990—1999 年代缺失;而且页级模型虽然省去了分割误差,但对更复杂的版面、表格、混排和手写体,未必还能保持同样稳定。换句话说,这次结果证明的是“在这个任务上,页级 VLM + 真实数据 + 低成本微调是能打的”,还不能直接外推成“所有僧伽罗语 OCR 场景都已解决”。科研里最怕的就是把局部成功吹成宇宙真理,这点还是得克制一点。
如果把这项工作放到更大的图景里看,它其实在回答一个很朴素但很重要的问题:AI 真正有用的时候,不是把英文论文讲得更顺,而是把那些原本没人愿意碰的旧文档、冷门语言和脏数据,变成可搜索、可分析、可保存的知识资产。 这类工作不一定最炫,但很实在。对于档案数字化、法律文本检索、文化遗产保护,甚至后续的知识抽取和时间演化研究,价值都相当直接。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“僧伽罗语真实整页文档 OCR 没有公开数据、没有真实评测、模型也缺乏适配”的问题。作者不仅发布了数据集,还验证了页级 VLM 经过小样本微调后,确实能在真实旧文档上干活。

CER、WER、BLEU、METEOR、ANLS 分别是什么意思?CER 是字符错误率,WER 是词错误率,越低越好;BLEU、METEOR、ANLS 用来衡量生成文本和真值的相似度,越高越好。OCR 场景里,CER 和 WER 通常更直接反映识别是否靠谱。

为什么这篇论文强调“历时性评估”?因为不同年代的文档质量差异很大,老文档的纸张、扫描、字体都会更糟。只看现代样本,模型成绩容易被高估;把时间维度加进去,才能知道模型到底是不是只会在“干净样本”上表演。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆。创新不在模型结构本身,而在真实页级数据集、QLoRA 适配和跨年代评估三件事的组合拳,实用主义很强。

实验合理度:★★★★☆。零样本、微调、商业系统、开源系统、年代分层评测都做了,逻辑闭环完整,比较也算公平。

学术研究价值:★★★★☆。对低资源语言 OCR、历史文档数字化和历时性鲁棒性研究都有直接参考价值。

稳定性:★★★☆☆。在当前数据域内表现不错,但数据集主题单一,遇到更复杂版式或其他文种时还需要验证。

适应性以及泛化能力:★★★☆☆。对僧伽罗语政府法案有效,但离“通吃所有文档类型”还差一截,泛化边界需要更多数据来证明。

硬件需求及成本:★★★★☆。QLoRA 把 1B 级模型的微调门槛压下来了,适合中高端消费级 GPU 或云端资源,不算离谱。

复现难度:★★★☆☆。数据集公开是加分项,但完整训练配置、数据清洗和文档处理链路仍有一定工程门槛。

产品化成熟度:★★★☆☆。在政府档案、法律文书数字化这类垂直场景里已经很有落地味道,但上线前还得补更多类型样本。

可能的问题:数据域偏窄、缺失 1990 年代、对复杂版式覆盖不足;结果很亮眼,但还不能把“一个场景赢了”直接写成“所有场景都赢了”。


主要参考文献

[1] N. Jayatilleke and N. de Silva, “Zero-shot OCR accuracy of low-resourced languages: A comparative analysis on Sinhala and Tamil,” RANLP 2025.
[7] T. Dettmers et al., “QLORA: Efficient finetuning of quantized LLMs.”
[11] H. Wei, Y. Sun, and Y. Li, “DeepSeek-OCR: Contexts optical compression,” 2025.
[13] S. Taghadouini, A. Cavailles, and B. Aubertin, “LightOnOCR: A 1B end-to-end multilingual vision-language model for state-of-the-art OCR,” 2026.
原论文链接:https://arxiv.org/pdf/2606.29378v1.pdf
开源数据集:https://huggingface.co/datasets/sinhala-ocr-lk-acts-1010

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
僧伽罗语OCR、低资源语言、文档智能、VLM微调,这类“数据少但坑很深”的论文,群里最适合拿来拆。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。