← 返回 PaperDaily
视觉与图像
1B模型把僧伽罗语OCR打到1.05%:还顺手赢了Google
这篇论文最有意思的地方,不是又做了一个 OCR,而是把“真实世界里的老旧僧伽罗语文档”这件麻烦事正面接住了。数据集、QLoRA 微调、跨年代评估三件事一起上,最后还把 Google Document AI 挤在了后面,挺硬核。
龙哥读论文
发布于 2026-08-14 09:10:57
阅读 2
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是又做了一个 OCR,而是把“真实世界里的老旧僧伽罗语文档”这件麻烦事正面接住了。数据集、QLoRA 微调、跨年代评估三件事一起上,最后还把 Google Document AI 挤在了后面,挺硬核。
原论文信息如下:
僧伽罗语OCR的“破冰者”:首个真实整页级数据集发布
这篇论文最值钱的地方,不是简单把一个 OCR 模型跑通了,而是先把“真实世界里的僧伽罗语整页文档 ”这件事正式搬上台面。以前很多研究都在合成图上比成绩,纸面上看着挺热闹,真到老旧扫描件、旧字体、脏背景、排版残缺这些现实问题一来,模型就开始装死。作者这次直接拿斯里兰卡政府法案文档开刀,做出了首个公开的页级僧伽罗语 OCR 数据集 sinhala-ocr-lk-acts-1010 ,这一步比“又训了个模型”更关键,因为没有数据,后面的比较基本都是空中楼阁。
这里先把几个基础概念说人话。OCR 是 Optical Character Recognition ,中文就是“光学字符识别”,目标是把图片里的字变成可编辑文本。页级 OCR 的意思不是一行一行切着识别,而是直接把整页文档喂给模型,让模型一次性看完整页内容。这样做的好处很直白:少了版面检测、行切分、字符拼接这些中间环节,错误不会像多米诺骨牌一样层层传染。对于僧伽罗语这种字形复杂、连写多、相似字符多的文字,少走一步弯路,往往就少掉一大截麻烦。
数据集的构建也不是随便抓几张图就完事。作者从斯里兰卡政府文档仓库里筛出僧伽罗语法案 PDF,再把长文档切块,交给 Google Document AI 生成初始文本,随后逐页人工修正。这个流程有点像“先请一个不太靠谱的实习生打底,再由资深编辑逐字审稿”,虽然费工,但能把真实扫描件里的连字错误、字符替换、空格混乱和断行问题尽量压下去。最终得到 1,010 个页级图文对,按 707/101/202 划分训练、验证和测试集,并且覆盖 1981–1989、2000–2009、2010–2019 三个时期。
从工程角度看,这个数据集的意义很现实:它不是实验室里打印出来的整齐样张,而是真实政府公文的扫描件,里面有老化、噪声、墨迹扩散和版面退化。也就是说,模型不是在做“识字游戏”,而是在对付历史文档数字化这个硬骨头。论文还把数据集公开到 Hugging Face,至少在可复现性上,姿态是到位的。
小样本大作为:QLoRA微调VLM实现1.05%超低CER
方法层面,这篇论文没有去造一个全新的 OCR 架构,而是选了三类现成但很强的页级视觉语言模型:DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B。这里的关键不是“模型名字够新”,而是它们都适合做页级文档识别,而且还能通过 LoRA 和 QLoRA 进行低成本微调。
LoRA 的全称是 Low-Rank Adaptation ,中文可理解为“低秩适配”。它的思路很朴素:不把大模型全量参数都改一遍,而是在关键层旁边加一组小的可训练矩阵,让模型用很少的新增参数去适应新任务。QLoRA 则是在这个基础上再把底座权重量化到 4bit,进一步降低显存占用。简单说,原来是“请一整支装修队重装房子”,现在变成“只改几个关键开关”,省钱、省显存,也更适合小数据场景。
这篇论文最有意思的点之一,是它没有迷信“大模型天然就更强”。实验里,DeepSeek-OCR V1、V2 和 LightOnOCR-2-1B 在零样本状态下几乎都不行,说明这些模型虽然在通用文档理解上很能打,但对僧伽罗语的预训练覆盖明显不够。换句话说,模型不是不会看字,而是压根没怎么见过这种字。零样本结果非常扎心:有的模型 CER 甚至接近“看不懂”的级别,说明低资源语言 OCR 不能靠玄学,还是得补域内数据。
真正的转折点出现在 QLoRA 微调之后。三种模型都出现了大幅提升,其中 LightOnOCR-2-1B 在实验 7 中表现最好,CER 降到 1.05% ,WER 降到 5.63% 。这个结果很有画面感:一个只有 1B 参数左右的开源模型,靠 707 张训练样本,居然能把真实僧伽罗语整页 OCR 做到接近可用甚至很好用的程度。这里真正起作用的,不只是“模型大”,而是“分辨率够高、数据够真、适配够准”。
这里还有一个很工程化的结论:输入分辨率 真的不是摆设。实验 7 把长边分辨率提高到 1540px 后,模型对细粒度笔画和变音符号的识别明显更稳。对于复杂文字系统,分辨率低了,字就像被压扁的蟹黄包,轮廓还在,细节全没了。论文还观察到,在小数据上,过强正则化未必有利,某些配置加了 dropout 反而不如更合适的低秩设置,这说明“把正则化往死里加”并不总是聪明选择。
时间的考验:首次历时性评估揭示OCR性能退化规律
这篇论文另一个很硬的点,是它第一次把僧伽罗语 OCR 放到“跨年代 ”视角下看。很多模型在现代打印件上表现不错,一碰到 1980 年代那种纸张老化、墨迹扩散、扫描噪声重的文档,立刻就原形毕露。作者把测试集按时期切成三段,再看不同模型的 CER、WER 变化,结果非常一致:文档越老,识别越难,错误率越高。
这个历时性分析的价值,绝不只是“多做了一个实验”。它告诉行业一个很现实的事:如果训练和评测总盯着现代干净样本,模型就会在历史文档上严重高估。论文里 Tesseract v5 和 Subasa-OCR 在 1980 年代文本上的 WER 高得离谱,意味着大约七成词都可能错;Surya-OCR 虽然比老牌工具强,但在真实旧档案上也远不如合成图上的成绩。这个差距说明,合成数据 benchmark 往往会把真实世界难度低估得很厉害。
开源战胜商业:LightOnOCR-2-1B全面超越Google Document AI
如果只看最核心的指标,这篇论文确实打出了一记漂亮的反差:LightOnOCR-2-1B 微调后在测试集上的 CER 达到 1.05% ,比商业系统 Google Document AI 的 2.06% 还要低。换句话说,开源 1B 模型在这个具体任务上把商业 OCR 挤到了后面。
不过这里也要说得客观一点。Google Document AI 在 METEOR 上略有优势,这说明它在某些文本相似度和流畅性指标上并不差;但 OCR 真正落地时,最怕的是字符级错误累积,尤其是法律文书、档案检索、可搜索 PDF 这类场景,CER 往往比“看起来顺不顺”更重要。也就是说,这次不是商业系统被“全面碾压”,而是在这个真实任务的关键指标上,开源模型更贴近实用需求。
更关键的是成本逻辑。商业 API 往往要按调用付费,批量处理历史档案时成本很容易失控;而 LightOnOCR-2-1B 这种可本地部署、还能用 QLoRA 低成本适配的方案,显然更适合政府档案馆、图书馆、研究机构这类长期项目。对这些场景来说,模型不是越“豪华”越好,而是越能稳定批量干活越值钱。
不仅是OCR:为新语言、旧文档的数字化铺平道路
这篇论文真正给行业的启发,不只是“僧伽罗语做出来了”,而是把一条可复制的路线摆得很清楚:先拿真实文档建数据,再用页级 VLM 做底座,最后用 QLoRA 低成本适配。对于很多低资源语言、历史档案语言、地方文字系统来说,这套路径比从零训练一个传统 OCR 系统更现实。
当然,论文也不是没有边界。数据集目前只覆盖政府法案,文体比较单一;1990—1999 年代缺失;而且页级模型虽然省去了分割误差,但对更复杂的版面、表格、混排和手写体,未必还能保持同样稳定。换句话说,这次结果证明的是“在这个任务上,页级 VLM + 真实数据 + 低成本微调是能打的”,还不能直接外推成“所有僧伽罗语 OCR 场景都已解决”。科研里最怕的就是把局部成功吹成宇宙真理,这点还是得克制一点。
如果把这项工作放到更大的图景里看,它其实在回答一个很朴素但很重要的问题:AI 真正有用的时候,不是把英文论文讲得更顺,而是把那些原本没人愿意碰的旧文档、冷门语言和脏数据,变成可搜索、可分析、可保存的知识资产。 这类工作不一定最炫,但很实在。对于档案数字化、法律文本检索、文化遗产保护,甚至后续的知识抽取和时间演化研究,价值都相当直接。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“僧伽罗语真实整页文档 OCR 没有公开数据、没有真实评测、模型也缺乏适配”的问题。作者不仅发布了数据集,还验证了页级 VLM 经过小样本微调后,确实能在真实旧文档上干活。
CER、WER、BLEU、METEOR、ANLS 分别是什么意思? CER 是字符错误率,WER 是词错误率,越低越好;BLEU、METEOR、ANLS 用来衡量生成文本和真值的相似度,越高越好。OCR 场景里,CER 和 WER 通常更直接反映识别是否靠谱。
为什么这篇论文强调“历时性评估”? 因为不同年代的文档质量差异很大,老文档的纸张、扫描、字体都会更糟。只看现代样本,模型成绩容易被高估;把时间维度加进去,才能知道模型到底是不是只会在“干净样本”上表演。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆。创新不在模型结构本身,而在真实页级数据集、QLoRA 适配和跨年代评估三件事的组合拳,实用主义很强。
实验合理度: ★★★★☆。零样本、微调、商业系统、开源系统、年代分层评测都做了,逻辑闭环完整,比较也算公平。
学术研究价值: ★★★★☆。对低资源语言 OCR、历史文档数字化和历时性鲁棒性研究都有直接参考价值。
稳定性: ★★★☆☆。在当前数据域内表现不错,但数据集主题单一,遇到更复杂版式或其他文种时还需要验证。
适应性以及泛化能力: ★★★☆☆。对僧伽罗语政府法案有效,但离“通吃所有文档类型”还差一截,泛化边界需要更多数据来证明。
硬件需求及成本: ★★★★☆。QLoRA 把 1B 级模型的微调门槛压下来了,适合中高端消费级 GPU 或云端资源,不算离谱。
复现难度: ★★★☆☆。数据集公开是加分项,但完整训练配置、数据清洗和文档处理链路仍有一定工程门槛。
产品化成熟度: ★★★☆☆。在政府档案、法律文书数字化这类垂直场景里已经很有落地味道,但上线前还得补更多类型样本。
可能的问题: 数据域偏窄、缺失 1990 年代、对复杂版式覆盖不足;结果很亮眼,但还不能把“一个场景赢了”直接写成“所有场景都赢了”。
主要参考文献
[1] N. Jayatilleke and N. de Silva, “Zero-shot OCR accuracy of low-resourced languages: A comparative analysis on Sinhala and Tamil,” RANLP 2025.
[7] T. Dettmers et al., “QLORA: Efficient finetuning of quantized LLMs.”
[11] H. Wei, Y. Sun, and Y. Li, “DeepSeek-OCR: Contexts optical compression,” 2025.
[13] S. Taghadouini, A. Cavailles, and B. Aubertin, “LightOnOCR: A 1B end-to-end multilingual vision-language model for state-of-the-art OCR,” 2026.
原论文链接:https://arxiv.org/pdf/2606.29378v1.pdf
开源数据集:https://huggingface.co/datasets/sinhala-ocr-lk-acts-1010
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
僧伽罗语OCR、低资源语言、文档智能、VLM微调,这类“数据少但坑很深”的论文,群里最适合拿来拆。