← 返回 PaperDaily 视觉与图像

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集

这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers(机构报纸流水线:从历史报纸中提取数十亿高质量token)
发表日期:
2026年8月
发表单位:
哈佛法学院图书馆Institutional Data Initiative、哈佛法学院、哈佛工程与应用科学学院、哈佛肯尼迪学院、波士顿公共图书馆
原文链接:
https://arxiv.org/pdf/2608.18972v1.pdf
开源代码链接:
https://github.com/institutional/institutional-newspapers-pipeline
项目链接:
https://huggingface.co/collections/institutional/institutional-newspapers
开源数据集链接:
https://huggingface.co/collections/institutional/institutional-newspapers

朋友们,当整个AI圈都在拼算力、拼模型规模的时候,有一群人默默把目光投向了——一百多年前的旧报纸。🤚
这不是什么行为艺术。哈佛法学院图书馆旗下的Institutional Data Initiative(机构数据倡议)联合波士顿公共图书馆,刚刚发布了一套名为Institutional Newspapers Pipeline的开源流水线,专门从海量历史报纸扫描件中提取高质量、结构化的文本数据。这套系统已经实际处理了波士顿公共图书馆馆藏的147万份报纸扫描件,产出了惊人的163亿token的OCR文本。
说句实话,龙哥第一次看到这个数字的时候也愣了一下。163亿token是什么概念?差不多相当于几百个GPT-3级别的预训练语料规模。而这些数据,全部来自1795年到1930年间出版的公共领域报纸——这意味着,它们可以合法、自由地被用于AI训练和学术研究。
更让人眼前一亮的是,这篇论文的官方demo图(图1)把整套流水线的效果展示得明明白白:一份1856年的《波士顿晚间公报》头版,经过流水线处理后,被精准地分割成40个独立区域,每个区域都有了OCR文本、类型标签、阅读顺序、命名实体、主题分类和嵌入向量。从扫描件到结构化数据,全程自动化。

历史报纸的"数字金矿":为何传统方法难以开采?

图1:流水线在1856年8月28日《波士顿晚间公报》头版上的输出效果。流水线的十五个步骤在此归为六层,自下而上依次为:原始扫描件;分割器检测出的40个裁剪区域;每个区域的OCR文本(按token数着色);各区域类型;以路径形式展示的阅读顺序;以及由富化步骤添加的实体、主题和嵌入。
流水线在1856年8月28日《波士顿晚间公报》头版上的输出效果。流水线的十五个步骤在此归为六层,自下而上依次为:原始扫描件;分割器检测出的40个裁剪区域;每个区域的OCR文本(按token数着色);各区域类型;以路径形式展示的阅读顺序;以及由富化步骤添加的实体、主题和嵌入。
这场"报纸数字化考古"背后,藏着一个更宏大的叙事:大语言模型越来越"饿",而高质量的历史文本数据,正是它们最稀缺的养分之一。
先问一个问题:为什么偏偏是报纸?
报纸是工业革命以来人类公共生活最丰富、最连续的记录载体。从政治事件到商业广告,从社会新闻到文艺评论,一份报纸几乎囊括了当时社会的全部信息维度。更重要的是,在1795年到1930年间出版的报纸,目前在美国已全部进入公共领域——没有版权限制,可以自由用于AI训练。
但问题在于:报纸扫描件的版面极其复杂。密密麻麻的专栏、装饰性的标题、分类广告、表格、图片……传统的OCR工具(比如Tesseract)面对这种"信息密集阵"时表现很不稳定,经常把栏目搞混、把大字标题认错、在复杂版面上直接"罢工"。而最新一代的视觉语言模型(VLM)虽然效果好一些,但对整页扫描件做OCR时,又容易出现重复生成、幻视和漏读,尤其当页面极其密集时,连顶级模型都会翻车。
更现实的问题还有成本。如果用云端前沿模型来处理这147万份扫描件,光OCR这一步的API调用费就要25万到80万美元。这个数字直接把绝大多数图书馆和中小型研究机构劝退了。
哈佛和波士顿公共图书馆的这次合作,给出了一个相当漂亮的回答:把"整页识别"拆成"先分割、再逐块识别",用传统OCR和专用VLM组成双引擎,再配上全套的文本分析与结构化后处理。整套流水线设计得极其克制,只依赖工作站级硬件就能跑。最终,他们把处理147万份扫描件的总成本压缩到了大约2.5万美元。
这个成本差,就是工程思维的胜利。

十五步流水线:从扫描件到结构化数据的完整旅程

这套流水线的核心设计哲学可以概括为八个字:模块解耦、逐级富化
整个流水线由15个顺序执行的步骤组成,每一步都保持独立、可解释、可单独调试。项目采用模块化CLI设计,支持系统管理、流程编排、单步调试、日志分析、数据预览和最终导出等完整操作。所有中间结果都记录在SQLite数据库中,最终导出为Parquet格式的分片文件。
这15个步骤大致可以分成六层(参见图1):
第一层是原始扫描件。第二层是区域分割,用目标检测模型把一整页报纸切成一个个独立的"裁剪区域"(crop)。第三层是OCR——每个裁剪区域都要分别过一遍Tesseract和dots.mocr(一个3B参数的多语言OCR专用VLM),得到两套平行的文本输出。第四层是类型分类,分别用图像分类器和文本分类器来判定每个区域是正文、广告、标题还是图片。第五层是阅读顺序检测,通过HDBSCAN聚类把散落的区域按人类阅读习惯排好序。第六层是富化层,包括命名实体识别、主题检测、语言识别、关键词匹配和向量嵌入生成。
整个流程下来,每个报纸扫描件不再是"一张图片+一段模糊的全文文本",而是一个拥有完整结构的数据对象:哪个区域是广告、哪段文字属于哪篇文章、文章里提到了哪些人物和地点、整页的阅读顺序是怎样的、每个区域的语义向量长什么样——全部清清楚楚。
这里特别要强调一个设计决策:把“分割”和“分类”彻底拆开。为什么?因为报纸扫描件里,正文和广告占了绝大多数,如果训练一个“检测+分类”一体的模型,类别严重不平衡,模型很容易把少数类(比如漫画、照片)忽略掉。分开之后,分割模型只需要学会“哪里有一块内容”,分类模型再单独判断“这块是什么”,两边都能把活干得更纯粹。
分割模型选的是YOLO26x(YOLO第26代系列中最大的版本,5500多万参数)。别看它叫“最大”,在今天的模型生态里依然是个标准的小个子,跑推理非常快。训练数据方面,团队手工标注了1020份扫描件,共47485个边界框,其中一部分先用中间模型预标注、再人工校对,最后按15%留出验证集、15%留出测试集。最终在测试集上,分割模型的F1分数达到0.918,mAP@50高达0.955,mAP@50-95也到了0.901。
表1:分割模型在留出测试集上的评估结果。
表1:分割模型在留出测试集上的评估结果。
更有意思的是,团队用Eigen-CAM热力图观察了模型到底在看哪里。结果发现,模型的注意力主要集中在报头、标题横幅和栏目的结构边界上,而不是扫描件的噪点或折痕。这说明模型学到的是报纸版面的“骨架”,而非表面的像素特征。对于历史文献数字化这种对可解释性要求很高的场景,这一点非常重要。
图2:分割模型的Eigen-CAM热力图叠加在样例头版上(《北布鲁克菲尔德日报》,1880年5月22日)。在主干网络第8层(C3k2块)、推理尺寸960像素下计算。激活主要集中在报头和标题横幅上,并勾勒出页面的栏结构。
图2:分割模型的Eigen-CAM热力图叠加在样例头版上(《北布鲁克菲尔德日报》,1880年5月22日)。在主干网络第8层(C3k2块)、推理尺寸960像素下计算。激活主要集中在报头和标题横幅上,并勾勒出页面的栏结构。
实际跑完全部馆藏后,模型在147万份扫描件上共检测出8314万多个裁剪区域,平均每份扫描件56.4个。模型置信度高度集中在0.95附近,说明它对自己的判断相当有把握。从年代分布看,19世纪中叶的报纸版面最“拥挤”,平均裁剪区域数量达到峰值,这可能和当时广告版式的发展阶段有关。
图3:所有检测到的裁剪区域的置信度分数分布。
图3:所有检测到的裁剪区域的置信度分数分布。
图4:按十年统计的每份扫描件平均裁剪区域数量。
图4:按十年统计的每份扫描件平均裁剪区域数量。
图5:被检测裁剪区域覆盖的扫描件面积比例分布。
图5:被检测裁剪区域覆盖的扫描件面积比例分布。
还有一个很有意思的统计:平均每个扫描件有89%的面积被裁剪区域覆盖,那剩下11%去哪了?团队抽样量了一下,发现最外侧的裁剪区域四周留出了约2.6%到3.6%的未覆盖边框,基本就是页边距。虚惊一场,模型没漏内容,是报纸本来就有白边。

双引擎OCR策略:传统与VLM的互补之道

OCR(光学字符识别),也就是把图片里的文字“认”出来,是整个流水线的核心环节。这个环节做得好不好,直接决定下游所有数据质量。
论文团队做了一个非常“不嫌麻烦”的决定:对每一个裁剪区域,同时跑两套OCR引擎。一套是经典的开源OCR工具Tesseract 5(配tessdata_best模型),另一套是专门为OCR优化的视觉语言模型dots.mocr(一个参数量仅30亿的多语言模型,支持表格解析)。
为什么这么干?因为两者的失败模式完全互补。Tesseract这类传统OCR引擎的优点是几乎不会“幻觉”,不会凭空给你编出一句整话来;缺点是面对装饰性字体、复杂版面、损坏的旧报纸时,经常漏字、认错栏。dots.mocr这类VLM则相反,理解能力强,能从上下文推断出残缺的字,但偶尔会一本正经地“脑补”出原文没有的内容。
表:一个“有益幻觉”的例子,VLM成功从损坏的扫描件中恢复缺失字母。同样的机制也可能导致转录错误。
图6:一个“有益幻觉”的例子,VLM成功从损坏的扫描件中恢复缺失字母。同样的机制也可能导致转录错误。
比如上图这张,原扫描件上“STORAGE”几个字母已经模糊不清,dots.mocr却根据上下文把它补全成了“STORAGE Storage-Rooms may be found on application at The Advertiser”。这种“有益幻觉”在修复受损历史文献时意外地好用。当然了,硬币的另一面是:它也可能把“cat”读成“car”,所以在数据集中同时保留两套OCR输出,让下游使用者自己权衡,是最稳妥的做法。
为了控制计算成本,论文团队没有让VLM直接啃整页大图,而是把每个裁剪区域的图像尺寸先压到0.25到1百万像素之间,再用vLLM做批量推理。vLLM是一个高性能的大模型推理加速框架,配合双缓冲机制(一边准备下一批数据、一边推理当前批),把GPU利用率拉到了很高。最终,dots.mocr在整个馆藏上产出了163亿个token,Tesseract产出了147亿个token。
图7:按十年统计的o200k_base token总量对比(Tesseract与dots.mocr)。
图7:按十年统计的o200k_base token总量对比(Tesseract与dots.mocr)。
图8:按十年统计的每份扫描件产生的o200k_base token数对比(Tesseract与dots.mocr)。
图8:按十年统计的每份扫描件产生的o200k_base token数对比(Tesseract与dots.mocr)。
从图7和图8可以明显看到,dots.mocr在几乎每个年代都比Tesseract多认出了不少文字——特别是在装饰元素多、纸张破损严重的版面上,VLM的语义理解能力优势尽显。这里提到的o200k_base是OpenAI发布的分词器,论文里用它来计算token数,目的是给AI训练从业者一个更直观的“模型视角”数据规模参考。
表3:Tesseract与dots.mocr在所有裁剪区域上的文本指标对比。平均值是在各引擎检测到文本的裁剪区域上计算的:Tesseract为81133206个,dots.mocr为82985118个,总裁剪区域为83147041个。
表3:Tesseract与dots.mocr在所有裁剪区域上的文本指标对比。平均值是在各引擎检测到文本的裁剪区域上计算的:Tesseract为81133206个,dots.mocr为82985118个,总裁剪区域为83147041个。
除了OCR文本本身,流水线还对每个裁剪区域做了语言检测。结果不出意外,英语占了97.61%,但真正有意思的是那条“多语言尾巴”:意第绪语、德语、瑞典语、法语紧随其后,一共覆盖了73种语言代码。这正是波士顿作为19世纪移民港口城市的历史缩影——当时的移民报纸,如今变成了语言学和历史学研究的富矿。
表2:dots.mocr(VLM)OCR文本的前五大语言代码及其在有语言代码裁剪区域中的占比。
表2:dots.mocr(VLM)OCR文本的前五大语言代码及其在有语言代码裁剪区域中的占比。
不过这里也得泼一盆冷水:Tesseract的“独特词”数量反而比dots.mocr更多。这听起来像好事,其实恰恰说明传统OCR产生了大量字符级噪声——一个词被认错几个字母,就变成了一个“新词”。VLM的独特词更少,意味着它的输出更干净、更接近真实词汇分布。
说完OCR,再看区域类型分类。团队给每个裁剪区域打上七种标签之一:正文、广告、栏目标题、报头/刊头、照片或插图、漫画、空白。分类器同样搞了“双保险”:一个基于YOLO26m-cls的图像分类器(1160万参数),一个基于Model2Vec静态嵌入的文本分类器。前者擅长看视觉特征,后者擅长读语义内容,两者结合,连“光看图不知道是啥、光看字也猜不透”的疑难区域也能拿下。
表4:图像与文本区域类型分类器的逐类别评估结果。“空白”对于文本分类器标记为N/A,因为该分类器不对该类建模。
表4:图像与文本区域类型分类器的逐类别评估结果。“空白”对于文本分类器标记为N/A,因为该分类器不对该类建模。
从表4可以看到,两个分类器在广告、正文、栏目标题这些“文字密集型”类别上表现接近,但到了照片/插图和漫画这类“视觉密集型”类别上,图像分类器完全碾压文本分类器——F1分数分别是0.84对0.48、0.92对0.68。这符合直觉:漫画和照片本来就没什么文字可读。合并决策逻辑也很清晰:默认取置信度更高的那个;如果图像分类器说是“照片/插图”或“空白”,直接听图像分类器的。
表5:区域类型分类的一致性以及最终决策来源。
表5:区域类型分类的一致性以及最终决策来源。
最终,两个分类器在90.55%的裁剪区域上意见一致,95%以上的情况下的最终决策与至少一个分类器重合。也就是说,两个分类器各有盲区,但合在一起,基本覆盖了版面上能出现的所有情况。从图9的统计看,广告是数量最多的区域类型,但正文承载了大部分token——这也符合报纸的本质:广告多但短,文章少但长。
图9:按最终区域类型类别统计的裁剪区域分布。
图9:按最终区域类型类别统计的裁剪区域分布。
图10:按最终区域类型类别统计的dots.mocr o200k_base token总量。
图10:按最终区域类型类别统计的dots.mocr o200k_base token总量。
区域类型还有一层“时间滤镜”的效果。图11到图13展示了不同年代下各类别占比的变化趋势:广告在19世纪末经历了一轮爆发式增长,正文的相对比例则有所下降。这为研究美国报刊史和商业史提供了量化的证据链。
图11:按十年统计的最终类别裁剪区域占比变化(相对百分比)。
图11:按十年统计的最终类别裁剪区域占比变化(相对百分比)。
图12:按十年统计的dots.mocr token占比变化(相对百分比)。
图12:按十年统计的dots.mocr token占比变化(相对百分比)。
图13:按十年统计的裁剪区域面积占比变化(相对百分比)。
图13:按十年统计的裁剪区域面积占比变化(相对百分比)。
分类做完,下一步是阅读顺序检测。这一步的原理是:报纸排版虽然复杂,但人类阅读时总有一个自然路径。论文用HDBSCAN(一种基于密度的聚类算法,不需要预先指定簇数量)对同一扫描件里的所有裁剪区域进行聚类,然后按空间位置排出1到40的阅读序号。这样一来,大模型或者RAG系统在读取这份数据时,就能按正确顺序“读报”,而不是跳来跳去。这好比是给AI配了一位排版师傅,专门负责把豆腐块文章按正确顺序串起来。
最后的“富化层”更是把数据价值拉满:命名实体识别(NER)负责找出每个区域里的人名、地名、机构名;主题检测负责给每个区域打上主题标签;还有一组预计算好的文本和图像向量嵌入(embedding),方便做语义检索和聚类分析。论文统计显示,整个数据集共识别出173个不同人名、148个地名和47个机构名的高频实体,主题标签的前八名覆盖了超过一半的区域。
表7和表8:命名实体总量和独特表面形式数量,以及每类实体中出现频率最高的前五个实体。
表7和表8:命名实体总量和独特表面形式数量,以及每类实体中出现频率最高的前五个实体。
图14:所有裁剪区域中排名靠前的主题标签。
图14:所有裁剪区域中排名靠前的主题标签。
图15:每个主题标签的平均top-1置信度分数,附带标准差误差棒。
图15:每个主题标签的平均top-1置信度分数,附带标准差误差棒。
图16:每个区域类型类别中的主导主题(主导主题的占比,百分比)。
图16:每个区域类型类别中的主导主题(主导主题的占比,百分比)。

计算节俭设计:工作站级硬件也能处理千万级扫描件

聊完了技术细节,来聊聊钱的问题。做数据处理的人都懂,很多时候不是算法不行,是预算不给力。这篇论文最让龙哥欣赏的一点,就是它在“计算节俭”这件事上做到了极致。
先看一组对比。如果用云端前沿大模型API来做这147万份扫描件的OCR,按每百万输出token 15到50美元的价格估算,总费用在25万到80万美元之间。而论文团队用8块NVIDIA L40S GPU本地部署dots.mocr,配合vLLM推理框架,把总成本压缩到了大约2.5万美元。这个差距不是一个数量级,是十到三十倍
这种成本优势从哪来?第一,把整页识别拆成“裁剪区域级”识别,每张图变小了,VLM处理得更快更稳;第二,模型选择非常克制——分割用50M参数的YOLO,分类用11M参数的YOLO分类器,OCR用3B参数的dots.mocr,全程没有一个是“巨无霸”;第三,大量使用vLLM的批处理与缓存机制,把GPU的空闲时间压到最低。
更难得的是,这套流水线对硬件的要求并不苛刻。论文明确指出,整个系统可以在工作站级硬件上运行。所谓工作站级,就是一台配了中高端GPU的桌面电脑或小型服务器,而不是需要独立机房的算力中心。这意味着,一家省级图书馆、一所普通高校,甚至一个资金有限的研究团队,都有能力把自己馆藏的历史文献“数字化”成高质量数据集。
为了达到这种“节俭”,团队在工程上做了大量取舍。比如Tesseract的输入图像被缩放到最大150万像素,dots.mocr的输入被限制在25万到100万像素之间——在准确率和显存占用之间反复权衡后找到的甜点。再比如分割模型推理时,置信度阈值设为0.6,IoU阈值设为0.15,用“宁缺毋滥”的保守策略确保留下的都是高质量检测框。

开放数据集与模型:16.3B token的公共资源

论文不只是发了个技术报告,还把全套家当都开源了。数据、模型、代码,一个不落。
先看数据集。在Hugging Face上,Institutional Data Initiative发布了覆盖147万份扫描件、8314万个裁剪区域的完整数据:每个裁剪区域都有边界框坐标、区域类型标签、Tesseract和dots.mocr两套OCR文本、阅读顺序索引、NER实体、主题分类、文本分析指标(字符数、词数、句子数等)、语言代码,以及文本和图像两种模态的向量嵌入。OCR文本总量达到163亿token,用o200k_base分词器计算。这个规模,在历史文献类开放数据集中是空前的。
再说模型。论文里训练的YOLO分割模型、YOLO图像分类器、Model2Vec文本分类器全部开源,每一个都有对应的Hugging Face模型仓库,附带训练和评估细节。这意味着其他机构可以直接拿来推理自己的馆藏,也可以在自己的数据上微调——这大大降低了复现的门槛。
代码方面,GitHub仓库提供了完整的模块化CLI工具链,支持从系统管理、流程编排到单步调试、日志分析、数据预览和最终导出。所有中间结果存在SQLite里,最终导出为Parquet格式的分片文件,方便各种下游工具直接读取。对了,还有一个Agent Skill文件——一个能让AI Agent自动使用这套数据集和模型的接口描述文件。这个细节有点前卫,说明团队已经考虑到未来Agentic工作流的需求了。
这套数据集的直接应用价值在哪里?答案是大模型预训练和数字人文研究。Talkie-LM项目就是一个范例——它专门用1931年前的公共领域数据训练LLM,以研究大模型对历史文本的预测能力,其训练数据的一部分就来自Institutional Data Initiative此前发布的Institutional Books:哈佛图书馆数据集。有了这批报纸数据,Talkie-LM这类项目的“数字饮食”将更加丰富多元。而对历史学家来说,过去只能靠人工翻阅缩微胶卷的研究方式,现在变成了对结构化数据的语义检索、共现分析和趋势统计。

局限与展望:从波士顿到全球报纸的数字解锁

任何一份工作都有边界,这篇论文也对自己的局限说得比较坦诚。
第一,这套流水线是针对波士顿公共图书馆的馆藏优化的。虽然分割和OCR部分相对通用,但区域类型分类器是在波士顿馆藏的标注数据上训练的,搬到其他机构的馆藏上,版面风格差异可能会导致精度下降。不过好在模型和数据都开源了,其他机构可以低成本地微调适配。
第二,VLM的幻觉问题没有被完全消除。论文承认,dots.mocr偶尔会把模糊的字“脑补”成错误的词。虽然“有益幻觉”能修复残缺文本,但“有害幻觉”会在数据里埋下错误的种子。使用者需要意识到,这套数据集的OCR文本并非100%忠实于原文。
第三,当前发布的是pre-1931的子集。1795年到1930年的报纸全部在公共领域,这是一个天然的法律红利期,但也是数据覆盖的截止线。1931年之后的报纸,版权状态复杂,处理起来要额外小心。
但往远处看,这篇论文打开了一扇门。美国国会图书馆的Chronicling America项目已经积累了超过2000万份报纸扫描件,欧洲的Europeana Newspapers和法国国家图书馆的Gallica平台也有海量数据。如果这套流水线能在更多机构落地,那么全球历史报纸的“数字解锁”只是一个时间问题。到那时,大模型能读到的

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?哈佛与波士顿公共图书馆联合开源历史报纸处理流水线,从147万份扫描件中提取8310万区域、163亿token的OCR文本,双引擎OCR+模块化设计让处理成本降至约2.5万美元,为AI训练与数字人文研究提供高质量公开数据集。
这篇工作最值得看的点是什么?分割模型达到0.927精度、0.910召回率、0.918 F1;阅读顺序检测达到72.1% macro和80.8% micro位置准确率;dots.mocr比Tesseract多产生约10%的token;分类器在广告和内容类别上F1超过0.92。
这篇工作的边界或风险在哪里?优点:(1)模块化设计使每个步骤可独立评估和定制;(2)计算高效,可在工作站级硬件上运行;(3)分离分割与分类有效解决了类别不平衡问题;(4)结合图像和文本双信号进行分类提高了准确性;(5)发布了完整的数据集、模型和代码。缺点:(1)阅读顺序检测对非列式布局的报纸效果有限;(2)NER和主题检测被视为实验性输出,准确性有限;(3)模型针对波士顿公共图书馆馆藏优化,对其他馆藏泛化性未知;(4)VLM OCR仍存在幻觉和token循环问题。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个模块化、可解释且计算高效的历史报纸扫描件处理流水线,通过版面分割、双引擎OCR、分类、阅读顺序检测、NER、主题分类、语言检测和嵌入生成等15个步骤,从1,473,635张扫描件中提取高质量结构化数据。

实验合理度:★★★★☆

分割:Precision、Recall、F1、mAP@50、mAP@50-95;阅读顺序:位置准确率(macro/micro)和Kendall's τ;分类:各类别P/R/F1和总体准确率。

学术研究价值:★★★★☆

构建一个模块化、可解释且计算高效的历史报纸扫描件处理流水线,通过版面分割、双引擎OCR、分类、阅读顺序检测、NER、主题分类、语言检测和嵌入生成等15个步骤,从1,473,635张扫描件中提取高质量结。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在8×NVIDIA L40S GPU节点上,处理200期报纸(约200×56.4个crop)平均耗时86.69分钟,其中dots.mocr OCR占28.62分钟,Tesseract OCR占16.48分钟;

复现难度:★★★☆☆

https://github.com/institutional/institutional-newspapers-pipeline

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(4)结合图像和文本双信号进行分类提高了准确性;(5)发布了完整的数据集、模型和代码。缺点:(1)阅读顺序检测对非列式布局的报纸效果有限;(2)NER和主题检测被视为实验性输出,准确性有限;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球