← 返回 PaperDaily 视觉与图像

哈佛开源2260万古籍插图,AI终于补上历史课

如果让一个从来没出过村的老学究,突然面对整个互联网的图片,他会怎么看世界?大概率是懵的。反过来,如果把全世界最聪明的AI模型扔进一座百年图书馆,让它只看一堆发黄的书页扫描件,它也会懵。

哈佛开源2260万古籍插图,AI终于补上历史课
原论文信息如下:
论文标题:
Institutional Books — Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections.
发表日期:
2026年08月
发表单位:
Harvard Law School Library, Harvard Library, Harvard Law School, Harvard School of Engineering and Applied Sciences, Harvard Kennedy School
原文链接:
https://arxiv.org/pdf/2608.18957v1.pdf

如果让一个从来没出过村的老学究,突然面对整个互联网的图片,他会怎么看世界?大概率是懵的。反过来,如果把全世界最聪明的AI模型扔进一座百年图书馆,让它只看一堆发黄的书页扫描件,它也会懵。这不是比喻,而是眼下多模态大模型真实的窘境——它们被互联网上的当代视觉文化"喂"大了,对历史内容是真正的"水土不服"。比如给模型看一幅19世纪的版画,它可能分不清这是照片还是手绘,看不懂藏书票的用途,更别提理解那些扫描过程中意外拍进去的手指头、金属夹子到底是什么鬼。
而哈佛这帮人,偏要把这个难题啃下来。他们搞了一个叫 Institutional Books — Visual Elements 的开源流水线,从哈佛图书馆的 Google Books 扫描数据里,硬生生挖出了2260万个视觉元素,还配套了检测、分类、去重、描述的一整套模型和工具链。论文的标题很朴素,但数据量一点不朴素:983,004卷书、3.94亿页扫描、2260万张插图,外加7.66亿个文本token的描述数据。这套流水线把"古书里的图"变成了AI能直接吃进去的结构化数据。

历史书页中的视觉宝藏:一个2260万元素的提取流水线

先交代一下背景。Institutional Books 是哈佛图书馆和哈佛法学院图书馆等机构联合推动的项目,目标是把图书馆里那些进入公共领域的图书,变成大规模、高质量、可供计算访问的语料库。之前他们已经发布过包含242B token的图书文本数据集,这次的工作相当于给这个文本宇宙加了一层"视觉维度"。
论文的核心逻辑其实很简单:OCR(光学字符识别,Optical Character Recognition)技术已经非常成熟,能把书页上的文字标准化提取出来,但那些插图、照片、版画、装饰图案、乐谱,长期以来都是"被数字化遗忘的角落"。这些视觉元素恰恰承载了文字无法表达的丰富信息——19世纪的科学绘图、维多利亚时代的藏书票、战争时期的讽刺漫画,都是那个时代视觉文化的直接证据。
于是他们做了这么一件事:把整个哈佛馆藏的Google Books扫描数据,将近400万页,全部过了一遍计算机视觉流水线。最终结果是一个包含22,622,060个视觉元素的数据集,每个元素都带有类别标签、图像嵌入向量,以及实验性的LLM生成描述。整个数据集在Hugging Face上开源,代码在GitHub上公开。换句话说,这不是一篇"纸上谈兵"的论文,而是一套已经跑完3.94亿页的、可复现的、完整的工业级流水线。
图5:后处理过滤后各类别占比饼图
图5:后处理过滤后各类别占比饼图,其中"Image/Illustration"占68.0%,"Artifact"占9.2%,"Ex Libris/Decorative"占7.0%,"Chart/Graph"占6.2%,"Music"占5.3%
这里要特别提一句,论文里把那些扫描过程中混进去的手指头、金属夹子、条形码、碎页等东西归为一个叫"Artifact"的类别。这个类别占了9.2%。别小看这个数字——这恰恰说明这套系统不是只在干净数据上自嗨,而是真实面对了数字化过程中的各种脏数据,并且把它们也诚实地标注了出来。

从检测到描述:五步流水线的技术拆解

这套流水线的整体流程非常清晰,一句话概括就是:先在书页上找到图,再判断图是什么,然后去掉重复的图,接着给图写描述,最后把歪的图转正。五个步骤环环相扣,每一步的输出就是下一步的输入。
第一步:检测(Detection)。检测是整条流水线的地基。如果检测阶段漏掉了某个视觉区域,后面所有步骤都不会有机会处理它。论文选用了YOLO26n——一个只有240万参数的轻量级目标检测模型,而不是更花哨但计算量巨大的视觉语言模型。为什么?理由很实在:图书馆的扫描页面有非常强的规律性,版式相对固定,这种强归纳偏好的任务,用CNN(卷积神经网络,Convolutional Neural Network)就够了,没必要上大模型。训练集是4528页图书扫描图,其中包含6103个边界框标注,标注过程经历了"人工标注109个样本→训练中间模型→自动预标注→人工修正"的迭代流程。这个流程在工程上非常值得借鉴:先用小规模人工标注起步,再借助中间模型放大标注效率。
表1:检测模型性能
表1:检测模型在测试集上的性能表现,精确率0.95,召回率0.96
检测阶段的另一个细节是把多类别检测简化为单类别检测——只找"有没有视觉元素",不管"是什么"。这样就把定位和分类两个任务解耦了,让检测模型专注于找图,分类模型专注于认图,各自优化互不干扰。这个设计思路很干净。最终的检测结果在测试集上达到了0.95精确率和0.96召回率,对于这种大规模历史文档场景已经非常能打。
图1:检测模型热力图
图1:检测模型的热力图,模型似乎通过关注页面周围的空白区域来判断是否存在视觉元素
图2:检测模型热力图
图2:检测模型热力图,正确识别出了2个独立对象
从热力图上可以看到,模型对页面空白区域和视觉元素边缘的响应很强烈,说明它学到了"有插图的地方版式会变化"这种隐含规律。
第二步:分类(Classification)。检测完之后,每个被框出来的视觉区域会被裁剪下来,送入分类模型。这里用的是YOLO26s-cls,280万参数的分类模型,负责把裁剪图归入五个大类:Image/Illustration(图像/插图,包括照片、绘画、版画等)、Music(乐谱)、Artifact(扫描伪影,包括手指、夹子、条形码等)、Ex Libris/Decorative(藏书票/装饰元素)、Chart/Graph(图表/图形)。训练集有6042个裁剪样本,其中1602个完全人工标注,另外4440个是中间模型预标注后人工修正的。
表2:分类数据各类别划分
表2:分类数据集的各类别训练/验证/测试划分,Image/Illustration占比最大,达到53.7%
表3:分类模型各类别准确率
表3:分类模型在测试集上各类别的精确率、召回率,Music类别表现最好,Chart/Graph相对较弱
分类阶段有个很聪明的后处理策略:把置信度低于0.7的预测全部重新标记为"Other",相当于让模型承认"这个图我没把握"。这一操作把983,959个低置信度样本(占4.3%)从原有类别中剥离出来。另外针对"Music"类别,论文设计了一个组合策略:置信度≥0.99的直接保留,低于阈值的还要检查描述文本里是否包含音乐相关的关键词。为什么这么折腾?因为很多看起来像乐谱的东西其实不是乐谱,分类器容易被视觉上相似的图案误导。最终12,502个样本被从"Music"改判为"Other"。这种"宁可少收,不可错收"的数据清洗思路,对做数据集的人来说非常有参考价值。
图7:Artifact类别的典型样本
图7:数据集中"Artifact"类别的示例。左图:扫描时被拍进去的手指以及书页边缘;中图和右图:扫描过程中用于压住书页的金属夹子
图7展示了"Artifact"类别的典型样本。这些样本不是脏数据,恰恰是最真实的历史——记录了图书馆扫描工作的物理过程。AI模型如果连"这是人的手指"和"这是金属夹子"都能区分,那它对于历史图像的理解才算真的到位。
第三步:去重(Deduplication)。大规模数字化项目里,重复是不可避免的。同一张插图可能在不同版次的书里反复出现,出版社也会复用装饰元素,扫描过程中还可能把同一页扫两遍。所以论文设计了一个两阶段去重策略
第一阶段用感知哈希(pHash,Perceptual Hash)做精确和近精确匹配。具体来说,对每张裁剪图计算一个144位的DCT感知哈希码,两张图的哈希距离小于等于某个阈值τ,就认为是重复。
感知哈希距离公式
感知哈希的距离公式,其中d_H表示汉明距离,h_i和h_j分别是两张图的感知哈希值,当距离不超过阈值τ时判定为重复
第二阶段用语义嵌入做相似性去重。这里选用了SSCD(Self-Supervised Copy Detection,自监督复制检测)模型,这是一个专门为复制检测设计的2460万参数模型,基于ResNet-50骨干网络加GeM池化。它的输出是一个512维的L2归一化嵌入向量。两张图的相似度用余弦相似度来计算:
内积公式
两个向量的内积,用于计算L2归一化后的嵌入向量之间的余弦相似度
余弦距离公式
余弦距离的公式,等于1减去两个向量的内积
为什么要把哈希和嵌入结合起来?因为感知哈希在旋转、裁剪、缩放等几何变化面前比较脆弱,而语义嵌入对这些变化更鲁棒。先用便宜的哈希把明显的重复筛掉,再用贵一点的嵌入处理"看起来像但又不是完全一样"的难啃骨头,这个策略兼顾了速度和精度。研究团队还专门构建了一个376张图、70个重复组的评估集来挑选嵌入模型,最终在CLIP、OpenCLIP、MetaCLIP 2、SigLIP 2和SSCD五个模型里,SSCD综合表现最好。选型过程非常严谨,不是拍脑袋决定的。
表4:去重模型准确率对比
表4:去重模型的准确率对比,SSCD在F1分数上表现最优
第四步:LLM辅助生成描述(Captioning)。这一步是最"实验性"的。论文坦诚地把它定义为"实验性的LLM辅助生成描述",而不是"最终可信标注"。他们用Qwen2.5-VL-72B-Instruct等模型,为每个视觉元素生成了一段自然语言描述。但这不只是简单地把图丢给大模型,而是设计了复杂的提示词模板,结合了检测框、文本上下文、OCR内容等额外信息。整个数据集的描述加起来总共是766,992,447个o200k_base文本token。这个数字什么概念?如果按单个token大约0.75个英文单词估算,相当于5.75亿个英文单词的描述文本。不过论文非常谨慎,他们用困惑度(Perplexity,PPL)来衡量生成文本的质量:
困惑度公式
生成序列的困惑度计算公式,其中T为序列长度,p_g(x_t)为模型对第t个token的预测概率
困惑度越低,说明模型对生成内容的"信心"越高。但论文也承认,困惑度低不等于内容一定正确——模型可能非常有信心地说错。所以在数据集的字段设计里,他们专门区分了"直接来自原始材料的字段"和"生成/实验性字段",让下游用户自己判断信用度。所有描述内容都明确标注了来源语言和检测语言。
第五步:方向校正(Orientation Correction)。这一步的目标很朴素:把扫歪了的图转正。有些扫描件里的插图可能是侧着甚至倒着的,如果直接拿去训练模型,等于喂给模型大量"歪"的样本。方向校正模型在这里对这些图进行旋转修正。论文在附录里给出了训练报告,这个模型的介入让最终数据集的可用性提升了一个档次。
表5:方向校正模型准确率
表5:方向校正模型在测试集上各类别的准确率

节俭计算哲学:如何在有限算力下处理3.94亿页扫描

这篇论文最让龙哥佩服的地方,不是他们用了多豪华的算力,而是他们处处透着"精打细算"的克制。论文里明确提到,他们遵循frugal computing(节俭计算)原则——每个方法都从最小可行的干预开始,只有在必须提升数据质量时才增加计算开销。这种思路在动辄"暴力美学"的AI工业化流水线里,简直是一股清流。
以检测阶段为例,为什么用YOLO而不是视觉语言模型?说白了就一个字:贵。如果用VLM对3.94亿页做推理,计算成本会高到绝大多数图书馆都无法承受。而且YOLO这种240万参数的小模型,在精度上已经够用——测试集精确率0.95、召回率0.96。而VLM的通用性优势在这种版式高度规律的场景里反而用处不大。这里用实力证明了:不是所有任务都需要大模型,选对工具比选贵工具重要得多。
从实际运行数据来看,整个检测阶段耗时约16天,平均每批1000卷书需要22分47秒。但有意思的是,GPU推理只占了全部时间的9.8%,而89.5%的时间都花在了图像加载、解码、缩放等CPU和IO密集型预处理上。四块NVIDIA L40S GPU被严重喂不饱——理论上每块GPU每秒能处理152张扫描图,实际只有71张,只有理论吞吐的47%。数据准备,而不是计算本身,成为了最大的瓶颈。
这个现象在工业级CV流水线里太常见了。很多团队在优化模型结构上花大量精力,却忽略了数据管线的瓶颈。论文里诚实地把这个问题暴露出来,还详细量化了各环节耗时占比,这本身就是对社区的一种贡献。分类阶段就完全不同了,GPU推理占了55.7%的时间,因为输入是小图裁剪块,省掉了大量解码开销。两个阶段的瓶颈模式形成鲜明对比,很有教学意义。
还有一个有趣的细节:检测结果的分布极其不均匀。平均每卷书有25.3个检测结果,但中位数只有4个,最极端的一卷书检测出了5260个视觉元素——那是一本关于希腊罗马雕塑的艺术参考书,几乎每页都是图。论文作者引用了一个网络梗叫"Spider Georg",来形容这种极端值拉高平均值的现象。这种幽默感在学术论文里实属难得。
图3:密集插图卷示例
图3:馆藏中一个密集插图卷的示例,大量视觉元素紧邻排列,这类案例帮助团队调整了训练阈值
图4:检测框尺寸分布散点图
图4:检测裁剪框宽度与高度的散点图,可以看到大部分视觉元素集中在中等尺寸范围,也有少量接近整页的大尺寸插图

数据质量与偏差:历史文献数字化的深层挑战

任何一个大数据集,如果不谈偏差,那都是耍流氓。这篇论文最让龙哥觉得靠谱的地方,就是他们花了大量篇幅对数据质量、类别歧义、模型不确定性进行了认真分析。
分类模型的置信度分布很能说明问题。平均置信度0.966,中位数1.000,85.9%的预测落在0.95到1.00之间,只有0.3%低于0.50。表面上看,模型对自己"极其有数"。但如果深挖,会发现不同类别的自信程度差异非常大:Music和Image/Illustration的平均置信度分别高达0.994和0.974,而Ex Libris/Decorative平均置信度只有0.904。这背后的原因是藏书票、装饰性边框这类东西本身就充满了风格化变异,缺乏强归纳偏置,让模型难以形成稳定的判断。
还有一个典型的类别混淆案例:Ex Libris(藏书票)在视觉上经常与插图非常相似。论文里专门展示了一张带插图的藏书票设计比赛页面——从版面设计看,这是"Ex Libris",但从图像内容看,它又是"Image/Illustration"。分类器会在这两类之间左右摇摆,模型自己可能并没有"错",而是问题本身的边界就是模糊的。论文在数据集中保留了这种模糊性,让用户根据上下文自行判断,而不是强行给出一个确定答案。这种诚实是很多数据集不具备的。
图6:藏书票设计样例
图6:书中的Ex Libris设计样例。系统在Ex Libris和Image/Illustration之间产生了分类歧义,这些图虽然属于藏书票,但根据上下文被标注为插图
时间覆盖方面,论文还分析了含有视觉元素的图书的出版年份分布。
图:含有10个以上视觉元素的卷的出版年份分布
含有10个以上视觉元素的卷的出版年份分布,与纯文本数据集的对比显示,视觉元素数据集的年代分布更集中于19世纪中后期
这种"年代偏差"其实是历史文献数字化的一个内在属性——不同年代的技术条件、出版习惯、插图普及率差异很大。论文没有试图掩盖这种偏差,而是通过附录里的多项统计分析把它透明地呈现出来。做AI训练数据的人应该都懂:数据的"阴暗面"(bias、噪声、歧义)永远不会因为你不看就不存在,最好的策略是把它标注清楚,让下游用户自行决定如何处理。

开源共享:为图书馆与AI社区搭建桥梁

论文最核心的贡献之一,是把这个数据集和整套模型全部开源。Hugging Face上发布了数据集和模型集合,GitHub上发布了流水线源码。特别值得一提的是,项目里还附带了一个SKILL.md文件,专门用于支持智能体(agentic)使用——也就是说,未来的AI智能体可以直接通过这个接口高效地访问和利用这个数据集。
开源的意义远不止于"代码免费"。对于图书馆和博物馆这类知识机构来说,计算资源往往是稀缺的。哈佛团队把整套流水线设计成"节俭计算"模式,就是想告诉同行:不需要超级计算机,你也可以对自己的馆藏进行这种级别的视觉数据挖掘。论文中详细记录了各种训练参数、推理配置、耗时数据,甚至包括GPU利用率不足的教训,这些"踩坑日志"是同类论文里极少见的,对于想复现的团队来说价值极高。
从AI研究的角度看,这个数据集补上了一个关键拼图:当前视觉语言模型主要被互联网当代视觉文化训练,对历史内容理解能力有限。研究已经表明,VLM在处理历史内容时会出现性能下降、时间推理错误、文化时代错误等问题。而这个包含2260万元素、带有丰富元数据和多样语言覆盖的历史视觉数据集,可以帮助研究者系统性地评估和改善模型在历史内容上的表现。这正是论文提到的"良性循环":更多数据可用→更强的模型能力→解锁更多数据的处理→再产生更多数据。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?哈佛大学团队开源了一整套从历史书籍扫描页中检测、分类、去重和标注视觉元素的流水线,并从98.3万卷古书中提取出2260万个视觉元素,全部免费开放。这套方案贯彻“节俭计算”理念,四张GPU跑完全流程。
这篇工作最值得看的点是什么?检测和分类精度高(Precision 0.95/0.96,分类各类别F1在0.87-0.99之间),去重效果优于通用多模态编码器(SSCD F1 0.87 vs OpenCLIP 0.74),方向校正准确率91.34%。最终发布22,622,060个视觉元素数据集。
这篇工作的边界或风险在哪里?优点:(1) 端到端开源pipeline设计完整,各步骤模块化可独立重跑;(2) 采用节俭计算原则,从最小可行干预出发,计算开销可控;(3) 数据集规模大(2260万视觉元素),附带丰富元数据(分类、嵌入、描述、logprobs);(4) 对去重策略进行了系统比较(哈希vs嵌入vs交集);(5) 明确区分源数据、生成数据和实验数据,数据标注规范。缺点:(1) 描述生成依赖外部API(OpenAI),成本较高且不可完全复现;(2) 方向校正模型准确率91.34%仍有提升空间;(3) 分类中"Artifact"类定义宽泛,包含多种异质元素;(4) 去重采用哈希与嵌入交集策略可能漏掉部分近重复项;
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个端到端的开源pipeline,依次使用YOLO检测、YOLO分类、感知哈希与SSCD嵌入联合去重、GPT-4.1-nano生成描述,从近百万册历史书籍扫描页中提取、分类、去重并标注视觉元素。

实验合理度:★★★★☆

检测:Precision 0.95, Recall 0.96;分类:各类别Precision/Recall(Image/Illustration 0.98/0.97, Music 0.99/0.99等);去重:Precision 0.

学术研究价值:★★★★☆

构建一个端到端的开源pipeline,依次使用YOLO检测、YOLO分类、感知哈希与SSCD嵌入联合去重、GPT-4.1-nano生成描述,从近百万册历史书籍扫描页中提取、分类、去重并标注视觉元素;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

检测阶段约16天(4×L40S GPU,285 scans/s),分类阶段3天17小时(140 crops/s),嵌入/哈希阶段1天23小时(267 crops/s),描述生成6天22小时(47.

复现难度:★★★☆☆

https://github.com/institutional/institutional-books-visual-elements-pipeline

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。

主要参考文献

[1] Mendez, J., Cargnelutti, M., Lowry-Duda, D., Brobston, C., Ismail, S., Leppert, G., Watson, A., & Zittrain, J. (2026). Institutional Books — Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections. https://arxiv.org/pdf/2608.18957v1.pdf
[2] 项目主页:Institutional Books 数据集及模型(Hugging Face):https://huggingface.co/collections/institutional/institutional-books
[3] 开源代码(GitHub):https://github.com/institutional/institutional-books-visual-elements-pipeline
[4] Pizzi, E., et al. (2022). Self-Supervised Copy Detection. ICIP 2022.
[5] Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
小编刚把2260万张古书插图整理成文,正好缺一个你。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的同好,等你来一起"考古"AI新姿势。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。