论文标题:
Institutional Books — Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections.
发表日期:
2026年08月
发表单位:
Harvard Law School Library, Harvard Library, Harvard Law School, Harvard School of Engineering and Applied Sciences, Harvard Kennedy School
原文链接: https://arxiv.org/pdf/2608.18957v1.pdf
如果让一个从来没出过村的老学究,突然面对整个互联网的图片,他会怎么看世界?大概率是懵的。反过来,如果把全世界最聪明的AI模型扔进一座百年图书馆,让它只看一堆发黄的书页扫描件,它也会懵。这不是比喻,而是眼下多模态大模型真实的窘境——它们被互联网上的当代视觉文化"喂"大了,对历史内容是真正的"水土不服"。比如给模型看一幅19世纪的版画,它可能分不清这是照片还是手绘,看不懂藏书票的用途,更别提理解那些扫描过程中意外拍进去的手指头、金属夹子到底是什么鬼。而哈佛这帮人,偏要把这个难题啃下来。他们搞了一个叫 Institutional Books — Visual Elements 的开源流水线,从哈佛图书馆的 Google Books 扫描数据里,硬生生挖出了2260万个视觉元素,还配套了检测、分类、去重、描述的一整套模型和工具链。论文的标题很朴素,但数据量一点不朴素:983,004卷书、3.94亿页扫描、2260万张插图,外加7.66亿个文本token的描述数据。这套流水线把"古书里的图"变成了AI能直接吃进去的结构化数据。
历史书页中的视觉宝藏:一个2260万元素的提取流水线
先交代一下背景。Institutional Books 是哈佛图书馆和哈佛法学院图书馆等机构联合推动的项目,目标是把图书馆里那些进入公共领域的图书,变成大规模、高质量、可供计算访问的语料库。之前他们已经发布过包含242B token的图书文本数据集,这次的工作相当于给这个文本宇宙加了一层"视觉维度"。论文的核心逻辑其实很简单:OCR(光学字符识别,Optical Character Recognition)技术已经非常成熟,能把书页上的文字标准化提取出来,但那些插图、照片、版画、装饰图案、乐谱,长期以来都是"被数字化遗忘的角落"。这些视觉元素恰恰承载了文字无法表达的丰富信息——19世纪的科学绘图、维多利亚时代的藏书票、战争时期的讽刺漫画,都是那个时代视觉文化的直接证据。于是他们做了这么一件事:把整个哈佛馆藏的Google Books扫描数据,将近400万页,全部过了一遍计算机视觉流水线。最终结果是一个包含22,622,060个视觉元素的数据集,每个元素都带有类别标签、图像嵌入向量,以及实验性的LLM生成描述。整个数据集在Hugging Face上开源,代码在GitHub上公开。换句话说,这不是一篇"纸上谈兵"的论文,而是一套已经跑完3.94亿页的、可复现的、完整的工业级流水线。图5:后处理过滤后各类别占比饼图,其中"Image/Illustration"占68.0%,"Artifact"占9.2%,"Ex Libris/Decorative"占7.0%,"Chart/Graph"占6.2%,"Music"占5.3%这里要特别提一句,论文里把那些扫描过程中混进去的手指头、金属夹子、条形码、碎页等东西归为一个叫"Artifact"的类别。这个类别占了9.2%。别小看这个数字——这恰恰说明这套系统不是只在干净数据上自嗨,而是真实面对了数字化过程中的各种脏数据,并且把它们也诚实地标注了出来。
[1] Mendez, J., Cargnelutti, M., Lowry-Duda, D., Brobston, C., Ismail, S., Leppert, G., Watson, A., & Zittrain, J. (2026). Institutional Books — Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections. https://arxiv.org/pdf/2608.18957v1.pdf[2] 项目主页:Institutional Books 数据集及模型(Hugging Face):https://huggingface.co/collections/institutional/institutional-books[3] 开源代码(GitHub):https://github.com/institutional/institutional-books-visual-elements-pipeline[4] Pizzi, E., et al. (2022). Self-Supervised Copy Detection. ICIP 2022.[5] Radford, A., et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. ICML 2021.