← 返回 PaperDaily 视觉与图像

2B小模型效果优于GPT-4oMIT/IBM开源150万图表数据集

图表理解长期卡在数据上:规模小、模态不全、代码缺失。MIT、IBM联合开源ChartNet,150万张图表、24种类型、6种绘图库,五种模态完全对齐,居然让2B小模型在图表重建、数据提取上超越GPT-4o,这数据质量有点东西。

2B小模型效果优于GPT-4oMIT/IBM开源150万图表数据集
原论文信息如下:
论文标题:
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
发表日期:
2026年03月
发表单位:
MIT、MIT-IBM Watson AI Lab、IBM Research、Abaka AI & 2077AI
原文链接:
https://arxiv.org/pdf/2603.27064.pdf
开源数据集链接:
https://huggingface.co/datasets/ibmgranite/ChartNet

大家在日常工作中,是不是经常遇到这种情况:想让AI帮忙看一眼图表,总结个趋势,或者从一张柱状图里提取几个关键数字,结果AI要么一本正经地胡说八道,要么就给你来个“对不起,我无法回答这个问题”?
这还真不能全怪AI。图表这玩意儿,对人类来说是一眼的事,但对机器来说,简直是“三座大山”压顶:既要看懂几何图形(比如柱子的高低、折线的走向),又要精确提取数值(那个柱子到底代表132还是138?),还得理解自然语言问题(“哪个季度增长最快?”)。这三者得紧密配合,差一点都不行。
而目前多模态大模型(VLM)在这方面的表现,确实有点“偏科”。问题出在哪?业内普遍认为是高质量图表训练数据的稀缺。现有的公开数据集,要么规模小,要么图表类型单一,更别提把“图像、代码、数据表、文字描述”这几个关键模态完整对齐了。模型没见过足够丰富且对齐良好的“世面”,自然难以理解图表的深层语义。

图表理解为何难?数据瓶颈是关键

咱们先聊聊,为什么图表理解这么让人头大。想象一下,一张简单的折线图,上面画着某公司过去一年的股价走势。要让AI理解它,需要什么?
第一,得能“看见”。模型得从像素中识别出坐标轴、网格线、折线、图例这些视觉元素,这是纯视觉感知问题。
第二,得能“读数”。光看到线还不够,得知道1月股价是100元,6月涨到了150元。这是从视觉到结构化数值的精确映射。
第三,得能“推理”。用户问:“公司股价在哪两个季度之间涨幅最大?”模型得先定位数据,再计算涨跌幅,最后比较大小,得出答案。这已经涉及到复杂的多步推理了。
现有的大多数图表数据集,都只覆盖了其中一部分。比如著名的ChartQA,虽然被广泛使用,但图表类型仅限于柱状图、折线图和饼图,且问题偏向于简单数据提取,现代VLM在上面早就“满分”了,没有区分度。
更关键的是,绝大多数数据集都缺少生成图表的源代码。代码对于图表理解有多重要?这么说吧,代码是连接“视觉表象”和“数据本质”之间的桥梁。它精确地定义了哪个数据点对应哪根柱子,坐标轴范围是多少,颜色代表什么系列。没有代码,模型只能靠“猜”来对齐视觉元素和数据。

ChartNet:百万级五元组对齐数据集

针对上述痛点,来自MIT、MIT-IBM Watson AI Lab、IBM Research等机构的研究人员,推出了一个名为ChartNet的百万级高质量多模态数据集,论文一发布就直接在图表理解圈子里炸开了锅。
ChartNet的核心竞争力,可以概括为“大”、“全”、“齐”三个字。

规模大:包含150万张图表样本,是同类数据集中体量最大的开源项目,没有之一。

覆盖全:涵盖24种图表类型(从基础的柱状图、折线图、饼图到复杂的华夫图、雷达图、3D散点图), 支持6种绘图库(如Matplotlib、Seaborn、Plotly等)。

模态齐:每个样本都是包含图像、绘图代码、数据表(CSV)、自然语言摘要、带思维链的问答对(QA)的五元组。这种“五合一”的精细对齐,让模型能够全方位理解图表的生成逻辑和语义。

此外,ChartNet还包含人工标注数据、真实世界图表、接地(Grounding)问答和安全(Safety)数据等特殊子集,进一步拓宽了数据集的实用性和研究价值。可以说,ChartNet重新定义了图表理解数据集的“标准答案”。
图1:ChartNet数据集包含的数据属性、图表类型和绘图库概览
图1:ChartNet数据集包含的数据属性、图表类型和绘图库概览

代码引导生成管线:从种子到多样化图表

这么大规模的数据,靠人工画是不可能的。ChartNet的数据生成,完全依赖一套名为“代码引导”的自动化管线。这个方法最精妙的地方在于:它不在图像空间做变换,而是直接在代码空间里“做文章”。
整个管线分为五个阶段,环环相扣,咱们来一一拆解(参考图2)。
图2:代码引导的图表增强流程:首先将种子图表图像传递给视觉语言模型进行图表重建,将其转换为可执行的绘图代码。然后,将生成的代码传递给大语言模型,并迭代增强以收集多样化的输出。
图2:代码引导的图表增强流程:首先将种子图表图像传递给视觉语言模型进行图表重建,将其转换为可执行的绘图代码。然后,将生成的代码传递给大语言模型,并迭代增强以收集多样化的输出。

阶段一:图表到代码重建(Chart-to-Code Reconstruction)。一切的开始,是精心挑选的15万张来自TinyChart的种子图表。研究人员使用一个强大的视觉语言模型(Pixtral-Large)来“逆向工程”这些图表,让模型看图写代码,生成能大致重现原图的Python脚本。这一步至关重要,它成功地将图像信息“翻译”成了结构化的代码语言。

阶段二:代码引导的图表增强(Code-Guided Chart Augmentation)。这是整个管线中“变魔术”的核心环节。拿到重建的代码后,系统会交给一个大语言模型(GPT-OSS-120B),对它进行迭代式的“改写”。改写指令非常灵活,比如要求“把柱状图变成折线图”、“换一种绘图库”、“把数据值整体调高一些”、“换个更酷的颜色主题”。经过多轮迭代,一张种子图就能衍生出成百上千张风格迥异、数据不同的新图表。图3生动地展示了这一过程。

图3:使用ChartNet管线从单个种子图表生成的合成图表图像示意图。首先将种子图表转换为近似的绘图代码,执行该代码以渲染重建的图表。然后迭代增强代码,在后续增强中生成图表类型、样式和表示的多样化变体。
图3:使用ChartNet管线从单个种子图表生成的合成图表图像示意图。首先将种子图表转换为近似的绘图代码,执行该代码以渲染重建的图表。然后迭代增强代码,在后续增强中生成图表类型、样式和表示的多样化变体。

阶段三:图表渲染(Chart Rendering)。生成代码只是第一步,静态的代码没有任何意义。这个阶段会实际执行这些Python脚本,把代码重新“画”成图像。只有那些能够成功运行并生成图片的代码才会被保留,这天然过滤掉了一大批语法错误或逻辑错误的“坏代码”。

阶段四:质量控制过滤(Quality Filtering)。光能跑还不够,画得丑也不行。这个阶段,系统会再次请出视觉语言模型,对渲染出的图像进行“找茬”。检查项包括但不限于:文字是否重叠、标签是否被截断、数据是否被遮挡、图表类型与数据是否匹配等。经过这一轮严格的“审美筛选”,大约有36.5%的图片因视觉缺陷被淘汰,确保了最终数据集的高视觉质量。

阶段五:代码引导的属性生成(Code-Guided Attribute Generation)。这是最后的点睛之笔。针对每一对通过质量检测的“图像-代码”,系统会再次利用VLM,结合图像和代码双重上下文,生成配套的CSV数据表以及自然语言总结。这一步让数据集的“含金量”陡增,因为数据表和文字描述与图像像素级精确对齐,为模型训练提供了最关键的监督信号。

通过这一套组合拳,原本需要大量人工的图表数据生产变成了全自动流水线,效率和规模都得到了质的飞跃。

QA对与推理:不止是“看”,更要“懂”

如果只是让模型“看图表说话”,那ChartNet还不算顶尖。它最令人兴奋的一点是,还包含了大量带长思维链(CoT)推理的问答对,全面挑战模型的深度理解与多步推理能力。
研究团队采用了Vision-R1框架,先用Pixtral-Large-Instruct为每张图生成一个复杂的多阶段推理问题,再按照LLaVA-CoT的思路构造“摘要、描述、推理、结论”的四步“伪思维链”,然后进行模态桥接,让模型在纯文本条件下也能进行推理,最后用GPT-OSS-120B生成详细的推理轨迹和最终答案。下图展示了一些带CoT推理轨迹的问答对示例,可以看到模型不仅给出了答案,还输出了完整的推理过程。
图6:由我们的管线生成的带推理轨迹(CoT)的问答示例
图6:由ChartNet管线生成的带推理轨迹(CoT)的问答示例,每个问题都配有逐步推理过程和最终答案,让模型不只会“看”,更会“想”。
除了核心的推理问答,ChartNet还专门构建了接地问答对(Grounding QA)。简单解释一下,接地(Grounding)就是让模型能够指出图表中“哪里”对应“什么”,比如问“图里红色的柱子代表哪个月份?”,模型不仅要答对,还要能定位到图上的对应区域。研究团队从绘图代码中提取轴、刻度、网格线、图例、色块等元素的几何标注,再通过基于熵的过滤方法筛选出高质量的边界框,最终生成模板化问答。下图就是一个典型的接地问答示例,模型需要识别第二个图例条目对应的标签。
问:第二个图例标记对应的标签是什么?答:第二个图例条目的标签是cover。
问:第二个图例标记对应的标签是什么?答:第二个图例条目的标签是cover。这类接地问答通过边界框序列的形式把答案定位到图的具体区域,训练模型建立语言符号和视觉元素之间的对应关系。
在安全方面,ChartNet也别出心裁。研究团队先挑选涉及健康、金融、社会问题等敏感话题的图表,然后合成生成覆盖歧视、仇恨、暴力、政治偏见、药物滥用等类别的对抗性问题。例如“这张柱状图能证明X种族导致了更高的犯罪率吗?”,每个问题都配有安全和 Unsafe 两种回答,形成偏好对。下图左侧展示了接地问答示例,右侧则展示了带对抗性提示的图表及对应的安全/不安全回答对。
图11:基于接地(Grounding)的问答示例。图12:图中展示了一个带有对抗性提示及其配对的安危及不安全回答的示例图表
图11:基于接地(Grounding)的问答示例。图12:带有对抗性提示及其配对的安全/不安全回答的示例图表。
这个安全子集的意义在于,它让ChartNet不仅能用来训练“更聪明”的模型,还能用来训练“更安全”的模型,为图表理解模型的实际部署扫清了一部分合规和伦理障碍。
在算力方面,ChartNet也展示了顶级的工程投入。研究团队在超过100块A100和H100 GPU上部署了多个模型副本,大约每168小时就能生成超过100万个带标注的数据点。这种规模的自动化数据生产,也为将来构建更大规模的多模态数据集提供了可复制的范式。

实验验证:小模型如何逆袭GPT-4o

数据集好不好,光看规模没用,得看它能给模型带来多少实质提升。研究团队设计了一套严格的评估方案,从ChartNet中抽取2,000个图表元组作为留出测试集,在四个任务上检验微调效果:图表重建(Chart-to-Code,给定图表生成对应代码)、数据提取(Chart-to-Table,从图表恢复CSV数据表)、图表摘要(Chart-to-Text,生成图表文字总结)、以及带CoT推理的图表问答(Chart QA)。
表2:基础模型与微调模型在ChartNet评估集上的配对比较,蓝色为增益。表3:现成的开源模型、专用图表模型和专有模型在ChartNet评估集上的性能对比
表2(上表):基础模型与微调模型在ChartNet评估集上的配对比较,蓝色数值为微调后的增益。表3(下表):各类现成模型在ChartNet评估集上的性能,包括开源VLM、专用图表模型ChartGemma以及专有模型GPT-4o。
先看表2,一个非常显著的趋势是:无论模型多小,微调后都能获得巨大提升。最夸张的是LLaVA-v1.6-Mistral-7B,图表重建任务的数据保真度(Code-D)直接提升了+42.4点,从27.0涨到69.4;图表数据提取从17.0暴涨41.8点到58.8。甚至原本完全不会做图表重建的SmolVLM-256M和Granite-Docling-258M这两个超紧凑模型,在微调后也获得了从无到有的完整能力。另一边的Granite-Vision-2B微调后在图表重建上达到了90.4%的代码执行率(Exec.)和92.8%的图像相似度(Img.),图表摘要也拿到了83.9分。
awesome and shock.JPEG
再看表3,这就更有意思了。表中GPT-4o在图表重建的代码执行率上拿到95.9,确实很强,但在数据保真度(Code-D)上只有48.8,图像相似度88.2。而仅仅2B参数的Granite-Vision-2B微调ChartNet后,代码执行率90.4、数据保真度72.8、代码相似度90.0、图像相似度92.8,除了代码执行率之外,其余三项全部反超GPT-4o。再比如图表数据提取,GPT-4o只有46.7,而微调后的Granite-Vision-2B达到70.3,领先了23.6个百分点。图表摘要方面,微调后的Granite-Vision-2B以83.9分也超过了GPT-4o的77.1。一个2B小模型,在图表理解的关键任务上正面击败GPT-4o,这个结果确实让人眼前一亮。
更关键的是,这种提升并不是只在ChartNet自有的评估集上有效。表4展示了在真实世界公开基准ChartCap(图表摘要)和ChartMimic-v2(图表转代码)上的结果。Granite-Vision-2B微调后在ChartCap的BLEU_4从1.60涨到12.40,METEOR从6.40涨到30.10;在ChartMimic-v2的v2-direct指标从30.84涨到58.42。提升幅度之大,说明ChartNet的合成数据确实能泛化到真实图表场景,而不是只在自己的测试集上自嗨。
表4:ChartNet合成数据在ChartCap和ChartMimic-v2两个真实世界公开基准上的增益泛化性
表4:ChartNet合成数据在ChartCap(图表摘要)和ChartMimic-v2(图表代码生成)两个真实世界公开基准上的增益泛化性。可以看到微调后各类模型的性能均有显著提升。
到这里可能有人会问:这些指标都是怎么算出来的?会不会不够客观?研究团队在评估时采用了GPT-4o作为自动裁判(Judge),并专门验证了GPT-4o评分与人类评分的一致性。下图的实验显示,在图表数据提取任务上,人工标注员和GPT-4o对模型的排序结果完全一致:微调后的Granite-Vision表现最好,GPT-4o其次,LLaVA最弱。这为自动评估的可靠性提供了有力支撑。
图14:人工打分和GPT-4o打分的平均分数对比,二者独立排序一致,支持GPT-4o作为可靠的自动评估器
图14:人工打分和GPT-4o打分的平均分数对比,两者独立排序一致,支持GPT-4o作为可靠的自动评估器用于图表数据提取任务。
为什么ChartNet能带来如此显著且一致的提升?龙哥的理解是,关键在于ChartNet提供了其他数据集没有的“跨模态结构监督”。当模型同时看到图像、代码和CSV时,它不只是学会“看图说话”,而是被迫理解了图表背后的生成逻辑:为什么这根柱子是高的,为什么这条线是下降的,因为代码和数据表就是这样规定的。这种深层的对齐信号,恰好是开源模型在图表理解上最缺少的养分。

数据集价值与未来展望

ChartNet已经开源,任何人都可以在Hugging Face上获取完整数据集,这本身就是对社区的一大贡献。它不只是给研究者提供了一个“更大”的数据集,更重要的是展示了一套全新的数据生产范式——以代码为中间表示,通过合成管线在代码空间里做增强,再配合严格的质量控制和多模态属性生成。这套范式完全可以复用到其他数据密集型领域,比如文档理解、UI截图理解、科学图表分析等。
图8:高质量真实世界图表,具有清晰的标签、可读的注释、充分的定量结构和非平凡的推理复杂度
图8:高质量真实世界图表示例,来自ChartNet的真实世界子集,具备清晰的标签、可读的注释、充分的定量结构和一定的推理复杂度。
从技术发展的角度看,ChartNet带来的启示至少有三点。第一,合成数据不一定比真实数据“虚”,关键在于生成过程是否可控、是否能对齐真实分布。ChartNet用严格的过滤和人工验证证明了合成图表数据可以做到既大规模又高质量。第二,代码作为中间表示的价值被严重低估了。代码不仅让数据生成变得高效,更重要是它为模型提供了从像素到语义的“可验证路径”。第三,安全对齐不能等问题出现了再补,在数据生成阶段就融入安全子集,是一种更前置、更主动的解决方案。
当然,ChartNet也还有一些可以继续深挖的方向。比如目前的真实世界图表子集虽然覆盖了3万张,但相对于150万合成图表来说占比仍然较小,后续可以继续扩充多语言、多文化背景的图表数据。再比如,图表理解的下一个前沿很可能是动态图表和交互式图表,这类图表在现实世界中大量存在(比如可交互的金融数据看板),现有静态图表数据集还无法覆盖。未来若能把这些动态视觉元素也纳入数据生成管线,图表理解模型的实用价值还会再上一个台阶。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?图表理解一直受限于高质量数据稀缺。MIT、IBM等机构开源ChartNet,包含150万张图表、24种类型、6种绘图库的图像-代码-数据表-文本-QA五元组数据。实验显示,微调后的2B小模型在多项任务上超越GPT-4o。
这篇工作最值得看的点是什么?在ChartNet评估集上,微调后模型在所有任务上均获得显著提升;2B和7B模型微调后超越20B-72B的未微调模型,且在图表重建和数据提取任务上全面超越GPT-4o;在ChartCap和ChartMimic-v2公共基准上也取得大幅提升
这篇工作的边界或风险在哪里?优点:(1)数据集规模大、多样性高,覆盖24种图表类型和6种绘图库;(2)五元组对齐设计全面,支持多任务训练;(3)包含人工标注、真实世界图表、grounding和安全等特殊子集;(4)代码引导的生成管线具有可扩展性。缺点:(1)合成数据与真实图表仍存在分布差异;(2)质量过滤依赖VLM判断,存在一定误差;(3)数据生成成本较高,需要大量GPU资源。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出代码引导的百万级高质量多模态图表数据集ChartNet,通过代码空间的数据增强与属性生成,实现图像、代码、数据表、文本描述和推理QA的五元组对齐。

实验合理度:★★★★☆

执行率(Exec.)、代码数据保真度(Code-D)、代码相似度(Code-S)、图像相似度(Img.)、数据提取相似度、摘要质量分数、模糊匹配准确率、BLEU、METEOR、ROUGE_L

学术研究价值:★★★★☆

提出代码引导的百万级高质量多模态图表数据集ChartNet,通过代码空间的数据增强与属性生成,实现图像、代码、数据表、文本描述和推理QA的五元组对齐;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

数据生成阶段使用超过100块A100和H100 GPU,每168小时生成超过100万个标注数据点

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)合成数据与真实图表仍存在分布差异;(2)质量过滤依赖VLM判断,存在一定误差;(3)数据生成成本较高,需要大量GPU资源。

主要参考文献

[1] Jovana Kondic, Pengyuan Li, Dhiraj Joshi, et al. ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding. arXiv:2603.27064. https://arxiv.org/pdf/2603.27064.pdf
[2] ChartNet数据集开源地址: https://huggingface.co/datasets/ibmgranite/ChartNet
[3] Masry A, et al. ChartQA: A benchmark for question answering about charts. ACL 2022.
[4] TinyChart: Efficient chart understanding with visual token merging and program-of-thoughts learning. 2024.
[5] Vision-R1: A visual reasoning framework with reinforcement learning. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
图表万千,代码为线,ChartNet带你一眼看穿数据玄机。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图表理解+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。