论文标题:
ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering
发表日期:
2026年07月
发表单位:
Ant Group
原文链接:
https://arxiv.org/pdf/2607.16060v1.pdf
ArtChart的思路并不玄学,核心就是分层解决:先保住图的骨架,再修文字,再兼顾审美,最后把几种目标拧到一起。这个路线很像修车:先别急着喷漆,先把底盘和方向盘修正,否则外壳再漂亮,车也开不稳。图2:ArtChart框架。整体流程分成三步:第一步用图表专用控制模块保证结构和数值关系;第二步用强化学习优化文字准确性、布局和美观性;第三步用多专家蒸馏缓解多个奖励之间的冲突。第一阶段是图表专用数学控制模块。这里先把原始数据渲染成一张“无文字灰度图”,只保留柱子、扇区、面积这些几何骨架,不放标题、标签、刻度。这样做的好处很直接:模型先学会“图该长什么样”,而不是一上来就被花里胡哨的文字和装饰带偏。论文还说明了这里用了 ControlNet 这类条件控制思路,中文可以理解成“给生成模型加一个结构约束分支”。ControlNet 的英文全称是 Conditional Control for Text-to-Image Diffusion Models,中文可理解为“用于文生图扩散模型的条件控制”。这个模块的输入是两样东西:一是描述图表主题和风格的自然语言提示词(例如“一张关于2024年全球智能手机市场份额的柱状图,赛博朋克风格”),二是由数据直接渲染出的灰度结构图。灰度图本身不包含任何文字信息,但它精确地定义了每个柱子的位置和高度、每个扇区的起始角度和结束角度、每个数据点的坐标。ControlNet将灰度图作为额外的条件输入到扩散模型的U-Net中,通过复制编码器层并添加零卷积层的方式,让模型在生成过程中能够参考这个几何骨架。这样一来,无论后续的提示词如何引导艺术风格,生成图像的底层几何结构都被牢牢锁定在数据所规定的范围内。论文的实验表明,没有这个模块时,模型生成的柱状图中柱子高度与真实数据的平均绝对误差高达15%以上,而加入后误差骤降至3%以内。第二阶段是强化学习对齐。这一步的重点不是再去修大结构,而是盯住更细的错误:文字有没有写对,标签有没有贴错位置,图是不是还足够好看。论文这里用的是 GRPO,英文全称是 Group Relative Policy Optimization,中文可译为“组相对策略优化”。它的直觉并不复杂:一次生成一组候选图,再在组内比较谁更好,给更好的样本更高的更新权重。这样比只盯单张图打分更稳,也更适合图像生成这种“结果好坏差异很大”的任务。图5:训练数据构建过程。先由语言模型生成题目和数据,再扩写成完整提示词,然后渲染灰度结构图,最后用生成模型产出候选图并经过几轮过滤,保留结构、文字和可读性都过关的样本。这一阶段里,论文把奖励拆成了三类:OCR文字准确奖励、布局奖励、美观奖励。OCR就是 Optical Character Recognition,中文是“光学字符识别”,它负责检查图里文字是不是写对了;布局奖励则更像“老师拿尺子看标签贴哪儿了”;美观奖励则用偏好模型去判断图是否真的好看。这里最关键的不是奖励本身,而是它们彼此会打架:只追求文字准确,图可能变得死板;只追求美观,文字又可能糊成一团。论文明确承认了这个矛盾,没有装作所有目标都能自然兼容。GRPO的具体工作流程如下:对于每个输入提示和对应的灰度结构图,模型会生成K张候选图像(论文中K=8)。然后,对每张候选图像,分别计算OCR奖励、布局奖励和美观奖励。OCR奖励通过一个预训练的OCR引擎(如PP-OCR)提取图像中的所有文本,并与真实标签进行精确匹配,计算字符级准确率。布局奖励则通过一个目标检测模型(如DETR)定位图像中的文本区域和图形元素区域,计算文本中心到其对应图形元素中心的距离,距离越小奖励越高。美观奖励使用一个在大规模美学偏好数据上训练好的评分模型(如LAION美学预测器)直接对图像的整体视觉质量打分。在得到K张图像的三个奖励值后,GRPO计算每个奖励在组内的均值和标准差,然后用每个图像的奖励值减去均值再除以标准差,得到归一化的优势值。最后,模型根据这些优势值来更新参数,使得生成高优势值图像的策略被加强,生成低优势值图像的策略被削弱。这种组内相对比较的方式,有效避免了不同奖励函数尺度不一致带来的训练不稳定问题。第三阶段是多专家蒸馏。论文的判断很实在:把多个奖励直接加权求和,通常会出现“顾此失彼”的跷跷板效应。于是它先分别训练三个单项专家,等每个专家在自己的指标上跑到较高水平后,再把这些专家的能力蒸馏到一个学生模型里。这里的关键不是“谁都学一点”,而是让学生模型在训练时就看见不同专家的最优方向,尽量减少互相拉扯。多专家蒸馏的具体实现被称为OPD(Optimized Preference Distillation)。首先,论文基于同一个基础扩散模型,分别使用三个不同的奖励函数进行GRPO训练,得到三个专家模型:Expert_OCR(在OCR奖励上表现最优)、Expert_Layout(在布局奖励上表现最优)和Expert_Aesthetic(在美观奖励上表现最优)。这三个专家模型各自在自己的专长领域达到了很高的水平,但会在其他领域有所牺牲。例如,Expert_OCR生成的图表文字极其准确,但整体风格可能偏向单调;Expert_Aesthetic生成的图表非常漂亮,但文字错误率可能较高。然后,论文将这三个专家模型作为教师,训练一个新的学生模型。蒸馏过程不是简单地让学生模型模仿教师模型的输出像素,而是通过一种偏好对齐的方式:对于同一个输入,学生模型生成一张图像,三个教师模型分别对该图像进行评分,学生模型的目标是最大化三个教师模型评分的加权和。同时,为了保持学生模型自身的多样性,训练中还加入了一个KL散度正则项,防止学生模型过度拟合到教师模型的平均输出。这种“先专精、再融合”的策略,比直接用一个加权奖励函数训练单一模型效果更好,因为它避免了在训练初期就让多个冲突的目标互相干扰。图3:失败类型分类。论文把艺术图表常见问题分成四类:数学逻辑错误、文字内容错误、文字布局错误、视觉风格与可读性错误。这个分类很重要,因为它决定了后面的训练和评估都不会只盯着单一指标。从工程角度看,这套方法最聪明的地方不在“用了多少模块”,而在于模块之间的职责分得很清楚:控制模块管几何,强化学习管文字和布局,多专家蒸馏管冲突协调。很多生成类论文的问题就是“一个模型想干所有活”,最后谁都没干好。ArtChart至少没有在这个老坑里继续跳舞。
Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma. ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering. arXiv:2607.16060v1, 2026.Zhang, L.; Rao, A.; and Agrawala, M. 2023. Adding Conditional Control to Text-to-Image Diffusion Models. ICCV.Black, K.; Janner, M.; Du, Y.; Kostrikov, I.; and Levine, S. 2024. Training Diffusion Models with Reinforcement Learning. ICLR.Fan, Y.; Watkins, O.; Du, Y.; Liu, H.; Ryu, M.; Boutilier, C.; Abbeel, P.; Ghavamzadeh, M.; Lee, K.; and Lee, K. 2024. DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models. NeurIPS.