← 返回 PaperDaily 视觉与图像

复旦携手小红书最新:给文字渲染装上“定位锚”,生成长文准确率暴涨10.3%

让AI准确渲染又长又密的文字,是图像生成的“最后一公里”。复旦携手小红书放出一招“位置锚定”新设计,把文字准确率直接拉高一大截,海报再密也不怕了。

复旦携手小红书最新:给文字渲染装上“定位锚”,生成长文准确率暴涨10.3%
原论文信息如下:
论文标题:
GlyphAnchor: Enhancing Visual Text Rendering via Position-Anchored Glyph Priors
发表日期:
2026年9月
发表单位:
复旦大学、小红书、上海创智学院
原文链接:
https://arxiv.org/pdf/2609.02349v1.pdf

1 文字渲染之痛:当AI画不好“字”时,我们该怎么办?

GlyphAnchor图文生成效果对比 图1:GlyphAnchor在文字密集场景下的生成效果,字体清晰、排版准确、风格统一。 很多人可能都有过这样的体验:想让AI画一张带中文标语的海报,或者生成一张布满小字的通知截图,结果出来的图,乍一看挺美,仔细一瞧,上面的字全在“胡说八道”。 要么是笔画多了几横,要么是好好的汉字凭空多出一个偏旁,更离谱的是,一句完整的话被拆得七零八落,字和字之间还会“串门”。这种在生成图像里准确“写字”的能力,学术上叫视觉文本渲染,一直是文生图、图生图模型最难啃的硬骨头之一。 为什么难?因为文字这东西和普通图像内容完全不同。画一只猫,哪怕耳朵歪一点、毛色深一点,大家都能看出来是猫;但写一个“龍”字,少一横它就是错别字。尤其当目标文本变长、排版变密,甚至出现不常用的生僻字时,模型的注意力根本顾不过来,字体结构稍一模糊,就直接“摆烂”给你编一个不存在的字。 最近,复旦大学与小红书的研究团队提出了一种名为GlyphAnchor的新方法,专门解决这个痛点。思路很有意思:既然光靠提示词让模型“脑补”字形不靠谱,那就直接把每个目标文字的“标准字形小抄”喂给模型,并告诉它这些小抄分别应该贴到画面的哪个位置。给模型开卷考,文字准确率自然就上去了。
一、问题的根源:模型为什么总是写错字 要想理解GlyphAnchor做了什么,得先搞清楚现有模型在文字渲染上到底栽在哪里。 目前主流的扩散Transformer模型,比如Qwen-Image、Z-Image等,处理文字的方式和人类不一样。它们不是像打字机那样一个字一个字地拼出文本,而是把整个提示词编码成抽象的特征向量,再结合视觉噪声,在去噪过程中一步步“猜”出画面内容。对于普通物体,这种“猜”足够用了;但对于文字这种需要精确到每一笔的结构,光靠提示词里的语义信息远远不够。 打个比方,你让一个只听过“龙”字读音、却从没见过字形的人去写这个字,他大概率会画出一个四不像。现有模型面临的就是这种窘境。之前也有研究尝试把渲染好的字形图片直接拼到输入里,希望能给模型一点提示,但往往效果不甚理想:要么把字形图处理成一张和最终画面一样大的“大字报”塞进去,导致信息冗余、风格被带偏;要么只给零散的字形小图,却不告诉模型该往哪里放,最终模型依然抓瞎。 图2清晰展示了这几种设计思路的差异。默认仅靠提示词驱动(a),文字基本是乱码;把整页字形渲染图作为参考输入(b),虽然文字能对上,但画面风格却变得呆板,背景细节也丢失严重;只给字形补丁不给位置(d),文字依然错漏百出。GlyphAnchor的方案(e)则在字形补丁之外,额外标注了每个文本块在画布上的目标位置框,让模型既知道“写什么”,也清楚“写在哪”。 GlyphAnchor不同设计选择对比 图2:多种字形条件注入设计的对比。(a)仅提示词;(b)全画布字形参考;(c)渲染字形补丁训练;(d)字形补丁无位置锚定;(e)字形补丁加位置锚定;(f)不同文本量下字形补丁的token开销比例。
二、方法概述:位置锚定的字形先验 GlyphAnchor的完整流程设计得相当巧妙。它并不要求推翻现有的扩散Transformer模型,而是在原有模型的基础上,额外增加一条轻量级的输入通路。 具体来说,对于提示词中需要渲染的每一段目标文本,系统会先用一个字形渲染器把这段文字画成一张紧凑的小图片,这张图可以是黑底白字的,也可以是带透明通道的。然后,通过视觉编码器把这张小图编码成视觉token。这些token并不会被随意地拼接在序列末尾,而是会被放置到一个虚拟的字形平面上,并且每一个token的位置ID都会根据其对应的文本布局框,重新映射到目标图像的潜在空间坐标上。 这套机制的核心在于利用了模型原生的旋转位置编码。因为位置ID与最终生成图像的坐标网格精确对齐,模型在处理这些字形token时,就能自然地建立起“这个字形应该出现画面中哪个区域”的空间对应关系。同时,由于整个过程只是改变了token的位置ID,并不改动注意力矩阵的计算方式,FlashAttention等高效注意力算子依然可以正常使用,推理效率没有打折扣。 这么设计有哪些好处?首先,字形补丁的视觉token数量非常少。一篇包含上千个汉字的海报,字形补丁所占用的token数也只有全画布字形参考图的三成左右,算力开销增长有限。其次,由于是即插即用的输入条件,GlyphAnchor可以很方便地适配到不同的扩散Transformer模型上,不需要为每个模型重新设计复杂的控制模块。 GlyphAnchor整体架构 图3:GlyphAnchor方法总览。提示词、可选源图和渲染后的字形补丁图被编码成token,一起送入扩散Transformer主干;字形token被放到额外的条件帧中,其坐标锚定到目标文本布局位置。
三、核心原理推导:训练策略中的门道 GlyphAnchor虽然设计简洁,但训练过程并非一帆风顺。研究团队发现了一个很容易被忽视的训练与推理不一致问题:在训练阶段,模型其实是可以看到最终的正确答案的。 如果把目标图像中某个文字区域完整地裁剪下来作为字形条件,那模型相当于在做“抄写”练习,学到的只是把输入补丁复制粘贴到输出位置,而不是真正理解文字与场景风格的关系。一旦到了推理阶段,系统没法提前拿到真实图像里的文字块,只能用渲染出来的规整字形图,模型马上就不会玩了。但如果训练时就直接用渲染的字形图,模型又学得不够扎实,因为模拟输入和真实生成目标之间总存在差距。 为此,团队提出了一种分阶段的微调方案。在训练初期,更多的让模型看真实图像的文字裁剪块,快速建立文字样式与场景融合的映射关系;随着训练推进,逐渐增加渲染字形图的比例,让模型逐步适应推理阶段的实际输入分布。同时,团队还对渲染的字形图做了大量的数据增强,比如随机换行、缩放、旋转、平移和随机丢弃,防止模型单纯地死记硬背字形图的像素外观,真正学到文字的结构化特征。 在分阶段微调之后,模型在简单场景下已经能写对字了,但在长文本和生僻字的情况下还是会出现整体崩溃的风险。研究团队又引入了基于强化学习的后训练环节,设计了一套专门针对文字生成的多维度奖励函数。除了常规的OCR编辑距离打分之外,团队还巧妙地设计了文本布局一致性奖励,不仅关注文字识别是否正确,还要用OCR把生成图和参考图中的字符实例都检测出来,并比较每一对匹配字符的中心位置偏移和大小差异。只有当文字整体识别得分超过一定门槛时,布局约束项才会被激活,避免模型为了追求OCR得分而输出超出边界的大字体。 同时,为了让生成的文字在艺术风格上不突兀,方法还引入了两个由多模态大模型评判的奖励项:风格一致性奖励,衡量生成文字的字形风格与排版和原图是否匹配;视觉融合奖励,评估文字与其周边背景、材质和光影是否自然过渡。 GlyphAnchor生成结果展示 图1(前页):GlyphAnchor面对复杂中英文混排的海报、菜单、文章页面等场景,均生成了排版得当、文字清晰的画面。
四、数据准备及实验设计 为了让模型真正适应“文字密集”的真实世界场景,研究团队还专门构建了一个用于评测和训练的文字信息型图像基准——InfoTextBench。这个基准包含133个样本,每个样本都配有中英文两版提示词。样本内容全部来源于真实世界收集的文字信息图像,包括海报、通知、产品说明、杂志页面等,每张图平均包含19.3个目标文本块,单张图片的目标文本平均总长度达到204个词,而且往往中英混排,还会夹杂各种符号。 针对这个基准,作者设计了一套专门的评估方案。文字准确度方面,用OCR工具识别生成结果,计算归一化编辑距离、词语级召回率、精确率、F1值以及短语命中率。整体视觉质量方面,则让多模态大模型从美学和提示词遵循度两个维度打分,取平均作为综合分。 GlyphAnchor在两个编辑模型(FireRed-Image-Edit-1.1、Qwen-Image-Edit-2511)以及一个文生图模型(Z-Image)上进行了验证。硬件方面使用24块H800-80GB GPU,分阶段微调和后训练各占两天。
五、实验结果:长文本和生僻字的双重突破 先看通用长文本基准上的表现。在LongTextBench数据集的英文任务上,原本FireRed-Image-Edit-1.1的单词准确率只有0.895,接上GlyphAnchor后,准确率直接跃升到0.990,涨了9.5个百分点;中文任务同样涨了8.2个百分点。Qwen-Image-Edit-2511在英文任务上更是从0.900大幅提升到0.983,而本身就较强的Z-Image也还能保持稳定增益。 表1:LongTextBench、OneIGBench-text与CVTG-2K基准上的量化对比。相比基础模型,GlyphAnchor在各项指标上均带来稳定提升。 生僻字的渲染是更大的亮点。在ChineseWord基准测试中,FireRed背书的GlyphAnchor模型在总准确率上从0.565提升到了0.801,提升了23.6个百分点。特别是二级字库(不常用汉字)和三级字库(生僻字)上的提升幅度非常夸张,分别上涨了37.2和34.9个百分点。这意味着当提示词里出现一个模型训练时很少见到的字形时,GlyphAnchor提供的字形“小抄”发挥了决定性作用。 表2:ChineseWord生僻字基准上的对比结果。GlyphAnchor在一级常用字、二级与三级生僻字上均大幅提升准确率。 在团队新建的InfoTextBench上,GlyphAnchor面对文字密集场景依然从容。原本编辑模型在这个基准上的词语级F1分数普遍在0.5上下挣扎,而接上GlyphAnchor后,Qwen-Image-Edit-2511的词语级F1从0.479跃升到0.871,短语命中率从0.167跳到0.737,综合视觉质量分也涨了2.1分。文生图模型Z-Image的词语级F1同样从0.872上升到0.950。
六、相关论文与开源生态分析 如果从更广阔的视角来看GlyphAnchor,不难发现视觉文本渲染是当前图像生成领域一个极具活力与挑战性的研究方向。在GlyphAnchor之前,做字形条件控制最有名的要数GlyphDraw、GlyphControl以及被集成进Seedream 2.0和GLM-Image的Glyph-ByT5-v2系列。其中Glyph-ByT5-v2路线是训练一个专门的字形感知文本编码器,把文本token映射为蕴含字形信息的特征,进而引导扩散模型。GlyphAnchor则采用了完全不同的视角,它不让编码器感知字形,而是像开卷考试一样,把整个字形图作为额外的参考图块交给模型,绕开了训练专用文本编码器所需要的巨大算力和数据成本。 对比近期不需要额外训练、仅在推理时干预的FreeText和GlyphBanana,GlyphAnchor属于“带条件微调”的路线,它通过在每个骨干模型上进行分阶段微调,让模型对字形补丁的响应更稳定。从消融实验来看,不管是在LongTextBench还是InfoTextBench上,GlyphAnchor相对原始模型和中间变体的提升都是全面的,特别是词组命中率从0.399到0.711的巨大跨步,说明位置锚定让模型在整句整段文本的排版稳定性上有了质变。 图5从可视化的角度展示了位置锚定的效果差异。第一行的参考图中,每个文本块都有特定的排版位置。第二行是没有位置锚定的字形补丁微调,可以看到模型虽然大概理解了要渲染哪些字,但多处出现了字形残缺、字块挤在一起或者大段丢字的问题。第三行是加上位置锚定的效果,不仅文字内容几乎全部还原,连每个文本块的相对位置关系都与原图保持高度一致。 位置锚定消融对比 图5:位置锚定的消融对比。上方为参考图,中间为有字形补丁但没有位置锚定的输出,下方为GlyphAnchor输出。加入了锚定之后,文本内容的完整性和排版位置都大幅改善。 分阶段微调消融对比 图6:分阶段微调的消融对比。左侧为参考图;GT Crop SFT直接把真实文本裁块作为训练条件,出现明显的白底粘贴伪影;Rendered Glyph SFT虽然规避了伪影但风格保真度不足;Staged SFT同时兼顾了文字准确率与画面风格。
七、龙哥点评 整体看完GlyphAnchor这套工作,龙哥的感受是:方法精简,思路清晰,实验也做得相当扎实。它没有去设计复杂的模型结构,而是从“字形先验怎么给才最有效”这一根本问题出发,一步步论证了紧凑字形补丁加位置锚定的组合方案。分阶段微调的设计也体现出研究团队对训练与推理分布差异的深入认知。 稍微有点遗憾的是,目前公开的论文中并没有提供在线Demo,对于只想快速体验效果的同学来说门槛有点高。此外,论文的评测基准和对比模型主要集中于中英文,对于其他语言文字以及艺术字体的渲染效果还未充分展示。后续如果能把这套锚定机制融合到更多的商用级图像基础模型里,文字生成这块短板有望被进一步补齐。 未来,如果字形锚定能按照文本语义进一步做子字级别的切分,在保持全局排版的前提下让模型逐字渲染,那么AI在排版密集的学术论文、复杂的数学公式甚至艺术字设计上,都有机会达到以假乱真的程度。但就目前而言,GlyphAnchor已经把“让AI准确写字”这门技术往前推进了一大步。
end
从字形锚定到海报生成,想让AI替你写好每一行字?和龙哥一起读论文、跑代码,把AI的“笔误”彻底纠正过来!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
文字渲染难,难在哪?有人可能会说:模型都能把提示词理解得那么准,照着字库“写”出来不就行了吗?问题恰恰在于,扩散模型生成图片时从来不是“查字库打字”,而是根据提示词的语义特征和随机噪声,在一遍遍去噪过程中“猜”出每一块区域的像素分布。对猫、树、汽车这类视觉对象来说,这种“猜”足够用——耳朵歪一点、颜色深一点,仍然像猫;可文字是极度精确的结构化符号,差一横就是错别字,多一个偏旁就是白字。当画面里出现长句、密集的说明文字甚至生僻字时,模型既要在数百个视觉区域中合理分配注意力,又要保证每一笔都毫厘不差,纯靠“语义猜字”几乎不可能稳定完成。
更麻烦的是,一段合格的“图文混排”画面往往有三个要求同时耦合:字符形状必须正确,文本要放到指定的位置,文字与周围场景、艺术风格要自然融合。三者只要有一个塌方,整张海报就没法用。比如一本杂志封面,正文段落里只要出现一个乱码字,编辑就会把整张图打回重做。文字类需求是“一票否决制”,这和“生成一只可爱但不太像的猫”完全不是一个量级的问题。
这类问题在文本生图里存在,在图生图编辑里同样存在。现有不少基础模型在短标语上已能做得很好,可一旦遇到整页通知、产品说明、菜单、数据看板这种文字密集场景,准确率就会肉眼可见地往下掉。更不用说生僻字了。在ChineseWord基准的Level-3生僻字测试里,不少强模型的准确率只有2%到5%,基本等于靠运气瞎蒙。显而易见,如果想让AI真正成为设计师的“文字排版助手”,这一课非补不可。

2 GlyphAnchor核心机制:位置锚定的字形先验如何工作?

面对“语义猜字”的不靠谱,GlyphAnchor给出的思路很直接:既然模型猜不准字形,那就把每个目标文字的“标准字形小抄”直接画好喂给它;既然模型不知道往哪里贴,那就给每张小抄附上精确的目标坐标。每个需要渲染的文本都被组织成一个布局项,即文本内容和它在画布上的归一化边界框:
L = { (s_i, b_i) }, b_i = (x_i, y_i, w_i, h_i)
其中N为目标文本的个数,s_i表示第i段文本的内容,b_i表示这段目标文本在画布上的归一化坐标框。
具体到GlyphAnchor实现中,每一段文本s_i都被一个字形渲染器画成一张紧凑的字形补丁图G_i,再由VAE编码器E(·)转成潜在特征g_i。这样每个文本项就变成了一组由“字形补丁”和“布局框”组成的字形条件c_i:
c_i = (g_i, b_i), g_i = E(G_i)
g_i是字形补丁图经过VAE编码后得到的视觉特征,b_i则告诉模型这段文字应该出现在画面中的哪个位置。
这套设计首先考虑的是现代扩散Transformer骨干的位置编码机制。当前Qwen-Image、Z-Image等主流模型,普遍使用三维旋转位置编码RoPE或类似变体。模型在计算注意力时,会根据token之间的位置差异去判断它们的关系。GlyphAnchor利用的正是这一特性:它不把字形补丁token变成“画布上的某个普通角落”,而是将这些补丁统一放进一个“虚拟字形平面”,同时把每个补丁的位置ID重新映射到目标潜在特征图上对应布局框的中心坐标。于是,字形信息在模型眼中就像贴好便签的坐标卡片,一旦注意力扫到画布某个区域,就能实时读取对应字形的结构。
这个机制还可以进行一个很自然的类比。假设一个学生(扩散模型)要完成一幅图文并茂的手抄报,你只告诉他“左上角写活动标题、右下角写报名须知”,他会非常容易把内容张冠李戴。现在你不仅把话术讲清楚,还在他桌上摆好了写好文字的小纸片,每张纸片背面贴着坐标:左上角贴“活动标题”,右下角贴“报名须知”。他要做的事,只剩下把小纸片描到对应位置。这便相当于把“背诵题”变成了“半开卷临摹题”,文字结构不再依赖模型凭语义脑补。
为什么选择这种“位置重映射”而不是常见的“自定义注意力掩码”?关键在于轻量和通用。若在注意力矩阵里插入额外的掩码约束,很多加速算子,比如FlashAttention,就不能直接使用,训练和推理都会变慢。GlyphAnchor只修改token的位置ID,注意力矩阵的计算方式和原生模型完全一致,因此现成的加速内核不用改动,兼容性拉满。
token开销同样是核心考量。整页字形参考法需要把一整张和最终画面同尺寸的字形图作为额外图像帧输入,视觉token直接翻倍。GlyphAnchor的紧凑字形补丁则经济得多:在1536×1536画布上,即便要渲染1000个中文字符,字形补丁也仅占用全画布参考约31%的token;如果换成1000个英文字符,占比还能降到15%左右。这种轻量条件让GlyphAnchor更像一个“外挂插件”,可以灵活接到不同扩散Transformer骨干上,而不用为每个模型重写一套庞大的控制网络。
如果从学术分类的角度看,GlyphAnchor属于典型的条件扩散模型增强研究,核心流程可以概括为一个表格:
*表格超出部分左右可以滑动 Table 1: Quantitative comparison on LongTextBench, OneIGBench-text, and CVTG-2K.
Table 1: Quantitative comparison on LongTextBench, OneIGBench-text, and CVTG-2K.

3 分阶段训练策略:如何让模型既学得会又用得好?

GlyphAnchor虽然设计简洁,但真正的难点其实藏在训练过程中,而且这个坑相当微妙。
训练一个图文模型时,我们是能看到目标答案的。也就是说,最省事的做法,是直接把目标图像里某个文本区域的真实裁块当作字形条件,喂给模型。这样模型很容易学会,因为相当于照着标准答案抄。但训练完一推理就会露馅:推理时模型根本拿不到目标图像里的真实文字裁块,只能用规规矩矩渲染出来的字形补丁。模型在训练时习惯了“抄作业”,突然让它面对规整的渲染字体,风格迁移能力立刻跟不上,甚至会生成带明显白色衬底的“贴纸字符”。反过来,如果整个训练过程都只用渲染字形补丁,模型又缺少高质量的真实裁块做引导,学习效率低,文字准确率也上不去。
GlyphAnchor为此设计了一套分阶段监督微调方案。训练前期,样本以真实图像的文字裁块为主,让模型快速建立起“字形内容与场景风格如何融合”的基本能力;随着训练推进,真实裁块的比例逐步降低,渲染字形补丁的比例逐步升高,模型被慢慢“过渡”到推理阶段的输入分布上。用公式来表达,分阶段微调的优化目标可以写成:
L_sft = E[ || v_theta(z_t, t, p, T_src, {c_i}) - v_t ||^2 ]
其中z_t为带噪潜在特征,p为提示词,T_src为可选的参考源图,c_i为每个文本项的字形条件,v_t是flow-matching中的速度回归目标。
为了防止模型死记字形补丁的像素外观,研究团队还加入了不少“防作弊”数据增强:随机打乱换行、缩放、旋转、平移,甚至随机丢弃部分字形。这么做的目的,是逼着模型把注意力放在字符结构和空间布局上,而不是去背输入图的纹理。只有学会了从字形里抽取结构信息,模型才能应对渲染字体和真实艺术字体之间的差异。
分阶段微调做完,基础文字准确率已经不错,但在特别长的文本和生僻字场景下仍可能整体崩溃。于是GlyphAnchor又借鉴了强化学习式的后训练框架DiffusionNFT,并针对文字任务设计了专门的奖励函数。其中最关键的是文本布局一致性奖励。如果只用字符串级别的OCR编辑距离做奖励,模型会找到一种投机取巧的解法——把字写得特别大来提升OCR识别成功率。为了避免这种作弊,奖励函数会把生成图和真值图中的字符实例都解析出来,再比较每一对字符的标签、中心位置和尺度差异。
R_layout = gamma_cov / |M| * sum exp(-lambda d_i - alpha delta s_i) R_TLC = w_text R_text + w_layout Gate(R_text) R_layout
上述公式中M表示生成图与真值图之间字符实例的匹配集合,d_i为字符中心位置归一化距离,Δs_i为字符尺度差异;Gate(R_text)是一个门控函数,只有当文字识别得分足够高时,布局约束项才会被激活,避免后训练早期用位置惩罚干扰文字内容学习。
文字位置和内容都不是全部。一张海报的文字再准确,如果字形风格跟整体画面完全不搭,或者文字像贴在背景上的贴纸一样没有光影互动,设计依然失败。GlyphAnchor为此又加入了两个由多模态大模型充当裁判的奖励项:风格一致性奖励衡量生成文字的风格是否与真值参考一致;视觉融合奖励评估文字是否和局部背景、材质、光影自然过渡。最终总奖励由文本布局奖励、风格奖励和融合奖励加权得到。
R = lambda_TLC R_TLC + lambda_style R_style + lambda_fusion R_fusion
这套总奖励既约束文字“写没写对”,也约束文字“放没放对”,还试图让模型“写出的字与画面长在一起”。

4 实验结果:从长文本到稀有字符的全面突破

实验部分,GlyphAnchor选了三款不同定位的扩散Transformer骨干来验证通用性:FireRed-Image-Edit-1.1和Qwen-Image-Edit-2511负责图生图编辑任务,Z-Image负责文生图任务。评测覆盖通用长文本基准LongTextBench、OneIGBench-text和CVTG-2K,生僻字基准ChineseWord,以及自建的InfoTextBench。
先看通用长文本基准。下方表1的结果显示,GlyphAnchor在三个骨干、三个基准上都带来了稳定的正向提升。两个编辑模型的改善尤其显眼:FireRed-Image-Edit-1.1在LongTextBench英文准确率从0.895提升到0.990,中文从0.898提升到0.980;Qwen-Image-Edit-2511在LongTextBench平均成绩从0.912提升到0.984,在CVTG-2K的NED从0.850跃升到0.968。至于本身已经很强的Z-Image,虽然在OneIGBench-text上的提升幅度很小,但在LongTextBench和CVTG-2K上依然获得了可感知的增益。
表1:LongTextBench、OneIGBench-text和CVTG-2K基准上的量化对比
表1:LongTextBench、OneIGBench-text和CVTG-2K基准上的量化对比。括号内数值为相比基础模型的提升幅度。CVTG-2K中Z-Image+GlyphAnchor的NED与WAC取得了所有对比方法中的最好成绩。
接下来是生僻字这一重头戏。从表2可以看到,GlyphAnchor对常用字和生僻字的渲染能力提升都很明显。FireRed-Image-Edit-1.1在ChineseWord上的总准确率从0.565涨到0.801,其中Level-2生僻字从0.411提升到0.783,Level-3生僻字从0.067提升到0.416。Qwen-Image-Edit-2511的总分也从0.496跃升到0.807。为什么提升如此夸张?这正是预期中的结果:生僻字在预训练语料里出现频率极低,模型对这类字形几乎没有记忆,提示词里的文字信息根本无法帮助模型还原复杂结构;而字形补丁相当于直接给出了标准字形,等于把“不认识的题”变成了“看着答案抄的题”。
表2:ChineseWord生僻字基准上的量化对比
表2:ChineseWord基准上的定量对比。GlyphAnchor在Level-1常用字以及Level-2、Level-3生僻字上均带来大幅提升。
再看团队新构建的InfoTextBench。这个基准里的样本平均每张包含19.3个文本项,目标文本总字数平均达到204词,还要在中英混排中准确呈现各类符号,难度远超一般长文本测试。从表3可见,Qwen-Image-Edit-2511在InfoTextBench的词语级F1从0.479涨到0.871,短语命中率从0.167暴涨到0.737,整体视觉质量分从4.603升到6.704;Z-Image的词语级F1也从0.872提升到0.950。文字密集的“多块版面”是最考验排版稳定性的场景,此前很多模型要么漏字,要么把两块文字写串行。GlyphAnchor的位置锚定让每段文本都有了明确的“坐标钉”,这种整体性错误被大幅压缩。
表3:InfoTextBench文字密集场景上的量化对比
表3:InfoTextBench基准上的定量对比。GlyphAnchor显著提升文字密集场景下的词语级F1、短语命中率与整体视觉质量。
消融实验进一步拆解了每个设计的贡献,见表4。只做普通数据微调,InfoTextBench词语级F1只有0.510;加入字形补丁但不加位置锚定,F1提升到0.737;再加上位置锚定后,F1直接跳到0.892。也就是说,字词准确率的大头提升恰恰来自这个看似不起眼的“坐标钉”。而最后的文本感知NFT后训练,则主要在整体视觉质量上做文章,让画面不因追求文字准确而损失美感。
表4:在FireRed-Image-Edit-1.1骨干上的消融实验
表4:在FireRed-Image-Edit-1.1骨干上的消融实验。无锚定训练相比无字形条件已有提升,但“字形补丁+位置锚定”带来了决定性的跃升,文本感知后训练进一步补齐视觉质量。

5 局限与展望:GlyphAnchor还有哪些提升空间?

GlyphAnchor的整套实验和设计都相当扎实,但它并不是一个没有前提的“万能补丁”。首先要正视的一点是,GlyphAnchor需要一个布局输入来指定每段文字的边界框。论文中的方案是用多模态大模型来做布局规划,再配合去重、重叠修正和换行调整等后处理。如果这个外在规划器本身就把文字框位置定错了,那么后续字形锚定得再准也无力回天,问题会从“写错字”变成“文字写对了但整体排版错位”。因此,GlyphAnchor的效果一定程度上依赖于上游布局模块的稳定性。
其次,文字风格的多样性空间还不够大。当前字形补丁由固定行高、固定字号的渲染器生成,这保证了字形结构清晰,但也意味着它更像“标准字库小抄”。生成带夸张变形的艺术字、花体字、手写体时,字形结构和最终风格之间会产生落差,需要模型具有较强的风格迁移能力才能弥补。目前公开评测仍以中英文信息型文本为主,设计感更强的艺术字体或阿拉伯文、泰文等更多语种的文本渲染效果,还没有被充分验证。
第三,训练成本并不算低。分阶段监督微调需要24块H800-80GB GPU跑两天,随后的NFT后训练又需要两天,换算成机时并不轻松。当然,推理阶段的额外开销被控制在了可接受范围内,这也是它能适配现有基础模型的重要原因。
从未来发展的角度看,如果把位置锚定从“文本块”细化到“子字级别”,模型在保持整体排版的同时逐字渲染,那么面对学术论文中的复杂公式、密集排版的数据报表,甚至更多样化的艺术字设计,这套机制都有

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?复旦与小红书提出GlyphAnchor,将字形先验做成紧凑补丁并锚定到目标位置,让文生图与图生图模型在长文本、密集排版和生僻字场景下文字更准,Z-Image英文长文准确率提升10.3%。
这篇工作最值得看的点是什么?在LongTextBench、OneIGBench-text、CVTG-2K、ChineseWord和InfoTextBench上,GlyphAnchor一致性地提升了三个骨干模型的文本准确率和整体视觉质量,尤其在稀有字符和文本丰富场景下提升显著。
这篇工作的边界或风险在哪里?优点:1) 位置锚定设计轻量高效,仅需少量额外token即可提供字形先验;2) 与标准注意力加速内核(如FlashAttention)兼容;3) 易于适配不同扩散Transformer骨干;4) 分阶段训练策略有效缓解训练-测试不匹配问题;5) 构建了InfoTextBench基准。缺点:1) 需要额外的布局输入,依赖MLLM布局规划器的准确性;2) 训练流程复杂,包含多阶段SFT和NFT后训练;3) 字形补丁渲染的字体和样式可能与目标图像风格不一致;4) 对中文和英文混合场景的处理仍有提升空间。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过将紧凑的字形补丁图像锚定到目标图像的布局位置,为扩散Transformer骨干提供显式的字符形状和空间位置先验,以提升长文本、复杂文本和稀有字符的渲染准确性。

实验合理度:★★★★☆

NED(归一化编辑距离)、词级召回率、词级精确率、词级F1、短语命中率、CLIP分数、WAC、整体视觉质量(MLLM评分)

学术研究价值:★★★★☆

通过将紧凑的字形补丁图像锚定到目标图像的布局位置,为扩散Transformer骨干提供显式的字符形状和空间位置先验,以提升长文本、复杂文本和稀有字符的渲染准确性;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

论文未明确报告FLOPs,但提到训练在24块H800-80GB GPU上进行,每阶段(SFT和NFT)各需2天。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;5) 构建了InfoTextBench基准。缺点:1) 需要额外的布局输入,依赖MLLM布局规划器的准确性;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。