← 返回 PaperDaily 视觉与图像

图像生成|招牌写"兽医"宠物店秒变诊所?新基准专治文生图语义泄漏

先来看一种并不罕见的场景:在产品包装设计、店铺招牌生成、设备铭牌渲染这类视觉内容创作任务里,用户往往给模型下达一个明确指令——在某个指定的主体区域(比如一家面包店的招牌、一辆货车的车身、一瓶饮料的标签)写入指定的文字,同。

图像生成|招牌写"兽医"宠物店秒变诊所?新基准专治文生图语义泄漏
原论文信息如下:
论文标题:
T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
发表日期:
2026年09月
发表单位:
Peking University
原文链接:
https://arxiv.org/pdf/2609.02255v1.pdf

文本渲染准确≠语义可控:T2LSC-Bench揭示的隐秘漏洞

先来看一种并不罕见的场景:在产品包装设计、店铺招牌生成、设备铭牌渲染这类视觉内容创作任务里,用户往往给模型下达一个明确指令——在某个指定的主体区域(比如一家面包店的招牌、一辆货车的车身、一瓶饮料的标签)写入指定的文字,同时保持主体身份和周边场景不变。
模型也确实乖乖照做了,几个字母端端正正地出现在招牌中央。但仔细一看整张图——不对劲。招牌上写着「VET Clinic(兽医诊所)」,结果画面里的宠物店门口居然蹲了一条正在接受听诊的狗,旁边的货架上还莫名其妙地摆上了听诊器和注射器。这还算轻的,更离谱的情况下,写着「GUNSMITH(枪匠)」的店面周围直接出现了枪支元素的视觉暗示。
这就是这篇论文关注的T2LSC-Bench(Text-to-Image Localized Semantic Control Benchmark,文生图局部语义控制基准)的核心问题:目标文本关联的语义泄漏(target-text-associated semantic leakage)——文字本身写对了,但文字的语义却通过锚定区域之外的非文本视觉内容悄悄扩散了出去,把原本规定好的主体身份或场景给带跑了。
图1:局部文本渲染与目标文本关联语义泄漏的示例
图1:局部文本渲染与目标文本关联语义泄漏的示例(上排为正常渲染,下排展示了泄漏现象)
这个问题的微妙之处在于:它不属于传统的文字渲染错误——字符拼写没错、位置也没放错;也不属于主体丢失——店铺还是那个店铺。它是一种更隐蔽的中间态失效:目标文字表达正确,但其语义影响未能被限制在指定区域内
为什么这个问题值得警惕?因为现有的视觉文本基准测评,清一色盯着文字是否可读、拼写是否正确、排版是否合理这些浅层指标。如果一家模型在拼写准确率上拿了99分,但在语义遏制(semantic containment,即文字语义被约束在锚定区域内不外溢)上却一塌糊涂,下游设计工作者照样不敢用。
图3:目标文本关联语义泄漏的概念边界
图3:目标文本关联语义泄漏的概念边界——主题保持与语义泄漏是两种独立属性
论文还专门厘清了边界——并非所有生成瑕疵都算泄漏。比如文字在锚定区域外重复出现,属于多余文字而非语义泄漏;锚定区域内出现与目标文字相关的视觉元素,不叫泄漏,因为本来就在区域内;主体自身劣化但跟目标文字语义毫无关系,也不算泄漏。真正的泄漏判定必须同时满足两个条件:视觉线索支持目标文字语义,且无法从主体的默认语境中自然推出。这个边界画的非常清楚,可见作者是真的被这类问题折磨过。

四因素因子化设计:如何系统性地压力测试语义泄漏

要系统地暴露这类问题,靠零散的几个demo是不够的,得有一套经过严格设计的评测基准。
T2LSC-Bench首先筛选了50个种子主体(seed subjects),这些主体共同具备三个特征:稳定的视觉身份(比如救护车就该长得像救护车)、天生自带可写字区域(车身侧面就是天然的锚点)、以及明确的默认语义/功能解读。每个种子主体是一条店铺门面、一辆服务车辆、一个产品容器或一块警告标牌。锚点区域——专业术语叫文本锚(text anchor)——规定了目标字符串应该出现的具体位置。注意这里有个严格限制:同样的文字出现在画面上其他地方并不算成功渲染,必须在锚点区域内才算数。
接下来是全文最精彩的部分——因子化设计(factorized design)。作者没有让50个种子随意搭配文本,而是引入了四个受控因子,进行一次全因子展开(full factorial expansion),每个模型拿到的是完全相同的1,200条提示:
第一个因子是语义关系(semantic relation):每个种子搭配1个对齐文本和2个冲突文本。对齐文本跟主体默认解读一致,比如花店配「FLOWERS」,测量正常状态下的表现;冲突文本则故意跟主体身份唱反调,比如花店偏配「GUNSMITH」或者宠物店配「VET CLINIC」,用来压力测试模型在语义矛盾时的应对能力。各模型在冲突条件下的行为差异便是解码其内部语义控制机制的关键线索。
第二个因子是提示模式(prompt mode):自然模式只要求写字、保持主体,而防泄漏模式则额外增加对抗语义传播、禁止主体/场景重新解读、禁止支撑性视觉内容、禁止场景重建等显式约束。两者的提示词仅差这部分内容,其余完全一致,这样可以直接隔离出「用户主动加上防泄漏指令」到底有没有用。
第三个因子是场景开放性(scene openness):封闭场景是主体居中的中景构图,周围只有1-3个物体;开放场景则拉远到中远景,周围放4-6个物体、背景密度更高。这个因子的作用机理很直白——周围的可放物体越多,等于给文本语义的泄漏提供了越多的「载体」。
第四个因子是语言(language):每套案例同时用英文和中文实例化,保持主体、锚点、语义关系完全一致,以便检测语义泄漏到底是英文专有的拼写现象,还是跨语言的通用语义问题。
图4:T2LSC-Bench的因子化案例实例化与质量控制
图4:T2LSC-Bench的因子化案例实例化与质量控制流程
经过了主体、锚点、目标文本和跨语言四层一致性检查,50个种子主体 × 3个文本 × 2个场景 × 2个提示模式 × 2个语言,每个模型1,200条提示,6个模型共7,200次生成。换算下来有7,160张有效图——有40张被安全过滤器挡下来了,全都涉及某个迪士尼店铺的种子,这个细节还挺有意思,说明即使是做评测基准的提示词,也会触发内容安全策略。
表1:T2LSC-Bench中受控因子的操作性定义
表1:T2LSC-Bench四个受控因子的操作性定义

双分支评估协议:将文本准确性与语义遏制分离测量

好,基准构造有了,接下来是评测方法。这里的核心设计理念是先分裂再汇总——把「字写得对不对」和「字义有没有跑出去」当成两个独立维度分开测,而不是混在一起打一个模糊的总分。
文本渲染分支负责判断目标字符串是否完整、正确地渲染在了指定锚点内。它采用了OCR与VLM(视觉语言模型,Vision-Language Model)的融合策略。OCR(Optical Character Recognition,光学字符识别)模块用的是PaddleOCR,提供字符级别的证据——但OCR有个固有缺点,它能识别出画面里有这串字,却无法可靠判断这串字到底是不是出现在锚点区域。这就需要一个具备空间感知能力的视觉语言模型来补充判断。VLM会检查指定文本区域,报告检测到的字符串、可见性、可读性、位置合法性、字符级偏差等信息,并给出置信度c_i。
图5:自动评估协议的总体流程
图5:T2LSC-Bench双分支自动评估协议总览。上分支处理文本渲染,下分支处理语义评估
融合规则也挺讲究:OCR和VLM都说匹配,判为exact;OCR漏检但VLM高置信度匹配,也能通过——这部分是为了弥补OCR对多行文本碎片化或变形字形的漏检。但如果OCR显示匹配而VLM否了,或VLM匹配但置信度不够,就得转人工复核。最终只有标记为exact的样本才算成功渲染,小瑕疵叫minor error,明显错误叫failure。
语义评估分支的设计更值得玩味。为了避免泄漏,VLM法官拿到的材料只有生成图、主体描述、文本锚信息和目标文字——语义关系标签、提示模式、完整提示词、生成模型身份全部被隐藏。为了防止VLM偷懒直接给结论,评估被拆成了三步:先找主体并判断身份是否保留,再客观描述锚点外的候选非文本线索,最后逐条判断这些线索是否支持目标文字语义、以及是否超出主体默认语境。
图2:T2LSC-Bench基准构建、生成与评估的整体流程
图2:T2LSC-Bench构建、生成与评估的整体流程
基于这套双分支协议,论文定义了四个核心指标,公式化为截图列出:
TAA公式 SSP公式
TAA(Text-at-Anchor Accuracy,锚点文本准确率)衡量完整目标字符串在指定锚点被正确渲染的比例。SSP(Semantic Subject Preservation,语义主体保持率)衡量预定义主体身份保持可识别的比例。
SLR公式
SLR(Semantic Leakage Rate,语义泄漏率)衡量有效泄漏判定样本中,锚点外非文本内容表达目标文字语义且超出默认语境的比例。注意SLR不管文本渲染是否成功,只要图里有泄漏就算。
C_L定义公式 cSLR公式
C_L样本集是「文本渲染精确且泄漏判定有效」的那些图,cSLR(Conditional Semantic Leakage Rate,条件语义泄漏率)计算这个子集中的泄漏比例。cSLR的价值在于直击要害——只有那些字已经精确写对的案例才有资格进入分母,它回答的问题是:即便文字渲染完美,语义依然有可能外溢吗?
ΔSLR公式
最后ΔSLR等于冲突条件SLR减去对齐条件SLR,这个差值直接度量了语义冲突带来的额外泄漏压力。
此外,论文还在420张分层抽样图上做了人工验证,每模型70张且正负例各半,由三名标注者独立标注并设置仲裁。自动协议与裁决后人工标注之间的一致性数据是这套评估另一处扎实的地方——一份没人认可的自动评估是自嗨式的工程玩具,论文为此花费了不少力气。

六大模型横评:谁在语义冲突下“原形毕露”?

该基准选取了六个当下有代表性的文生图模型:豆包Seedream 5.0、Gemini 3.1 Flash Image Preview、Gemini 2.5 Flash Image、GPT-image-1.5、Wan2.6 Image和Qwen-Image-2.0。这里直接看表2的结果:
表2:T2LSC-Bench上的总体与关系特定性能(%)
表2:T2LSC-Bench总体及语义关系维度上的性能对比(N为可用图像数)
先看总分再拆细节。文本渲染准确率TAA六模型跨度惊人——从59.2%到99.0%,其中Gemini 2.5的TAA低得扎眼,但它的SSP却有96.7%,说明文字渲染和主体保持真是两种互不相干的能力。再看语义泄漏指标就更刺激了:对齐条件下所有模型SLR 1.2%,岁月静好;切到冲突文本的一瞬间SLR飙升到18.1%、cSLR到18.2%,而TAA仅仅从91.4%掉到90.9%。
这个对比数字就是整篇论文最锋利的发现——模型把字写对的能力和把字义按住的能耐是完全解耦的。Gemini 3.1综合表现最均衡,但也不是铜墙铁壁,冲突条件下cSLR仍有13.1%;Seedream 5.0更典型,TAA高达97.1%但cSLR同时冲到22.0%;Gemini 2.5则展示了另一种方向上的拙劣,每10次生成就有4次字写不对,这已经是硬伤级的渲染缺陷了。Wan2.6以94.2%的TAA配上22.4%的SLR和23.4%的cSLR,进一步佐证了渲染好与泄漏少完全是两回事。
图6:匹配基准条件下的跨模型对比
图6:匹配条件下的跨模型对比示例。所有输出均实现了精确的锚点文本渲染,但主体保持与语义泄漏情况各不相同
图6的对比相当直观,同一个提示词下各个模型产出的差异一目了然——有的模型为了配合冲突文字,把店铺外观都改了;有的模型则坚持主场景不变,把冲突字硬写上去,效果却显得不伦不类。这两种失败模式在图上形成了鲜明的对比。
图8:语义遏制与泄漏的匹配对比
图8:成对比较语义遏制与泄漏的案例。每对共享相同主体、目标文本、锚点与受控条件,所有输出均满足TAA=SSP=1
字写对了、主体也守住了,但语义线索引到了锚定区域之外——图8里几组正反例对比把SLR和cSLR所指的现象具象化了。左右两张图,右边的某处细节悄悄从「照常营业的宠物店」变成了「跟兽医有关联的道具」,这就是只有语义评估分支才能捕捉到的微妙变化。
更进一步,论文把受控因子逐项拆开来看,结果见表3:
表3:T2LSC-Bench受控因子条件下的性能(%)
表3:T2LSC-Bench在四种受控因子条件下的性能细分
最值得留意的是语言因子:英文和中文条件下的SLR差异在不同模型上方向完全不一致——有些模型在中文下泄漏更严重,有些则相反。这个结果说明语义泄漏的机制与分词和概念激活方式深度绑定,不能简单地归因于「某个语言更难」。场景开放性因子的结论倒是符合直觉:开放场景下泄漏率普遍更高,正如论文假设的那样——周围的物体越多,可供文本语义「寄生」的载体就越多。
同时还用配对种子簇自助法(paired seed-clustered bootstrap)估计了受控条件下SLR差异的置信区间,见图7。论文没有直接把横条交叉就略过,种子层面的聚类置信区间明显要比普通区间更加可信,在评估基准这类高度依赖数据集内部结构的场景里是一个必须坚持的做法。
图7:种子聚类自助法估计的SLR差异
图7:配对种子聚类自助法估计的受控条件间SLR差异。点为估计差值,横线为95%置信区间
表4:420图分层子集上的人工验证结果
表4:420图分层子集上的人工验证结果
表4b:人工标注与自动协议的一致性及分类性能
表4(b):人工标注与自动协议的一致性及分类性能
人类标注的加入让这套自动评估的可靠性有了依据,参考标签和自动判断之间的一致性足够高,才敢拿这套流程去替人工筛选大规模样本。

防泄漏提示的局限:部分缓解但远非万能

既然问题是模型主动把文字语义往画面里「圆」,那有没有可能靠提示词直接按住它?
论文为此专门设计了一个防泄漏(anti_leakage)提示模式,在基础提示词上叠加四重约束:禁止语义从目标文字传播、禁止对主体或场景重新解读、禁止添加支撑性视觉内容、禁止场景重建。从全模型汇总来看,效果确实存在——SLR从16.6%降到8.4%,几乎砍了一半,而且TAA几乎没有折损。乍一看是个好消息:用户可以通过写提示词来部分规避语义泄漏。
但接下来的发现就给这碗鸡汤加了冰——缓解效果存在显著的模型依赖性。有的模型在防泄漏提示下SLR应声而降,抗泄漏能力大幅增强;有的模型却几乎不为所动,提示词写了等于白写。这背后的可能是不同模型在训练数据中「文字-场景联动」模式的固化程度有所区别:指令跟随能力强的模型能理解「不要把文字含义画出来」这种抽象约束,而另一些模型则把文字语义与场景元素的共现关系内化得太深,一层提示已经不足以穿透。
更关键的是量级问题——即便采取了防泄漏提示,表现最好的模型残留泄漏率依然还在8%上下。这个数字放在内容生产的质检环节里意味着:每12-13张图就有约1张存在语义泄漏瑕疵,对于需要批量出图的广告物料生产来说,这个残次率仍然无法直视。提示工程不是万能药,它只是把风险压低了一些,想根治还得从模型的架构或训练层面着手。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?生成文字越来越准,语义却可能“跑”出指定区域污染画面。T2LSC-Bench对六大主流模型实测:冲突条件下语义泄漏率从1.2%冲到18.1%,文字渲染准确率却几乎不变。能写对字,不等于控住了义。
这篇工作最值得看的点是什么?实验发现语义冲突条件下SLR从1.2%增至18.1%,cSLR从1.3%增至18.2%,而TAA仅从91.4%微降至90.9%,表明准确文本渲染不保证语义局部遏制。显式防泄漏提示可将SLR从16.6%降至8.4%但不损害渲染精度。人类验证研究显示自动协议与人工标注高度一致。
这篇工作的边界或风险在哪里?优点:(1)首次系统性地定义并量化了目标文本相关语义泄漏问题,填补了现有视觉文本基准的评估空白;(2)因子化设计支持对语义关系、场景开放性、提示模式和语言的独立分析;(3)双分支评估协议将文本渲染准确性与语义遏制分离测量,并经过人类验证。缺点:(1)基准局限于具有预定义文本锚点和稳定视觉先验的主体,以及较短的英文和中文目标文本;(2)SLR评估中自动判断倾向于过度归因(精确率83.3%),对模糊或自然语境线索的区分仍有改进空间;(3)40个不可用输出均来自Disney店面种子,可能引入轻微偏差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把「文字渲染正确但语义泄漏」从通用生成质量缺陷中剥离出来单独建模评测,切入点新颖且定义清晰,填补了视觉文本基准在语义遏制维度上的空白。

实验合理度:★★★★☆

50个种子、1,200条提示/模型、四因子全因子展开,控制变量设计严谨;OCR-VLM双分支评估与融合规则合理,420张人工验证进一步增强了评估可信度。若种子覆盖更广则能进一步压缩估计方差。

学术研究价值:★★★★☆

揭示了「文本渲染准确」与「语义遏制」是两个可解耦的能力维度,对后续模型设计、评估体系构建、泄漏机理分析等多条研究线有直接启发。

稳定性:★★★☆☆

双分支评估协议的可复用性较好,融合规则和置信度阈值清晰,但整体流程依赖闭源VLM、其判断一致性存在版本漂移风险;人工复核环节在规模化部署时仍是短木板。

适应性以及泛化能力:★★★★☆

主体覆盖店铺、车辆、包装、标牌等典型文字承载场景,中英双语设计增强了跨语言泛化能力。种子数量、场景多样性及模型规模是主要受限因素。

硬件需求及成本:★★★☆☆

基准运行成本主要由API推理和VLM评估构成,7,160张图约1,200条提示/模型×6模型的生成费用尚可控,但350+次VLM调用与人工复核的人工成本不低;源码暂无端到端一键复现脚本。

复现难度:★★★★☆

Github仓库已给出项目资源,数据集构造方法和评估协议描述详细。主要复现障碍在于闭源VLM的API成本与部分模型不可访问。

产品化成熟度:★★★☆☆

作为质检工具,能有效筛出「字写对但语义跑偏」的废稿;但当前依赖多阶段VLM流水线、且提示工程缓解效果模型相关,集成到真实内容生产管线仍需技术验证与流程调优。

可能的问题:种子主体仅50个且偏「商业标识类」,对抽象主体或非常规语境下的语义泄漏覆盖有限;防泄漏提示的提示模板偏单一,未系统搜索最优措辞;SLR的人工判定仍然依赖标注者主观判断「什么算自然预期」,跨文化标注差异可能有影响。


主要参考文献

[1] Wang Y, Hou X, Lin W, et al. T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation[J]. arXiv preprint arXiv:2609.02255, 2026.
[2] 项目开源地址: https://github.com/LLMSecResearch/T2LSC-Bench

end
写对字很容易,管住“字外之音”才是真功夫。想第一时间围观这类文生图新基准、新坑位、新思路,欢迎加入龙哥读论文粉丝群。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如图像生成+上海+某大厂+小龙),按格式备注可更快通过并邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5大方向,等你来辩~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。