← 返回 PaperDaily 视觉与图像

多语言文生图被曝"语言不平等"!LingT2I基准:10种语言33K提示词,通义千问也翻车

这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。

多语言文生图被曝"语言不平等"!LingT2I基准:10种语言33K提示词,通义千问也翻车
原论文信息如下:
论文标题:
On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation
发表日期:
2026年08月
发表单位:
Khalifa University, Queen Mary University of London, The Chinese University of Hong Kong, The University of Western Australia, The University of Melbourne, University of Central Florida
原文链接:
https://arxiv.org/pdf/2608.11002v1.pdf

这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁纸。
但要是把这句话换成印地语、阿拉伯语或者日语呢?结果可能就完全变了个样——物体数量错误、文字渲染成一团乱码、画风莫名变成油画。别以为这只是个别模型的抽风问题,最近的一篇论文用33K条提示词、10种语言做了系统性评测,把这个"语言不平等"的盲区彻底掀开了。
图1:多语言T2I面临的挑战
图1:多语言T2I面临的挑战。(i) 语言不平等:印地语版本物体数量不正确;(ii) 文本渲染失败:字母排列错误及字符结构错误;(iii) 跨语言多维权衡:韩语结果呈油画风格,与预期的照片风格不一致;(iv) 语言相关的生成模式:相同提示词在不同语言下产生具有不同文化特征的织物。

多语言T2I的"语言不平等":一个被忽视的盲区

多说一句,这里是"语言不平等"(linguistic inequality),指的是模型在不同语言上的生成质量差异极大——高资源语言如英语、法语表现突出,低资源语言如印地语、阿拉伯语则明显掉队。这不是某个模型的小毛病,而是整个T2I生态的系统性问题。
为什么会出现这种现象?根源在于数据和训练范式。当前主流T2I模型基本建立在英语主导的训练集上,比如COCO Captions和LAION-5B,这类数据集中英语语料占比极高,其他语言的信息被严重稀释。模型在英语上的语义理解自然最好,而到了小语种就像"半聋"一样,只能从训练语料残留的碎片里勉强猜测语义。
更值得注意的一个现象是,不同语言不仅在"图像语义对齐"上有差距,还会连带影响图像风格、文本渲染、人口统计偏差等维度。比如同一个提示词,英语下生成的是写实照片风格,韩语下却可能变成油画;同样的文化元素,日语提示词可能生成细节更贴合当地传统的图案,而英语提示词就千篇一律是"西方审美模板"。这些语言依赖的生成模式(language-dependent generation patterns)说明,模型输出不仅仅受到文本语义的影响,还被语言背后的文化先验和数据分布左右。
但长期以来,学术界对多语言T2I的研究很少,大部分评测只看英文指标。真到了阿拉伯语、印地语、日语等语言上,模型表现如何?文本渲染又能不能把文字写对?这些关键问题一直没有系统性的答案。本文的目标正是补齐这块拼图。

LingT2I基准:10种语言、33K提示词的系统性评估框架

要系统分析跨语言差异,首先需要一个靠谱的评测基准。论文提出了LingT2I,一个覆盖10种广泛使用语言的跨语言T2I评测基准,包含两个核心任务:内容生成(Content Generation)和文本渲染(Text Rendering)。
语言选择上,论文兼顾了文化语义多样性和书写系统多样性,选定了英语、中文、印地语、西班牙语、阿拉伯语、法语、葡萄牙语、俄语、日语和韩语这10种语言。这些语言覆盖了印欧语系、汉藏语系、闪含语系等主要语系分支,也包含了拉丁字母、汉字、天城文、阿拉伯字母、西里尔字母、假名/谚文等多种书写系统。从使用人口、全球覆盖率、语言影响力指数(Power Language Index, PLI)等多个维度综合评估后筛选得出。
表1:LingT2I中10种语言的统计与分类
表1:LingT2I中10种语言的统计与分类,包括使用人口(Spk.,十亿)、全球覆盖率(Cov.,%)、语言影响力指数(PLI)、文字类型和语系分支。
内容生成子集基于DOCCI数据集的英文标注构建,并设计了10个评估维度:图像质量(真实感、美感)、任务对齐(内容对齐、属性对齐)、多样性(风格多样性、结构多样性)、鲁棒性(清晰度、认知一致性、偏见、毒性)。每个维度都通过提示词工程引导Gemini 2.5 Flash进行维度感知的标注和提示词构建,然后翻译成9种其他语言。文本渲染子集则基于EasyText数据集,背景提示词保持英文不变,只翻译需要渲染的文本内容,从而将语言变量隔离到渲染组件上。最终整个基准包含30K条内容生成提示词和3K条渲染文本提示词,合计33K。
图2:内容生成任务的评估维度
图2:内容生成任务的评估维度。每个维度提供定义、多语言示例以及生成图像中"高质量"和"失败案例"的代表性示例。
图3:文本渲染任务的评估维度
图3:文本渲染任务的评估维度,聚焦文本质量和与背景的和谐度。
在评估指标上,论文也做了不少细致的处理。内容生成任务采用改进的CLIPScore,用Meta-CLIP2多语言编码器替换了原始CLIP,因为原始CLIP在英语上的表现远强于其他语言,直接用会导致公平性偏差。维度级评估则引入了TRIGScore,这是基于多模态大语言模型(MLLM)的评测方法,用Qwen-2.5-VL的log概率产生细粒度评分,评估提示词也做了跨语言适配。文本渲染任务采用字符级和词元级(token-level)的NED(归一化编辑距离)以及句子级准确率,三者平均得到最终精度。
质量控制方面,论文设计了"自动处理+回译验证+GPT-5交叉检查+人工修正"的多级流程,并让母语者评估了随机5%子集,98%的样本被判定为跨语言语义一致。

三大核心发现:语言不平等、文字渲染瓶颈与文化偏见

论文在LingT2I上评测了17个模型,包括通用模型(SD3.5、SDXL、FLUX.1-Krea、Sana 1.5、PixArt-Σ、Janus-Pro、Lumina-Next、Z-Image、Qwen-Image、Omni-Diffusion、Nano Banana),多语言增强模型(PEA-Diffusion、X2I、MuLan),以及渲染专用模型(AnyText、AnyText2、EasyText),全部使用4张A100 64G GPU默认配置部署。
表2:内容生成和文本渲染模型的整体跨语言性能
表2:内容生成(CG)和文本渲染(TR)模型的整体跨语言性能。CG任务用CLIPScore衡量;TR任务用平均精度衡量。每个模型给出跨语言平均值和标准差,方差反映模型层面的语言不平等。
发现一:语言不平等普遍存在,且模型架构决定了公平性的上限。
在内容生成任务上,通用模型整体表现呈明显的"英语一枝独秀"格局:英语平均CLIPScore达到0.78,法语0.73,西班牙语0.71,中文0.48,印地语和阿拉伯语都只有0.38。而标准差方面,SD3.5、FLUX.1-Krea、PixArt-Σ的标准差高达0.19-0.21,说明这些模型在不同语言上表现极不稳定。相比之下,多语言增强模型(PEA-Diffusion、X2I、MuLan)的方差只有0.03-0.04,公平性显著提升,但代价是英语和法语的性能有所下降——通常是"拆东墙补西墙"。
真正亮眼的是Qwen-Image:在保持平均分0.78(与英语水平相当)的同时,标准差只有0.03,几乎做到了"高水准+高公平"兼得。这说明基于原生多语言大语言模型(LLM)架构的T2I模型,比事后加适配器或蒸馏的方案更能从根本上解决问题。但即便整体公平性改善,语言之间的差距依然存在:罗曼语系(法语、西班牙语、葡萄牙语)和日耳曼语(英语)依然领先,斯拉夫语和东亚语言居中,印地语和阿拉伯语继续垫底。
发现二:非拉丁书写系统是文本渲染的核心瓶颈。
文本渲染任务的情况更加"惨烈"。通用模型在英语上的平均精度为0.67,而到了阿拉伯语只剩0.12,印地语0.22,俄语0.29。即便是渲染增强模型EasyText,在英语上能到0.87,到了阿拉伯语也只有0.43,印地语0.46。表3给出了EasyText和Nano Banana的细节对比。
表3:EasyText和Nano Banana的跨语言文本渲染精度
表3:EasyText和Nano Banana在各语言上的文本渲染精度。
从书写系统的角度看,拉丁字母语言(英语、西班牙语、法语、葡萄牙语)表现最好,这是模型在拉丁语料上训练充分的结果。中文在渲染专用模型下有明显提升,但阿拉伯语、印地语、俄语等非拉丁文字仍然普遍出现字符错乱、字形结构错误甚至幻觉文字。为什么这么难?根源在于这些书写系统的文字构成逻辑和拉丁字母完全不同:阿拉伯文是连笔草书,同一字母在词首、词中、词尾都有不同的写法;天城文(印地语)则大量使用辅音连字和上标符号,字形组合远比26个字母复杂;韩语谚文虽然是字母系统,但字母要拼成方块字,这种空间组合对生成模型的字符解码提出了更高要求。
图7:语言相关的文本渲染错误
图7:语言相关的文本渲染错误,展示不同书写系统下字符正确性和结构保真度的差异,字母文字与非字母文字呈现不同错误模式。
文本渲染的评价指标核心是精度,论文采用字符级NED、词元级NED和句子级准确率的平均。其中字符级NED的定义如下:
公式:字符级NED = 1 - 莱文斯坦距离(预测字符序列, 真实字符序列) / 最大长度
其中D_lev表示莱文斯坦编辑距离,衡量两个字符串之间通过插入、删除、替换操作互相转换所需的最少编辑次数;C_pred是模型预测的字符序列,C_gt是真实字符序列。NED将编辑距离归一化到0-1区间,越接近1表示渲染越准确。
公式:精度 = 三分之一乘以(字符级NED + 词元级NED + 句子级准确率)
最终精度取三者的平均,词元级NED与字符级NED类似,但比较的是mT5分词器生成的词元序列。图4进一步展示了跨语言维度的相关性分析。
图4:跨语言维度分析
图4:跨语言维度分析。内容生成(a、b)和文本渲染(c、d)中的语言-维度相关性,以及内容生成(e)和文本渲染(f)中关键维度对之间的语言相关权衡。
发现三:文化偏见不只是"西化",而是"语言-文化"强绑定。
传统观点认为T2I模型存在"西方化"(Westernization)偏见,即不管什么语言,生成的图像都偏向白人、西方美学。但LingT2I的实验结果并不完全支持这一点。论文对Qwen-Image在偏见维度的输出做了人口统计学分析,发现生成图像中的人物种族分布与提示词语言高度绑定:印地语提示词生成印度裔人物占94.6%,日语和韩语提示词生成亚洲裔人物超过65%,而俄语、法语、英语提示词生成白人比例在84.9%到97.1%之间。
图5:十种语言中种族和性别类别的分布
图5:十种语言中种族和性别类别的分布,基于Qwen-Image在偏见维度下的输出计算。
也就是说,模型学到的是每种语言背后的文化人口统计学特征,而不是单一的"西方中心"先验。多语言提示词反而把生成结果"引导"到了对应的文化区域,这一现象在文化倾向分析中更加直观——同一句提示词"一位女子与海马雕像"在印地语下是印度传统雕塑风格,在日语下则融入了东亚视觉元素甚至会加上锦鲤。在全部有效样本中,23.2%的图像带有可识别的文化特有视觉元素,其中79.6%的主要文化标签与提示词语言一致,在仅统计能对应到特定已知文化的样本时,这一比例提升到90.2%。
图6:语言相关的文化倾向
图6:语言相关的文化倾向,展示相同提示词如何在不同语言下产生文化特定的视觉解释,反映与每种语言关联的隐性文化先验。
另一方面,跨语言的偏见维度也存在有趣的"权衡":英语生成的图像审美一致性较强,但文化和性别偏见也更明显;印地语和阿拉伯语生成的图像更"安全"但美学质量明显下降。这类语言相关的维度权衡,在英语评测中完全无法暴露。Bias指标的计算公式如下:
公式:偏差(d) = 熵(H_d) / 最大熵(H_d_max) = -Σ p_i * log(p_i) / log(K)
H_d为第d个维度(如种族、性别、年龄)上类别分布的熵,K为类别数。该值越大表示分布越均匀,偏差越小;综合偏差分数则按种族50%、性别30%、年龄20%加权平均。

因果分析:从现象到根源的深度剖析

现象背后的成因到底是什么?论文从数据、语言形态和书写系统三个角度进行了剖析。
数据分布的不均衡是第一层原因。训练数据中英语语料占据绝对主导,其他语言的图像-文本对在数量和质量上都存在明显劣势。模型在"见得多"的英语上自然理解更深、风格更稳,在"见得少"的印地语和阿拉伯语上则只能靠泛化"硬撑"。同时,数据中的社会文化分布也被模型内化,形成了语言-人口统计的强关联——印地语提示词生成印度面孔、日语提示词生成亚洲面孔,本质上反映的是训练数据中图像与语言文化背景的统计相关性。
语言形态和分词效率是第二层原因。论文发现,在mT5分词器下,英语提示词平均只需约21.9个词,而多语言提示词平均需要43.1个词元(token)。印地语、阿拉伯语等语言的名词变格和派生形态丰富,同样的语义需要分配更多的词元,导致在固定上下文窗口下,模型可以"看到"的语义信息被稀释。如图11所示,提示词碎片化程度越高,生成质量往往越差。
图11:Qwen-Image的提示词碎片化与跨语言生成质量
图11:Qwen-Image的提示词碎片化与多语言生成质量。
书写系统复杂度是第三层原因。文本渲染错误与字符复杂度直接相关。论文按字符类别和笔画数做了细粒度的错误率分析:拉丁文字的大写字母比小写字母更容易出错,CJK文字中笔画数越多的字符错误率越高;从序列位置来看,错误率在文本开头和结尾更高,中间相对较低。这说明模型对复杂字符的"笔画级"建模能力依然不足。
图8:跨书写系统的文本渲染错误分析
图8:跨书写系统的文本渲染错误分析。上图:字符级错误率,拉丁文字按字符类别(大写/小写)分组,CJK文字按笔画数分组;下图:错误率按归一化字符位置分组,可对比拉丁文和CJK文字的错误模式。
另外,安全审查机制的英语中心化也在起作用。论文发现印地语、阿拉伯语等语言的"毒性分数"更高(即更少有害内容),但这可能不是因为模型在那些语言上更"文明",而是因为审查管道主要针对英语进行优化,对低资源语言的过过滤导致生成内容更保守、更通用,反过来牺牲了语义丰富度和美学质量。
图9展示了多语言文本渲染的典型失败模式,包括字符混淆、笔画缺失、多余装饰笔画、结构错位等。这些问题在拉丁脚本上很少出现,却在天城文、阿拉伯文、汉字上频繁发生。
图9:多语言文本渲染中的典型失败模式
图9:多语言文本渲染中的典型失败模式。

未来方向:原生多语言架构与语言感知训练策略

LingT2I不仅是一个评测基准,更给后续的模型研发指明了几个关键方向。
第一个方向是原生多语言架构。Qwen-Image和Omni-Diffusion这类在基座模型层面引入多语言能力的方案,比事后加适配器(如PEA-Diffusion、X2I、MuLan)的效果更好、性能损失更小。原因在于原生多语言模型在预训练阶段就把多语言知识编码进了视觉-语言对齐空间,而不是在英语底座上"打补丁"。
第二个方向是语言感知的文本渲染模块。现有的渲染增强模型(AnyText、EasyText)在英语和中文上表现不错,但面对阿拉伯文和天城文仍然力不从心。未来的渲染模型需要内置"书写系统感知"机制,针对不同文字的字形组合规则做专门建模,而不是把所有文字都当作通用字符序列处理。
第三个方向是训练数据与评测指标的多元化。要缩小语言差距,必须增加多语言图像-文本对的数据规模,尤其是低资源语言;同时评测指标也要规避英语中心化问题,比如用Meta-CLIP2替代原始CLIP,用语言感知的MLLM评估替代固定模板打分。LingT2I的构建思路正好提供了一个可复制的范本。
总而言之,多语言T2I的"语言不平等"不是一个简单的工程问题,而是涉及数据、模型架构、文化认知的系统性挑战。LingT2I把这些问题摆到了台面上,剩下的就是研究者们怎么接招了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?LingT2I覆盖10种语言33K提示词,系统性评测17个文生图模型的跨语言一致性,揭示语言不平等、非拉丁文字渲染瓶颈与语言依赖的生成模式,为多语言T2I评估提供首个系统化框架。
这篇工作最值得看的点是什么?实验全面揭示了多语言T2I模型的系统性缺陷:通用模型存在严重语言不平等(方差0.03-0.21),非拉丁文字渲染精度低(阿拉伯语0.12-0.43),语言相关文化偏见显著(79.6%文化标签与提示语言一致),tokenization碎片化与CLIPScore强负相关(ρ=-0.89)。
这篇工作的边界或风险在哪里?优点:(1) 构建了首个系统性的多语言T2I基准,覆盖10种语言、33K提示词,规模大且语言多样性高;(2) 评估维度全面,涵盖内容生成和文本渲染两大任务,并引入多维度权衡分析;(3) 因果分析深入,通过音译控制、对齐条件偏见、文化标签分析和tokenization分析定位性能差距根源;(4) 发现具有重要启示性,如原生多语言架构优于事后适配、tokenization碎片化是关键瓶颈等。缺点:(1) 依赖机器翻译构建多语言数据,可能引入翻译偏差;(2) 评估指标本身可能不完全语言无关;(3) 未提出具体改进方法,仅提供分析洞察;(4) 部分分析基于单一模型(如Qwen-Image),泛化性有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建覆盖10种语言、33K提示词的多语言T2I基准LingT2I,系统评估内容生成与文本渲染两大任务,揭示跨语言性能差距、语言相关权衡及生成模式,并进行因果分析定位瓶颈。

实验合理度:★★★★☆

CLIPScore(使用Meta-CLIP2多语言编码器)、TRIGScore(基于Qwen-2.5-VL)、文本渲染精度(字符级NED、词元级NED、句子级准确率)、文本质量/美学/背景融合(MLLM-as-judge)

学术研究价值:★★★★☆

构建覆盖10种语言、33K提示词的多语言T2I基准LingT2I,系统评估内容生成与文本渲染两大任务,揭示跨语言性能差距、语言相关权衡及生成模式,并进行因果分析定位瓶颈;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(本文为评估分析,不涉及新模型计算量)

复现难度:★★★☆☆

https://github.com/RISys-Lab/LingT2I

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。

主要参考文献

[1] Zhang S, Yan Z, Xie B, et al. On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation. arXiv:2608.11002, 2026.
[2] LingT2I项目主页:https://github.com/RISys-Lab/LingT2I
[3] LingT2I数据集:https://huggingface.co/datasets/RISys-Lab/LingT2I

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
语言不平等、文字渲染翻车、文化偏见过载……多语言文生图的水,比想象中深得多。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 多模态生成+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,和龙哥一起把

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。