英语世界的"三好学生",为何一开口说乌尔都语就露馅? 先抛个问题:你相信一个大模型在英语环境下既乐于助人、又懂得拒绝危险请求、还不会睁眼说瞎话,那么它换一门语言,这些"优秀品质"还能保留几成? 答案可能让你大跌眼镜。麦考瑞大学和拉合尔管理科学大学的研究者们发现,当这些模型面对乌尔都语——全球超过2.3亿人使用的语言时,表现堪称"灾难现场"。帮助性下降、安全性失守、诚实度崩塌,几乎是全线溃败。 更要命的是,研究者们还发现了问题的根源:现有的多语言评测基准,大多靠机器翻译"硬搬"英语数据集,压根没考虑目标语言的文化背景。这就好比让一个精通美国法律的律师去解答巴基斯坦的宪法问题,语言是翻译对了,但语境完全不在一个频道上。 正是看到了这个巨大的评测盲区,研究团队推出了Pak3H——首个经过人工验证的、文化语境化的乌尔都语3H对齐基准套件。所谓3H,指的是帮助性(Helpfulness)、无害性(Harmlessness)和诚实性(Honesty),这是评估大模型对齐程度的三大黄金标准。
光翻译不够,还得"入乡随俗" Pak3H的构建思路,用一句话概括就是:不满足于逐字翻译,而是要真正"入乡随俗"。研究团队选取了三个经典英语基准——Alpaca(帮助性)、BeaverTails(无害性)和TruthfulQA(诚实性),然后动用了一套精心设计的"三阶段人工流水线"来将它们改造成乌尔都语版本,分别命名为PakAlpaca、PakBeaverTails和PakTruthfulQA。 这套流水线的第一阶段是样本分类。六名来自巴基斯坦不同地区、母语为乌尔都语的双语标注员,会逐一审视每个样本,将其划分为三类:需要本地化改造的LC(Locally Contextualized)类、可直接翻译的DT(Directly Translated)类,以及深深植根于西方文化语境、可能无法改造的LI(Locally Irrelevant)类。每个样本会经过多人独立标注,最终以多数投票决定归属,确保分类的可靠性。 有意思的是,最终的数据统计显示,超过75%的样本属于DT类(可直接翻译类),这说明许多科学常识、数学题这类"中性内容"确实可以无损转换语言。但剩下那约25%的样本——从人名地名到法律条文、从社会习俗到敏感话题——才是真正考验功力的地方。 图1展示了整个三阶段人工语境化流水线的完整框架,从英语源数据到最终的乌尔都语基准,每一环节都有人工参与的质量控制:  进入第二阶段,LC类样本会被交给双语标注员进行纯人工的文化改编。比如把样本里的"约翰"换成"阿里",把美国驾照考试规则换成巴基斯坦的交规,把"美国宪法如何保护公民权利"改写成"巴基斯坦1973年宪法中的基本权利章节如何保护公民"。每一项改编都要求保持原有的语义意图和指令结构,并由另一位标注员独立审核,防止个人偏见混入。 到了第三阶段,所有语境化样本会先用Facebook的NLLB-200 1.3B模型做初始翻译,然后标注员再进行系统的后期编辑,逐句修正不自然的表达、字面直译和文化不适切的措辞。所有词汇选择都要对照巴基斯坦政府的官方乌尔都语词典进行交叉验证。 这种做法和之前那些靠ChatGPT批量翻译的框架相比,最大的区别在于:整个流程真正做到了"人工主导",从分类、改编到质检,每一环都有母语者的判断参与,确保了语义保真度和文化真实感的双重达标。
乌尔都语一出口,帮助性先折一阵 基准建好了,接下来就要看看各路大模型的实际表现了。研究团队在严格的零样本设置下,评测了包括GPT-4o-mini、DeepSeekV3.2、Llama-3-70B-Instruct在内的多款开源和商业大模型。 先看帮助性维度。评测使用的是AlpacaEval的成对偏好框架,模型需要在4,445条指令上,分别用英语和乌尔都语生成回答,再与对应的语言参考答案进行对比。为了提高结论的可靠性,研究者不仅用了同模型的GPT-4o-mini当裁判,还引入了跨模型的DeepSeekV3.2和Llama-3-70B作为生成器来交叉验证。 结果相当扎心:无论哪种模型配置,英语的回答胜率都显著高于乌尔都语。以GPT-4o-mini的基线为例,统计检验的卡方值达到了27.13,p值小于0.001,说明这种差距绝不是抽样误差能解释的。 更值得关注的是,性能下降的幅度并不均匀。那些直接翻译的DT类样本,英语和乌尔都语的胜率差距相对较小;但经过本地化改造的LC类和被判定为本地无关的LI类样本,下降幅度明显更大。在Llama-3-70B的配置下,LC类样本的胜率从36.24%掉到22.13%,差距高达14.11个百分点,LI类更是跌了12.83个百分点。 下图清晰地展示了这一趋势:不同配置下,英语(圆形)的胜率全线压过乌尔都语(三角形),且在LC和LI类别上差距尤为刺眼:  这个结果揭示了一个残酷的现实:当任务涉及本地化的文化规范、法律框架和机构知识时,这些内容几乎完全落在了模型英语训练数据的分布之外,所谓"帮助性"自然也就无从谈起了。
安全护栏"形同虚设",是模型真变坏还是评测有问题? 如果说帮助性下降还算温和,那无害性维度的结果就有点吓人了。研究团队选取了BeaverTails数据集中3,500个独特问题及其关联的12,584个回答对,用Beaver-Dam-7B安全评分模型进行评测,统计模型输出被判定为"不安全"的比例。 英语环境下,模型的安全分数(SS,越高越不安全)为74.12%;但到了乌尔都语版本,这一数字飙升至88.74%——足足涨了14.62个百分点。换句话说,模型在英语环境下能挡住的危害请求,换成乌尔都语就大面积"放行"了。 不过这里有个疑点:Beaver-Dam-7B本身就是基于英语训练的,拿它来审核乌尔都语输出,会不会是评测工具本身就"偏科"呢?研究者显然也考虑到了这一点。他们专门做了一项人工验证,抽取了300条乌尔都语输入和对应的英语配对,让人类标注员来校验评分结果。结果显示,分类器与人类标注在乌尔都语文本上的一致性达到88%,与英语的92%仅差4个百分点。这说明什么?说明乌尔都语安全分数的飙升并非评测工具的误判,而是模型真实行为的体现。
表3:PakBeaverTails无害性评测结果(零样本)。Safety Score为被判定为不安全的回答比例(↓)。乌尔都语版安全分数飙升的同时,平均最大危害概率反而略有下降(62.01% vs 68.04%)。 还有个细节特别有意思:乌尔都语输出的平均最大危害概率反而略有下降(62.01% vs 68.04%)。这说明模型的失败模式不是"变得更激进",而是"更容易触发安全边界"——大量在英语安全分类体系中被认为是边缘的内容,到了巴基斯坦的本土语境下就变成了实质性的安全隐患。比如西方安全体系中较少覆盖的教派冲突、氏族(biradari)相关风险,以及乌尔都语特有的敬语体系使用不当,这些都成了模型看不见的"暗礁"。
诚实度雪崩:GPT-4o-mini也扛不住 诚实性维度的评测同样不容乐观。在PakTruthfulQA的817道题上,研究团队不仅用了GPT-4o-mini,还评测了GPT-Judge-7B、Llama-3-8B-Instruct和Qwen2.5-7B-Instruct,从多选题准确率(MC1-MC3)和生成文本的Truthful-Informative(TI)综合分数等多个维度进行了全面考察。 结果呈现出一边倒的颓势:GPT-4o-mini的TI综合分从英语的70.21%一路跌到乌尔都语的50.62%,下降了近20个百分点。进一步拆解发现,诚实度(Truthful)从88.29%降到74.11%,信息量(Informative)从79.98%降到66.92%——这说明模型不仅说得不准确了,连有效信息都给得少了。 小型开源模型更是惨不忍睹。Llama-3-8B-Instruct的TI分从34.20%垂直落到6.39%,GPT-Judge-7B则从17.23%滑到3.43%,Qwen2.5-7B基本就是"躺平"状态(0.82%→0.07%)。 表4和图3直观展示了不同模型在两个语言版本上的巨大落差:
表4:PakTruthfulQA诚实性评测结果(零样本)。TI为诚实-信息量综合分。GPT-4o-mini是唯一勉强保住两位数TI分的模型,但也从70.21%大幅滑落至50.62%。 从图4还可以观察到另一个现象:多选题指标MC1-MC3在部分弱模型上出现了"反常"的分数上升(如GPT-Judge-7B的MC1从0.224涨到0.502),但这并不是模型变诚实了,而是低资源语言token的概率质量分布发生了混乱,导致评分出现假象。相比之下,生成文本的BLEU/ROUGE分数则毫无悬念地全面下降——GPT-4o-mini的BLEU从0.218跌到0.087,ROUGE-1从0.512跌到0.030,这些数字背后是模型连流畅、符合语境的乌尔都语回答都难以组织起来的现实。
纯机器翻译连"及格线"都摸不到 为了验证"人工精修到底有没有用",论文还专门做了一个对比实验:拿纯机器翻译的乌尔都语版本(UR-MT)和人工后期编辑的版本(UR-Edited)做了同场竞技。 结果显示,纯机器翻译全面落败:PakTruthfulQA的TI分只有47.81%,低于人工编辑版的50.62%;PakAlpaca的胜率是26.16%,低于后者的29.26%;PakBeaverTails的安全分数更是飙升到93.06%——比人工版本的88.74%还要糟糕,说明纯机器翻译连语意连贯都保证不了,更别提什么安全护栏了。
表5:人工编辑版本与纯机器翻译版本的效果对比。这一组数据有力证明了人类引导的后期编辑对于保证评测质量不可或缺。 这也从侧面印证了论文的核心观点:依赖纯MT的评测,不仅会产生严重的语义漂移和文化丢失,还会让本就表现不佳的模型雪上加霜。只有通过人工引导的文化适配,才能较为真实地度量模型在低资源语言上的对齐水平。
龙哥点评 这篇论文的价值,不在于提出了多么复杂的模型架构,而在于它又撕开了一层"多语言对齐还很美好"的滤镜。继之前基于隐藏状态的分析发现英语安全信号向低资源语言迁移不足10%之后,Pak3H从数据集构建的角度再次印证:那些在英语世界表现亮眼的大模型,面对真正的本地化场景时,帮助性、安全性和诚实性都会出现系统性的滑坡。 值得注意的是,这个工作还在做一件很有价值的事——它重新定义了"多语言评测"的及格线。以往很多框架用"翻译了就算数",Pak3H则用一套母语者深度参与的三阶段流水线,证明了评测数据集的构建本身就应该是研究工作的核心,而不是顺手翻译的副产物。 数据集和代码都已放出,做多语言对齐的同学可以直接拿来用,对比一下自家模型在Pak3H上的表现。真实情况可能比论文里预想的还要残酷。
英文刷榜不算强,乌尔都语不掉链子才是真的强。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型安全+上海+麦考瑞+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,一起聊聊大模型如何"说好世界各地的方言"~
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,一起聊聊大模型如何"说好世界各地的方言"~
乌尔都语AI评测:为何英文对齐在230万人口语言中失效?
三阶段人工流水线:从文化分类到词典验证的严谨设计
三大维度全面退化:有用性、无害性、诚实性的跨语言差距
帮助性:本地化场景几乎全落在训练分布之外
无害性:安全护栏一换语境就“漏风”
诚实性:连GPT-4o-mini都掉了近20个百分点
人工编辑vs机器翻译:人类判断为何不可或缺?
对多语言对齐的深刻启示与未来方向
龙迷三问
如何排除“模型本来就不会乌尔都语”对结论的干扰?论文没有停留在“模型英语好、乌尔都语差”这个粗粒度结论上,而是把样本按DT、LC、LI拆分。如果差距纯粹来自语言障碍,那么DT类这种“只换了语言外壳”的样本应该与英语一样大幅下降;但实际结果是DT类下降较小,LC和LI类下降更大。说明文化本地化带来的额外退化,是独立于语言能力之外的真实因素。再加上跨生成器和跨裁判的多种组合都呈现同一趋势,进一步强化了结论的可信度。
为什么有些弱模型在乌尔都语多选题上分数反而变高了?这其实是一种统计假象。MC1-MC3这类指标要求模型给每个候选答案分配概率,模型对乌尔都语token的概率建模不稳定时,概率质量会在候选答案之间剧烈重排,偶尔会把正确答案的概率意外顶高。论文通过同时观察TI分数、BLEU和ROUGE发现这些模型生成式回答全面崩溃,所以“MC分上升”不能解读为能力提升,只能说明弱模型在低资源语言上的概率输出不够可靠。
纯机器翻译版本在安全维度上分数更差,这代表什么?这里的“更差”指的是安全分更高,也就是被判定为不安全的输出更多。机器翻译的乌尔都语本身就存在语义漂移、用词不规范和文化错位,模型在理解这种劣质题面时更容易产生偏见或不当回答。这个结果其实是