← 返回 PaperDaily
大模型与智能体
首个斯洛伐克语文本嵌入基准SkMTEB:词汇裁剪62%,45M小模型媲美商业API
大模型多语言能力虽强,但在斯洛伐克语这种仅有500万使用者的语言上,效果会打多大折扣?本文不仅给出了教科书式的基准测试,更告诉你:通过巧妙的“词汇裁剪+定向微调”,一个仅45M参数的开源小模型就能追平商业API,这对于所有小语种研究者来说都是一剂强心针。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
大模型多语言能力虽强,但在斯洛伐克语这种仅有500万使用者的语言上,效果会打多大折扣?本文不仅给出了教科书式的基准测试,更告诉你:通过巧妙的“词汇裁剪+定向微调”,一个仅45M参数的开源小模型就能追平商业API,这对于所有小语种研究者来说都是一剂强心针。
原论文信息如下:
引言
文本嵌入是语义搜索、RAG、聚类等NLP应用的核心基础设施。然而,大部分基准和优秀模型都集中在英语、中文等高资源语言上。对于那些全球仅有500万人口使用、甚至更少的“低资源语言”来说,情况就尴尬了:虽然像Multilingual E5、BGE等大型多语言模型在技术上声称支持上百种语言,但它们的词汇表和训练数据高度偏向高资源语言,导致在斯洛伐克语这样的西斯拉夫语上表现“水土不服”,或者部署起来成本高昂。
为了解决这个问题,来自斯洛伐克夸美纽斯大学、思科、科希策技术大学等机构的研究人员,针对斯洛伐克语做了两件里程碑式的大事:
第一,发布了SkMTEB——首个斯洛伐克语大规模文本嵌入基准,包含31个数据集、横跨7种任务类型,覆盖度比现有MMTEB基准中的斯洛伐克语任务高出近4倍。
第二,通过词汇裁剪 + 定向微调,打造了e5-sk-small(45M参数)和e5-sk-large(365M参数)两个开源模型。其中,45M的小模型在性能上竟然与OpenAI的text-embedding-3-small不相上下,而模型体积却缩小了62%!
语言模型“偏科”严重,斯洛伐克语怎么办?
多语言模型的“偏科”问题由来已久。当前的多语言嵌入模型虽然支持数百种语言,但它们的“精力”主要分配在英语和中文上。像斯洛伐克语这种低资源语言,在模型的词汇表中仅有少量token,训练数据覆盖也非常有限,性能自然大打折扣。
方法概述
面对上述挑战,本文提出了一套系统性的解决方案,主要包括构建基准和适配模型两大路径。
SkMTEB基准:为斯洛伐克语定制的31个任务新基准
为了填补斯洛伐克语在嵌入模型评估上的空白,研究者们构建了SkMTEB基准。它严格遵循MTEB框架,包含7大任务类型共31个数据集,涵盖新闻、政府、社交媒体、医药、百科等多个领域,时间跨度从2000年至2025年。