← 返回 PaperDaily 大模型与智能体

首个斯洛伐克语文本嵌入基准SkMTEB:词汇裁剪62%,45M小模型媲美商业API

大模型多语言能力虽强,但在斯洛伐克语这种仅有500万使用者的语言上,效果会打多大折扣?本文不仅给出了教科书式的基准测试,更告诉你:通过巧妙的“词汇裁剪+定向微调”,一个仅45M参数的开源小模型就能追平商业API,这对于所有小语种研究者来说都是一剂强心针。

首个斯洛伐克语文本嵌入基准SkMTEB:词汇裁剪62%,45M小模型媲美商业API
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
大模型多语言能力虽强,但在斯洛伐克语这种仅有500万使用者的语言上,效果会打多大折扣?本文不仅给出了教科书式的基准测试,更告诉你:通过巧妙的“词汇裁剪+定向微调”,一个仅45M参数的开源小模型就能追平商业API,这对于所有小语种研究者来说都是一剂强心针。


原论文信息如下:
论文标题:
SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation
发表日期:
2026年6月
发表单位:
斯洛伐克夸美纽斯大学、思科系统、科希策技术大学、凯姆佩伦智能技术研究所
原文链接:
https://arxiv.org/pdf/2606.13647v1.pdf
开源代码链接:
https://github.com/slovak-nlp/skmteb
项目链接:
https://huggingface.co/collections/slovak-nlp/skmteb
开源数据集链接:
https://huggingface.co/collections/slovak-nlp/skmteb

引言

文本嵌入是语义搜索、RAG、聚类等NLP应用的核心基础设施。然而,大部分基准和优秀模型都集中在英语、中文等高资源语言上。对于那些全球仅有500万人口使用、甚至更少的“低资源语言”来说,情况就尴尬了:虽然像Multilingual E5、BGE等大型多语言模型在技术上声称支持上百种语言,但它们的词汇表和训练数据高度偏向高资源语言,导致在斯洛伐克语这样的西斯拉夫语上表现“水土不服”,或者部署起来成本高昂。
为了解决这个问题,来自斯洛伐克夸美纽斯大学、思科、科希策技术大学等机构的研究人员,针对斯洛伐克语做了两件里程碑式的大事:
第一,发布了SkMTEB——首个斯洛伐克语大规模文本嵌入基准,包含31个数据集、横跨7种任务类型,覆盖度比现有MMTEB基准中的斯洛伐克语任务高出近4倍。
第二,通过词汇裁剪 + 定向微调,打造了e5-sk-small(45M参数)和e5-sk-large(365M参数)两个开源模型。其中,45M的小模型在性能上竟然与OpenAI的text-embedding-3-small不相上下,而模型体积却缩小了62%!

语言模型“偏科”严重,斯洛伐克语怎么办?

多语言模型的“偏科”问题由来已久。当前的多语言嵌入模型虽然支持数百种语言,但它们的“精力”主要分配在英语和中文上。像斯洛伐克语这种低资源语言,在模型的词汇表中仅有少量token,训练数据覆盖也非常有限,性能自然大打折扣。
插图
对于那些对语义搜索和RAG有刚需的斯洛伐克语应用开发者来说,他们面临一个两难选择:要么依赖表现不佳的多语言模型,要么部署动辄数亿参数、难以本地化运行的庞然大物。这正是这篇论文要解决的核心矛盾。

方法概述

面对上述挑战,本文提出了一套系统性的解决方案,主要包括构建基准和适配模型两大路径。

SkMTEB基准:为斯洛伐克语定制的31个任务新基准

为了填补斯洛伐克语在嵌入模型评估上的空白,研究者们构建了SkMTEB基准。它严格遵循MTEB框架,包含7大任务类型共31个数据集,涵盖新闻、政府、社交媒体、医药、百科等多个领域,时间跨度从2000年至2025年。
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。