[论文] SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation

研究领域: NLP 作者: Marek Šuppa, Andrej Ridzik, Daniel Hládek, Natália Kňažeková, Viktória Ondrejová 发布时间: 2026-06-11 arXiv: 2606.13647

论文概要

研究领域: NLP 作者: Marek Šuppa, Andrej Ridzik, Daniel Hládek, Natália Kňažeková, Viktória Ondrejová 发布时间: 2026-06-11 arXiv: 2606.13647

中文摘要

我们引入SkMTEB,首个面向斯洛伐克语的MTEB风格全面文本嵌入基准,包含7个任务类型的31个数据集。我们通过对多语言E5模型应用词汇裁剪和微调开发e5-sk-small(45M)和e5-sk-large(365M)。尽管尺寸缩减高达62%,我们的模型仍与专有API保持竞争力且可本地部署。

原文摘要

We introduce SkMTEB, the first comprehensive MTEB-style text embedding benchmark for Slovak, comprising 31 datasets across 7 task types. We develop e5-sk-small (45M) and e5-sk-large (365M) by applying vocabulary trimming and fine-tuning to Multilingual E5 models. Despite size reductions up to 62%, our models achieve competitive performance with proprietary APIs while remaining locally deployable.


*自动采集于 2026-06-14*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先放一个数字:62%。

62% 是 SkMTEB 中 e5-sk-small 相比多语言 E5-base 的参数缩减量。从 110M 缩到 45M,仍然与专有 API 竞争力相当。

为什么小语种嵌入模型重要?MTEB(Massive Text Embedding Benchmark)覆盖英文为主,小语种如斯洛伐克语几乎没有公开基准。SkMTEB 是首个 MTEB 风格的斯洛伐克语全面基准——31 个数据集、7 个任务类型。

更精彩的是词汇裁剪(vocabulary trimming)技术:多语言 E5 的词汇表是为 100+ 语言设计的,斯洛伐克语只占一小部分。把不需要的 token 剪掉,模型大小直接砍掉 62%,而性能不掉。

这揭示了一个被低估的事实:多语言模型的"通用"是有税的。每加一种语言,词汇表膨胀,参数稀释,推理变慢。小语种专用模型在固定规模下,实际上比通用模型更强——这是"少即是多"在 NLP 的具体落地。

工程意义:任何有特定语种需求的企业,不需要调通用大模型,只需要剪词汇表 + 微调,就能拿到小、快、强的本地部署模型。e5-sk-small 45M 完全可以跑在笔记本上,延迟比 API 调用低两个数量级。

但更深的洞察是数据护城河:SkMTEB 31 个数据集本身是这个工作的最大贡献。模型只是数据的下游产物——你能剪词汇表是因为 31 个数据集定义了"什么算好",没有这个基准,62% 缩减就是空中楼阁。

下一根钉子:小语种嵌入的真正护城河不是模型架构,是数据。谁先做出 MTEB 风格的多语种基准,谁就定义了这个语种的"什么算好"。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens