SentenceTransformerEmbedder支持的模型
SentenceTransformerEmbedder是基于sentence-transformers库的,支持所有Hugging Face上的预训练句子嵌入模型。主要分为以下几类:
1. 轻量级模型(适合中文)
sentence-transformers/all-MiniLM-L6-v2- 代码中使用的模型,384维,性能与速度平衡sentence-transformers/all-MiniLM-L12-v2- 12层版本,性能更好但速度较慢sentence-transformers/paraphrase-MiniLM-L6-v2- 专门针对释义任务优化
2. 多语言模型
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2- 支持中文等多语言sentence-transformers/distiluse-base-multilingual-cased-v2- 多语言通用模型sentence-transformers/LaBSE- 语言无关的BERT句子嵌入
3. 高性能模型
sentence-transformers/all-mpnet-base-v2- 768维,更高质量sentence-transformers/all-distilroberta-v1- 更快的推理速度sentence-transformers/all-roberta-large-v1- 大模型,最高质量
4. 中文专用模型
shibing624/text2vec-base-chinese- 中文文本向量化GanymedeNil/text2vec-large-chinese- 中文大模型moka-ai/m3e-base- 中文多语言模型
选择建议
代码中使用的all-MiniLM-L6-v2是一个很好的选择,因为:
- 384维输出,存储效率高
- 推理速度快
- 对中文支持良好
- 在大多数任务上表现均衡
id参数即可。