静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2025-11-23 05:28

SentenceTransformerEmbedder支持的模型

SentenceTransformerEmbedder是基于sentence-transformers库的,支持所有Hugging Face上的预训练句子嵌入模型。主要分为以下几类:

1. 轻量级模型(适合中文)

  • sentence-transformers/all-MiniLM-L6-v2 - 代码中使用的模型,384维,性能与速度平衡
  • sentence-transformers/all-MiniLM-L12-v2 - 12层版本,性能更好但速度较慢
  • sentence-transformers/paraphrase-MiniLM-L6-v2 - 专门针对释义任务优化

2. 多语言模型

  • sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 - 支持中文等多语言
  • sentence-transformers/distiluse-base-multilingual-cased-v2 - 多语言通用模型
  • sentence-transformers/LaBSE - 语言无关的BERT句子嵌入

3. 高性能模型

  • sentence-transformers/all-mpnet-base-v2 - 768维,更高质量
  • sentence-transformers/all-distilroberta-v1 - 更快的推理速度
  • sentence-transformers/all-roberta-large-v1 - 大模型,最高质量

4. 中文专用模型

  • shibing624/text2vec-base-chinese - 中文文本向量化
  • GanymedeNil/text2vec-large-chinese - 中文大模型
  • moka-ai/m3e-base - 中文多语言模型

选择建议

代码中使用的all-MiniLM-L6-v2是一个很好的选择,因为:
  • 384维输出,存储效率高
  • 推理速度快
  • 对中文支持良好
  • 在大多数任务上表现均衡
可以根据具体需求选择其他模型,只需修改id参数即可。

👍 1