Sentence Transformers 增加多向量检索能力
6.0 版本引入 MultiVectorEncoder,用于 ColBERT 风格的后期交互模型。
为什么重要
这次发布把后期交互检索带入一个被广泛使用的嵌入库,降低了构建搜索和 RAG 系统的团队的集成门槛。它还将 Sentence Transformers 扩展到视觉文档检索流程,可在无需 OCR 的情况下,将文本查询与页面图像进行匹配。
核心要点
- 1.Sentence Transformers v6.0 新增 MultiVectorEncoder。
- 2.PyLate 和 ColBERT checkpoint 可直接加载。
- 3.后期交互提升匹配效果,但会增加索引规模。
Hugging Face 表示,Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 风格的后期交互检索。此次更新让用户可以直接加载 PyLate 和 Stanford-NLP ColBERT checkpoint,并通过与稠密、稀疏和 reranker 模型相同的 API,支持 colpali-engine 视觉文档检索模型。多向量模型为每个 token 保留一个向量,并使用 MaxSim 打分,以更大的索引规模为代价提升 token 级匹配效果。
⚡ 今天就能用
升级 Sentence Transformers,并在精确术语或多部分需求较重要的检索查询中测试 MultiVectorEncoder。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。