AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

UEmbed 统一稀疏与稠密多模态嵌入

这款 decoder-only 模型可在一次因果前向传递中生成词法检索向量和稠密检索向量。

为什么重要

这项工作为多模态搜索和 RAG 系统中的混合检索指向了一种更简单的架构,减少了对独立稀疏、稠密或跨模态组件的依赖。其基于公开数据的训练方式和多种模型规模,可能让研究人员更容易比较不同检索方法。

核心要点

  • 1.在一次 decoder-only 传递中生成稀疏和稠密嵌入。
  • 2.发布 2B、4B 和 9B 三种规模。
  • 3.UEmbed-9B 在 MMEB-v2 上报告的稠密得分为 71.8。

研究人员推出了 UEmbed,这是一款 decoder-only 多模态嵌入模型,可在一次因果前向传递中同时生成稀疏词法表示和稠密表示。该模型使用可学习的特殊 token 和分区词表子集来构建稀疏向量,并发布了 2B、4B 和 9B 三种规模。UEmbed-9B 在 MMEB-v2 上报告的稠密得分为 71.8、稀疏得分为 71.0,超过了作者引用的基于公开数据训练的多模态嵌入模型,并且在 BEIR 上仍具竞争力。

今天就能用

在调整多模态 RAG 流水线之前,应先将 UEmbed 与当前的稠密和稀疏检索器进行评估对比。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究