AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

Pesquisadores lançam embeddings multimodais UEmbed

O UEmbed gera representações lexicais esparsas e densas em uma única passagem forward decoder-only.

Por que importa

O UEmbed aponta para uma arquitetura mais simples para combinar recuperação esparsa aprendida e embeddings multimodais densos. Isso pode ser relevante para sistemas de busca e de geração aumentada por recuperação que precisam tanto de precisão lexical quanto de correspondência semântica.

Pontos-chave

  • 1.Produz embeddings esparsos e densos em uma única passagem causal.
  • 2.Lançado nas escalas 2B, 4B e 9B.
  • 3.O UEmbed-9B reporta 71,8 em denso no MMEB-v2.

Pesquisadores apresentaram o UEmbed, um modelo de embeddings multimodal decoder-only que produz tanto representações lexicais esparsas quanto densas em uma única passagem causal forward. O modelo acrescenta tokens especiais aprendíveis à entrada, divide o vocabulário em subconjuntos disjuntos e usa o estado oculto de cada token para prever pesos esparsos. A equipe lançou versões de 2B, 4B e 9B treinadas com dados públicos, com o UEmbed-9B marcando 71,8 em denso e 71,0 em esparso no MMEB-v2.

Experimente hoje

Leia o artigo antes de escolher stacks multimodais separados de embeddings esparsos e densos para novos sistemas de recuperação.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa