AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

Investigadores presentan embeddings multimodales UEmbed

UEmbed genera representaciones léxicas dispersas y densas en una sola pasada hacia adelante con un modelo solo decodificador.

Por qué importa

UEmbed apunta a una arquitectura más simple para combinar recuperación dispersa aprendida y embeddings multimodales densos. Eso podría ser relevante para sistemas de búsqueda y generación aumentada por recuperación que necesitan tanto precisión léxica como coincidencia semántica.

Puntos clave

  • 1.Produce embeddings dispersos y densos en una sola pasada causal.
  • 2.Publicado en escalas de 2B, 4B y 9B.
  • 3.UEmbed-9B reporta 71.8 en denso en MMEB-v2.

Investigadores presentaron UEmbed, un modelo de embeddings multimodal solo decodificador que produce representaciones léxicas dispersas y densas en una única pasada causal hacia adelante. El modelo añade tokens especiales aprendibles a la entrada, divide el vocabulario en subconjuntos disjuntos y utiliza el estado oculto de cada token para predecir pesos dispersos. El equipo publicó versiones de 2B, 4B y 9B entrenadas con datos públicos, y UEmbed-9B obtuvo 71.8 en denso y 71.0 en disperso en MMEB-v2.

Pruébalo hoy

Lee el paper antes de elegir pilas separadas de embeddings multimodales dispersos y densos para nuevos sistemas de recuperación.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación