AAI News Hub
InvestigaciónThu, August 6, 2026·Aug 62 sources corroborating

UEmbed unifica embeddings multimodales dispersos y densos

El modelo solo decodificador genera representaciones léxicas y densas para recuperación en una sola pasada causal hacia delante.

Por qué importa

El trabajo apunta a una brecha práctica en los sistemas de recuperación al combinar recuperación multimodal dispersa y densa sin depender de módulos cross-modal separados. Eso podría simplificar los pipelines de búsqueda y RAG que necesitan tanto precisión léxica como semántica multimodal.

Puntos clave

  • 1.Produce embeddings dispersos y densos en una sola pasada solo decodificador.
  • 2.Publicado en escalas de 2B, 4B y 9B.
  • 3.UEmbed-9B reporta 71,8 en denso y 71,0 en disperso en MMEB-v2.

Investigadores presentaron UEmbed, un modelo multimodal de embeddings solo decodificador que produce tanto representaciones léxicas dispersas como densas en una única pasada causal hacia delante. El modelo usa tokens especiales aprendibles y particionamiento del vocabulario para generar pesos dispersos, y se publica en escalas de 2B, 4B y 9B tras entrenarse con datos públicos. UEmbed-9B reporta puntuaciones en MMEB-v2 de 71,8 para recuperación densa y 71,0 para recuperación dispersa, superando a los modelos multimodales de embeddings entrenados públicamente citados por los autores, incluido RzenEmbed.

Pruébalo hoy

Evalúa UEmbed-9B frente a tus recuperadores densos y dispersos actuales antes de cambiar la arquitectura multimodal de RAG.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación