AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Des chercheurs publient les embeddings multimodaux UEmbed

UEmbed génère des représentations lexicales creuses et denses en une seule passe avant decoder-only.

Pourquoi c'est important

UEmbed esquisse une architecture plus simple pour combiner la recherche creuse apprise et les embeddings multimodaux denses. Cela pourrait compter pour les systèmes de recherche et de génération augmentée par récupération qui ont besoin à la fois de précision lexicale et de correspondance sémantique.

Points clés

  • 1.Produit des embeddings creux et denses en une seule passe causale.
  • 2.Publié aux échelles 2B, 4B et 9B.
  • 3.UEmbed-9B annonce un score dense de 71,8 sur MMEB-v2.

Des chercheurs ont présenté UEmbed, un modèle d’embedding multimodal decoder-only qui produit à la fois des représentations lexicales creuses et denses en une seule passe avant causale. Le modèle ajoute à l’entrée des tokens spéciaux apprenables, divise le vocabulaire en sous-ensembles disjoints et utilise l’état caché de chaque token pour prédire des poids creux. L’équipe a publié des versions 2B, 4B et 9B entraînées sur des données publiques, UEmbed-9B obtenant des scores de 71,8 en dense et 71,0 en creux sur MMEB-v2.

À tester aujourd'hui

Lisez l’article avant d’opter pour des piles d’embeddings multimodaux creux et denses séparées dans de nouveaux systèmes de recherche.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche