UEmbed unifie les embeddings multimodaux clairsemés et denses
Ce modèle uniquement décodeur génère des représentations lexicales et denses pour la recherche en un seul passage causal avant.
Pourquoi c'est important
Ces travaux répondent à une lacune pratique des systèmes de recherche en combinant recherche multimodale clairsemée et dense sans recourir à des modules cross-modaux distincts. Cela pourrait simplifier les pipelines de recherche et de RAG qui ont besoin à la fois de précision lexicale et de sémantique multimodale.
Points clés
- 1.Produit des embeddings clairsemés et denses en un seul passage uniquement décodeur.
- 2.Publié aux échelles 2B, 4B et 9B.
- 3.UEmbed-9B revendique 71,8 en dense et 71,0 en clairsemé sur MMEB-v2.
Des chercheurs ont présenté UEmbed, un modèle d’embedding multimodal uniquement décodeur qui produit à la fois des représentations lexicales clairsemées et des représentations denses en un seul passage causal avant. Le modèle utilise des tokens spéciaux apprenables et un partitionnement du vocabulaire pour générer des poids clairsemés, et il est publié aux échelles 2B, 4B et 9B après un entraînement sur des données publiques. UEmbed-9B revendique des scores MMEB-v2 de 71,8 pour la recherche dense et de 71,0 pour la recherche clairsemée, dépassant les modèles d’embedding multimodal entraînés publiquement cités par les auteurs, dont RzenEmbed.
⚡ À tester aujourd'hui
Évaluez UEmbed-9B par rapport à vos moteurs de recherche dense et clairsemée actuels avant de modifier l’architecture de votre RAG multimodal.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.