Des chercheurs publient les embeddings multimodaux UEmbed
UEmbed génère des représentations lexicales creuses et denses en une seule passe avant decoder-only.
Pourquoi c'est important
UEmbed esquisse une architecture plus simple pour combiner la recherche creuse apprise et les embeddings multimodaux denses. Cela pourrait compter pour les systèmes de recherche et de génération augmentée par récupération qui ont besoin à la fois de précision lexicale et de correspondance sémantique.
Points clés
- 1.Produit des embeddings creux et denses en une seule passe causale.
- 2.Publié aux échelles 2B, 4B et 9B.
- 3.UEmbed-9B annonce un score dense de 71,8 sur MMEB-v2.
Des chercheurs ont présenté UEmbed, un modèle d’embedding multimodal decoder-only qui produit à la fois des représentations lexicales creuses et denses en une seule passe avant causale. Le modèle ajoute à l’entrée des tokens spéciaux apprenables, divise le vocabulaire en sous-ensembles disjoints et utilise l’état caché de chaque token pour prédire des poids creux. L’équipe a publié des versions 2B, 4B et 9B entraînées sur des données publiques, UEmbed-9B obtenant des scores de 71,8 en dense et 71,0 en creux sur MMEB-v2.
⚡ À tester aujourd'hui
Lisez l’article avant d’opter pour des piles d’embeddings multimodaux creux et denses séparées dans de nouveaux systèmes de recherche.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.