Des chercheurs proposent STAMPlus pour la segmentation par MLLM
Structured All-Mask Prediction vise à préserver les capacités de dialogue tout en accélérant la production dense de masques.
Pourquoi c'est important
Cette approche s’attaque à un compromis fréquent dans la segmentation par MLLM : qualité de la segmentation, préservation du dialogue et vitesse d’inférence. Si elle est validée, cette architecture pourrait rendre la segmentation fondée sur le raisonnement plus pratique pour les systèmes qui ont besoin à la fois d’ancrage visuel et de capacités conversationnelles.
Points clés
- 1.STAMP prédit des masques binaires en un seul passage non autorégressif.
- 2.STAMPlus associe des identifiants de cibles à un espace de masques multiclasse partagé.
- 3.La méthode vise à préserver les capacités de dialogue multimodal.
Un article publié sur Hugging Face propose Structured All-Mask Prediction pour la segmentation fondée sur des grands modèles de langage multimodaux. Les travaux présentent STAMP, qui sépare le dialogue autorégressif de la prédiction non autorégressive de masques binaires, ainsi que STAMPlus, qui génère des identifiants de cibles et, en option, des boîtes afin de prédire conjointement plusieurs cibles en un seul passage.
⚡ À tester aujourd'hui
Lisez l’article avant de construire des pipelines de segmentation MLLM nécessitant des masques multi-cibles en un seul passage.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google teste AMIE pour des consultations médicales vidéo en temps réel
Ce système de recherche fondé sur Gemini a été évalué dans des consultations de télésanté simulées.
Un modèle d’Anthropic fait avancer les travaux sur l’hypothèse de Riemann
Un modèle inédit d’Anthropic a permis des progrès sur ce problème mathématique non résolu de longue date, rapporte TechCrunch.
IBM détaille ALTK-Evolve, une méthode de mémoire pour agents
Le système récupère des consignes propres à chaque tâche afin de réduire les tokens d’inférence par rapport à ACE.