Des études testent les lacunes des VLM en raisonnement spatial et visuel
De nouveaux benchmarks et méthodes évaluent la manière dont les modèles vision-langage gèrent la perception dense et la conscience spatiale.
Pourquoi c'est important
Ces études mettent en évidence un décalage persistant entre le raisonnement centré sur le langage et la compréhension visuelle dense dans les VLM. Les progrès des agents incarnés pourraient dépendre de modèles capables de préserver la géométrie, la disposition, la profondeur et les détails visuels fins sur des flux visuels plus longs.
Points clés
- 1.GST-Bench révèle un écart important entre les VLM et les humains dans le raisonnement spatial global sur vidéo.
- 2.COVT ajoute des jetons visuels continus pour la profondeur, la segmentation, les contours et la supervision DINO.
- 3.SpatialCLI entraîne les VLM à utiliser des outils spatiaux spécialisés, puis à les internaliser.
Plusieurs articles récents examinent les limites des modèles vision-langage en matière de perception et de raisonnement spatial. GST-Bench évalue la conscience spatiale globale dans la vidéo au moyen de questions vérifiées par des humains, issues de 6 790 minutes de vidéo synthétique, et fait état d’un score maximal de 42,68 en zero-shot pour le meilleur modèle, contre 79,08 pour les humains. D’autres travaux proposent des méthodes comme Chain-of-Visual-Thought, qui utilise environ 20 jetons visuels continus, et SpatialCLI, qui entraîne les VLM à utiliser puis à internaliser des outils spatiaux spécialisés.
⚡ À tester aujourd'hui
Avant de déployer des VLM pour des tâches spatiales ou incarnées, il faut les tester sur des cas de perception dense et de raisonnement spatial à long horizon, et pas seulement sur la VQA au niveau de l’image.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- arXiv cs.LGChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- HF Daily PapersGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?Aug 6, 4:00 AM↗
- arXiv cs.AISpatialCLI: Learning to Reason With Spatial Tools, Then Without ThemAug 5, 12:00 PM↗
- arXiv cs.CLVLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic AnchorsAug 5, 12:00 PM↗
- arXiv cs.AILinguistic Context Recodes Visual Representations in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGSpatioLM: Towards General Physical Spatial Intelligence in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLHAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSpatioLM: Towards General Physical Spatial Intelligence in Vision-Language ModelsAug 4, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.