AAI News Hub
RechercheThu, August 6, 2026·Aug 62 sources corroborating

Des chercheurs ciblent les lacunes du raisonnement spatial des VLM

COVT ajoute un raisonnement par tokens visuels, tandis que GST-Bench évalue la conscience spatiale globale dans la vidéo.

Pourquoi c'est important

Ces travaux mettent en lumière une faiblesse persistante des VLM : transformer des flux visuels en représentations spatiales globalement cohérentes. Un meilleur raisonnement spatial est essentiel pour les agents incarnés et les systèmes qui doivent déduire la géométrie, l’agencement et les points de vue à partir de vidéos.

Points clés

  • 1.COVT entraîne les VLM à raisonner au moyen de tokens visuels continus et compacts.
  • 2.GST-Bench teste la conscience spatiale globale sur de longs flux vidéo.
  • 3.Les meilleurs VLM en zéro-shot restent très loin des performances humaines.

Des chercheurs ont présenté Chain-of-Visual-Thought, un cadre qui entraîne les modèles vision-langage à raisonner à partir de tokens visuels continus et compacts encodant des indices comme l’apparence 2D, la géométrie 3D, l’agencement spatial et les contours. L’approche utilise environ 20 tokens, distille les signaux d’experts vision légers et peut, en option, décoder des prédictions denses telles que la profondeur, la segmentation, les contours et les caractéristiques DINO afin d’améliorer l’interprétabilité. Un benchmark distinct, GST-Bench, évalue l’intelligence spatiale globale dans la vidéo à partir de questions vérifiées par des humains issues de 6 790 minutes de vidéo générée synthétiquement, et indique que le meilleur VLM en zéro-shot obtient 42,68, contre 79,08 pour les humains.

À tester aujourd'hui

Lisez GST-Bench avant d’utiliser des VLM pour des tâches vidéo spatiales de longue durée, et évaluez si une supervision par tokens visuels de type COVT convient à votre pipeline de modèles.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche