Des chercheurs ciblent les lacunes du raisonnement spatial des VLM
COVT ajoute un raisonnement par tokens visuels, tandis que GST-Bench évalue la conscience spatiale globale dans la vidéo.
Pourquoi c'est important
Ces travaux mettent en lumière une faiblesse persistante des VLM : transformer des flux visuels en représentations spatiales globalement cohérentes. Un meilleur raisonnement spatial est essentiel pour les agents incarnés et les systèmes qui doivent déduire la géométrie, l’agencement et les points de vue à partir de vidéos.
Points clés
- 1.COVT entraîne les VLM à raisonner au moyen de tokens visuels continus et compacts.
- 2.GST-Bench teste la conscience spatiale globale sur de longs flux vidéo.
- 3.Les meilleurs VLM en zéro-shot restent très loin des performances humaines.
Des chercheurs ont présenté Chain-of-Visual-Thought, un cadre qui entraîne les modèles vision-langage à raisonner à partir de tokens visuels continus et compacts encodant des indices comme l’apparence 2D, la géométrie 3D, l’agencement spatial et les contours. L’approche utilise environ 20 tokens, distille les signaux d’experts vision légers et peut, en option, décoder des prédictions denses telles que la profondeur, la segmentation, les contours et les caractéristiques DINO afin d’améliorer l’interprétabilité. Un benchmark distinct, GST-Bench, évalue l’intelligence spatiale globale dans la vidéo à partir de questions vérifiées par des humains issues de 6 790 minutes de vidéo générée synthétiquement, et indique que le meilleur VLM en zéro-shot obtient 42,68, contre 79,08 pour les humains.
⚡ À tester aujourd'hui
Lisez GST-Bench avant d’utiliser des VLM pour des tâches vidéo spatiales de longue durée, et évaluez si une supervision par tokens visuels de type COVT convient à votre pipeline de modèles.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- arXiv cs.LGChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- HF Daily PapersGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?Aug 6, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées
Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.