AAI News Hub
PesquisaThu, August 6, 2026·Aug 62 sources corroborating

Pesquisadores miram lacunas no raciocínio espacial dos VLMs

COVT adiciona raciocínio por tokens visuais enquanto o GST-Bench testa consciência espacial global em vídeo.

Por que importa

O trabalho destaca uma fraqueza persistente dos VLMs: converter fluxos visuais em representações espaciais globalmente consistentes. Um raciocínio espacial melhor é essencial para agentes incorporados e sistemas que precisam inferir geometria, layout e pontos de vista a partir de vídeo.

Pontos-chave

  • 1.O COVT treina VLMs a raciocinar por meio de tokens visuais contínuos e compactos.
  • 2.O GST-Bench testa consciência espacial global em longos fluxos de vídeo.
  • 3.O desempenho do principal VLM zero-shot fica muito atrás do desempenho humano.

Pesquisadores apresentaram o Chain-of-Visual-Thought, um framework que treina modelos de visão e linguagem a raciocinar com tokens visuais contínuos e compactos, capazes de codificar pistas como aparência 2D, geometria 3D, disposição espacial e bordas. A abordagem usa cerca de 20 tokens, destila sinais de especialistas visuais leves e pode, opcionalmente, decodificar previsões densas como profundidade, segmentação, bordas e recursos DINO para fins de interpretabilidade. Um benchmark separado, o GST-Bench, avalia inteligência espacial global em vídeo usando perguntas verificadas por humanos a partir de 6.790 minutos de vídeo gerado sinteticamente, relatando que o VLM zero-shot mais forte marcou 42,68, contra 79,08 dos humanos.

Experimente hoje

Leia o GST-Bench antes de usar VLMs em tarefas espaciais de vídeo de longo horizonte e avalie se uma supervisão por tokens visuais no estilo COVT se encaixa no seu pipeline de modelos.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa