AAI News Hub
InvestigaciónThu, August 6, 2026·Aug 62 sources corroborating

Investigadores apuntan a las brechas de razonamiento espacial en los VLM

COVT incorpora razonamiento con tokens visuales mientras GST-Bench mide la conciencia espacial global en video.

Por qué importa

El trabajo pone de relieve una debilidad persistente de los VLM: convertir flujos visuales en representaciones espaciales globalmente coherentes. Un mejor razonamiento espacial es clave para agentes encarnados y sistemas que deben inferir geometría, disposición y puntos de vista a partir de video.

Puntos clave

  • 1.COVT entrena VLM para razonar mediante tokens visuales continuos y compactos.
  • 2.GST-Bench evalúa la conciencia espacial global en secuencias de video largas.
  • 3.El rendimiento del mejor VLM zero-shot queda muy por detrás del de los humanos.

Investigadores presentaron Chain-of-Visual-Thought, un marco que entrena modelos de visión-lenguaje para razonar con tokens visuales continuos y compactos que codifican señales como apariencia 2D, geometría 3D, disposición espacial y bordes. El enfoque usa alrededor de 20 tokens, destila señales de expertos visuales ligeros y puede decodificar de forma opcional predicciones densas como profundidad, segmentación, bordes y características DINO para mejorar la interpretabilidad. Por separado, el benchmark GST-Bench evalúa la inteligencia espacial global en video mediante preguntas verificadas por humanos a partir de 6.790 minutos de video generado sintéticamente, e informa que el VLM zero-shot más sólido obtuvo 42,68 puntos frente a 79,08 de los humanos.

Pruébalo hoy

Lee GST-Bench antes de usar VLM en tareas espaciales de video de largo horizonte, y evalúa si una supervisión con tokens visuales al estilo de COVT encaja en tu pipeline de modelos.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación