AAI News Hub
연구Thu, August 6, 2026·Aug 62 sources corroborating

연구진, VLM의 공간 추론 한계 겨냥

COVT는 시각 토큰 기반 추론을 더하고, GST-Bench는 동영상 속 전역 공간 인식을 평가한다.

왜 중요한가

이 연구는 VLM의 지속적인 약점, 즉 시각 스트림을 전역적으로 일관된 공간 표현으로 변환하는 능력의 한계를 보여준다. 더 나은 공간 추론은 동영상에서 기하, 배치, 시점을 추론해야 하는 embodied agent와 시스템에 핵심적이다.

핵심 포인트

  • 1.COVT는 VLM이 압축 연속 시각 토큰을 통해 추론하도록 훈련한다.
  • 2.GST-Bench는 긴 동영상 스트림에서 전역 공간 인식을 테스트한다.
  • 3.최상위 zero-shot VLM 성능은 인간보다 큰 격차로 뒤처진다.

연구진은 Chain-of-Visual-Thought를 공개했다. 이 프레임워크는 비전-언어 모델이 2D 외형, 3D 기하, 공간 배치, 경계선 같은 단서를 인코딩한 압축 연속 시각 토큰으로 추론하도록 훈련한다. 이 접근법은 약 20개의 토큰을 사용하며, 경량 비전 전문가 모델에서 신호를 증류하고, 해석 가능성을 위해 깊이, 세그멘테이션, 경계선, DINO 특징 같은 조밀한 예측을 선택적으로 디코딩할 수 있다. 별도의 GST-Bench 벤치마크는 합성 생성 동영상 6,790분에서 인간 검증을 거친 질문으로 동영상 내 전역 공간 지능을 평가하며, 가장 강력한 zero-shot VLM이 42.68점을 기록한 반면 인간은 79.08점을 기록했다고 보고했다.

오늘 바로 활용

장기 범위의 공간 동영상 작업에 VLM을 사용하기 전에 GST-Bench를 검토하고, COVT식 시각 토큰 감독이 모델 파이프라인에 적합한지 평가해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구