연구진, VLM의 공간 추론 한계 겨냥
COVT는 시각 토큰 기반 추론을 더하고, GST-Bench는 동영상 속 전역 공간 인식을 평가한다.
왜 중요한가
이 연구는 VLM의 지속적인 약점, 즉 시각 스트림을 전역적으로 일관된 공간 표현으로 변환하는 능력의 한계를 보여준다. 더 나은 공간 추론은 동영상에서 기하, 배치, 시점을 추론해야 하는 embodied agent와 시스템에 핵심적이다.
핵심 포인트
- 1.COVT는 VLM이 압축 연속 시각 토큰을 통해 추론하도록 훈련한다.
- 2.GST-Bench는 긴 동영상 스트림에서 전역 공간 인식을 테스트한다.
- 3.최상위 zero-shot VLM 성능은 인간보다 큰 격차로 뒤처진다.
연구진은 Chain-of-Visual-Thought를 공개했다. 이 프레임워크는 비전-언어 모델이 2D 외형, 3D 기하, 공간 배치, 경계선 같은 단서를 인코딩한 압축 연속 시각 토큰으로 추론하도록 훈련한다. 이 접근법은 약 20개의 토큰을 사용하며, 경량 비전 전문가 모델에서 신호를 증류하고, 해석 가능성을 위해 깊이, 세그멘테이션, 경계선, DINO 특징 같은 조밀한 예측을 선택적으로 디코딩할 수 있다. 별도의 GST-Bench 벤치마크는 합성 생성 동영상 6,790분에서 인간 검증을 거친 질문으로 동영상 내 전역 공간 지능을 평가하며, 가장 강력한 zero-shot VLM이 42.68점을 기록한 반면 인간은 79.08점을 기록했다고 보고했다.
⚡ 오늘 바로 활용
장기 범위의 공간 동영상 작업에 VLM을 사용하기 전에 GST-Bench를 검토하고, COVT식 시각 토큰 감독이 모델 파이프라인에 적합한지 평가해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- arXiv cs.LGChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- HF Daily PapersGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?Aug 6, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.