研究がVLMの空間・視覚推論の弱点を検証
新たなベンチマークと手法が、視覚言語モデルにおける高密度な知覚と空間認識の扱いを探っている。
なぜ重要か
これらの研究は、VLMにおいて言語中心の推論と高密度な視覚理解の間に根強いミスマッチがあることを示している。身体性を持つエージェントの進展には、より長い視覚ストリームの中で形状、配置、奥行き、細かな視覚的ディテールを保持できるモデルが必要になる可能性がある。
要点
- 1.GST-Benchは、動画全体にわたる空間推論でVLMと人間の間に大きな差があることを示している。
- 2.COVTは、奥行き、セグメンテーション、エッジ、DINOによる教師信号のために連続的な視覚トークンを追加する。
- 3.SpatialCLIは、VLMに専門的な空間ツールを使わせ、その後それを内在化させるよう訓練する。
最近の複数の論文が、視覚言語モデルの知覚能力と空間推論の限界を検証している。GST-Benchは、6,790分の合成動画から作成した人間検証済みの質問を用いて、動画におけるグローバルな空間認識を評価し、最上位のゼロショットモデルのスコアは42.68、人間のスコアは79.08だったと報告した。ほかの研究では、約20個の連続的な視覚トークンを使うChain-of-Visual-Thoughtや、VLMに専門的な空間ツールの利用と内在化を学習させるSpatialCLIなどの手法が提案されている。
⚡ 今日から使える
空間タスクや身体性を伴うタスクにVLMを導入する前に、画像単位のVQAだけでなく、高密度な知覚や長期的な空間把握を要するケースで検証すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- arXiv cs.LGChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- HF Daily PapersGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?Aug 6, 4:00 AM↗
- arXiv cs.AISpatialCLI: Learning to Reason With Spatial Tools, Then Without ThemAug 5, 12:00 PM↗
- arXiv cs.CLVLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic AnchorsAug 5, 12:00 PM↗
- arXiv cs.AILinguistic Context Recodes Visual Representations in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGSpatioLM: Towards General Physical Spatial Intelligence in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLHAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSpatioLM: Towards General Physical Spatial Intelligence in Vision-Language ModelsAug 4, 12:00 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。