AAI News Hub
研究Thu, August 6, 2026·Aug 62 sources corroborating

研究者ら、VLMの空間推論の弱点に照準

COVTが視覚トークンによる推論を追加し、GST-Benchは動画における大域的な空間認識を検証。

なぜ重要か

この研究は、視覚ストリームを大域的に一貫した空間表現へ変換するという、VLMに残る根深い弱点を浮き彫りにしている。より優れた空間推論は、動画から形状、レイアウト、視点を推定しなければならない身体性エージェントやシステムにとって中核的な要素だ。

要点

  • 1.COVTは、コンパクトな連続視覚トークンを通じて推論するようVLMを訓練する。
  • 2.GST-Benchは、長い動画ストリームにわたる大域的な空間認識を検証する。
  • 3.トップのゼロショットVLMの性能は、人間に大きく後れを取っている。

研究者らは、Chain-of-Visual-Thoughtを発表した。これは、2Dの見た目、3D形状、空間レイアウト、エッジといった手がかりを符号化したコンパクトな連続視覚トークンを使って推論するよう、vision-language modelを訓練するフレームワークだ。この手法はおよそ20個のトークンを用い、軽量なビジョン専門モデルから信号を蒸留する。また、解釈性を高めるために、深度、セグメンテーション、エッジ、DINO特徴量などの密な予測を任意でデコードできる。別のベンチマークであるGST-Benchは、合成生成された6,790分の動画から人手で検証した質問を使い、動画における大域的な空間知能を評価するもので、最も強力なゼロショットVLMのスコアは42.68、人間は79.08だったと報告している。

今日から使える

長期的な空間動画タスクにVLMを使う前にGST-Benchを確認し、COVTのような視覚トークン監督が自分のモデルパイプラインに適合するかを評価すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究