AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

研究测试 VLM 在空间与视觉推理上的短板

新基准和新方法正在检验视觉语言模型如何处理密集感知与空间意识。

为什么重要

这些研究指出,VLM 中以语言为中心的推理能力与密集视觉理解之间仍存在持续错位。具身智能体的进展,可能取决于模型能否在更长的视觉流中保留几何关系、布局、深度和精细视觉细节。

核心要点

  • 1.GST-Bench 显示,VLM 与人类在全局空间视频推理上存在巨大差距。
  • 2.COVT 加入连续视觉 token,用于深度、分割、边缘和 DINO 监督。
  • 3.SpatialCLI 训练 VLM 使用专门的空间工具,再将其内化。

近期多篇论文考察了视觉语言模型在感知和空间推理方面的局限。GST-Bench 利用 6,790 分钟合成视频中经人工验证的问题,评估模型在视频中的全局空间意识,并报告称表现最好的零样本模型得分为 42.68,而人类得分为 79.08。其他研究提出了 Chain-of-Visual-Thought 等方法,该方法使用约 20 个连续视觉 token;还有 SpatialCLI,它训练 VLM 使用并内化专门的空间工具。

今天就能用

在将 VLM 部署到空间或具身任务之前,应在密集感知和长程空间案例上测试它们,而不只是做图像级 VQA。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究