研究人员瞄准 VLM 空间推理短板
COVT 引入视觉 token 推理,GST-Bench 则测试视频中的全局空间感知能力。
为什么重要
这项工作凸显了 VLM 的一个长期弱点:将视觉流转换为全局一致的空间表征。更强的空间推理能力,对具身智能体以及必须从视频中推断几何、布局和视角的系统至关重要。
核心要点
- 1.COVT 训练 VLM 通过紧凑连续视觉 token 进行推理。
- 2.GST-Bench 测试长视频流中的全局空间感知能力。
- 3.顶级零样本 VLM 的表现仍大幅落后于人类。
研究人员提出了 Chain-of-Visual-Thought,这是一个训练视觉语言模型使用紧凑连续视觉 token 进行推理的框架,这些 token 编码了 2D 外观、3D 几何、空间布局和边缘等线索。该方法大约使用 20 个 token,从轻量级视觉专家中蒸馏信号,并可选择解码深度、分割、边缘和 DINO 特征等密集预测结果,以增强可解释性。另一项 GST-Bench 基准则通过来自 6,790 分钟合成生成视频、经人工验证的问题,评估视频中的全局空间智能;报告显示,表现最强的零样本 VLM 得分为 42.68,而人类为 79.08。
⚡ 今天就能用
在将 VLM 用于长时程空间视频任务前,先阅读 GST-Bench,并评估类似 COVT 的视觉 token 监督是否适合你的模型流程。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- arXiv cs.LGChain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual TokensAug 6, 12:00 PM↗
- HF Daily PapersGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?Aug 6, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。