Video-DR 瞄准基于视频的多模态研究
该项目为多模态深度研究 Agent 增加了视频流 grounding 能力,并推出包含 200 项任务的基准。
为什么重要
这项工作让人们更关注研究型 Agent 能否基于视频证据来支撑答案,而不是只依赖文本检索或记忆中的事实。其基准可能有助于在更真实、时间信息更密集的任务中评估多模态 Agent。
核心要点
- 1.Video-DR 将深度研究 Agent 从图像扩展到视频流。
- 2.该基准包含 200 个复杂的多跳 VQA 任务。
- 3.报告的 Video-DeepResearch-35B-A3B 准确率为 64.0%。
研究人员推出了 Video-DeepResearch,简称 Video-DR,这是一个面向多模态 Agent 的框架,可在处理连续视频流的同时进行开放网络探索。作者指出,当前系统存在两大瓶颈:Agent 更偏向文本搜索而非视觉工具,以及依赖内部知识而不是基于工具执行任务。他们还发布了 Video-DR-Bench,这是一个包含 200 个实例的多跳视频问答基准,并报告称 Video-DeepResearch-35B-A3B 的平均准确率为 64.0%,高于 Claude-4.5-Sonnet 的 59.0%。
⚡ 今天就能用
用 Video-DR-Bench 测试你的多模态 Agent 是否真的会在网页检索之前使用视觉工具。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。