AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

Video-DR 瞄准基于视频的多模态研究

该项目为多模态深度研究 Agent 增加了视频流 grounding 能力,并推出包含 200 项任务的基准。

为什么重要

这项工作让人们更关注研究型 Agent 能否基于视频证据来支撑答案,而不是只依赖文本检索或记忆中的事实。其基准可能有助于在更真实、时间信息更密集的任务中评估多模态 Agent。

核心要点

  • 1.Video-DR 将深度研究 Agent 从图像扩展到视频流。
  • 2.该基准包含 200 个复杂的多跳 VQA 任务。
  • 3.报告的 Video-DeepResearch-35B-A3B 准确率为 64.0%。

研究人员推出了 Video-DeepResearch,简称 Video-DR,这是一个面向多模态 Agent 的框架,可在处理连续视频流的同时进行开放网络探索。作者指出,当前系统存在两大瓶颈:Agent 更偏向文本搜索而非视觉工具,以及依赖内部知识而不是基于工具执行任务。他们还发布了 Video-DR-Bench,这是一个包含 200 个实例的多跳视频问答基准,并报告称 Video-DeepResearch-35B-A3B 的平均准确率为 64.0%,高于 Claude-4.5-Sonnet 的 59.0%。

今天就能用

用 Video-DR-Bench 测试你的多模态 Agent 是否真的会在网页检索之前使用视觉工具。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究