AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

Video-DR mira pesquisas aprofundadas em vídeos contínuos

O artigo no arXiv propõe um agente multimodal fundamentado em vídeo e um benchmark com 200 tarefas.

Por que importa

O trabalho evidencia lacunas de avaliação e treinamento para agentes que precisam raciocinar sobre vídeo, não apenas sobre imagens estáticas. Seu benchmark e suas restrições de uso de ferramentas podem influenciar a forma como laboratórios testam agentes de pesquisa multimodais para execução fundamentada.

Pontos-chave

  • 1.O Video-DR estende agentes de pesquisa aprofundada de imagens estáticas para vídeos contínuos.
  • 2.O Video-DR-Bench contém 200 instâncias complexas de VQA com múltiplas etapas.
  • 3.O resultado reportado do Video-DeepResearch-35B-A3B é de 64,0% de acurácia média.

Pesquisadores apresentaram o Video-DeepResearch, ou Video-DR, um framework de agente multimodal projetado para pesquisas aprofundadas em fluxos contínuos de vídeo com exploração da web aberta. Segundo o artigo, os modelos atuais exibem viés de modalidade, contornando ferramentas visuais em favor de buscas por texto, e vazamento de conhecimento paramétrico, recorrendo à memória interna em vez do uso de ferramentas. O Video-DR usa um pipeline desacoplado de percepção e exploração, liberação de ferramentas por etapas, ajuste fino supervisionado e GRPO; seu modelo Video-DeepResearch-35B-A3B alcançou 64,0% de acurácia média no novo Video-DR-Bench, com 200 instâncias.

Experimente hoje

Leia o artigo e o desenho do benchmark antes de criar agentes de pesquisa em vídeo que combinem fundamentação visual com recuperação na web.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa