Video-DR mira pesquisas aprofundadas em vídeos contínuos
O artigo no arXiv propõe um agente multimodal fundamentado em vídeo e um benchmark com 200 tarefas.
Por que importa
O trabalho evidencia lacunas de avaliação e treinamento para agentes que precisam raciocinar sobre vídeo, não apenas sobre imagens estáticas. Seu benchmark e suas restrições de uso de ferramentas podem influenciar a forma como laboratórios testam agentes de pesquisa multimodais para execução fundamentada.
Pontos-chave
- 1.O Video-DR estende agentes de pesquisa aprofundada de imagens estáticas para vídeos contínuos.
- 2.O Video-DR-Bench contém 200 instâncias complexas de VQA com múltiplas etapas.
- 3.O resultado reportado do Video-DeepResearch-35B-A3B é de 64,0% de acurácia média.
Pesquisadores apresentaram o Video-DeepResearch, ou Video-DR, um framework de agente multimodal projetado para pesquisas aprofundadas em fluxos contínuos de vídeo com exploração da web aberta. Segundo o artigo, os modelos atuais exibem viés de modalidade, contornando ferramentas visuais em favor de buscas por texto, e vazamento de conhecimento paramétrico, recorrendo à memória interna em vez do uso de ferramentas. O Video-DR usa um pipeline desacoplado de percepção e exploração, liberação de ferramentas por etapas, ajuste fino supervisionado e GRPO; seu modelo Video-DeepResearch-35B-A3B alcançou 64,0% de acurácia média no novo Video-DR-Bench, com 200 instâncias.
⚡ Experimente hoje
Leia o artigo e o desenho do benchmark antes de criar agentes de pesquisa em vídeo que combinem fundamentação visual com recuperação na web.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.