AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

Video-DR apunta a la investigación profunda sobre video continuo

El paper de arXiv propone un agente multimodal basado en video y un benchmark de 200 tareas.

Por qué importa

El trabajo pone de relieve brechas de evaluación y entrenamiento en agentes que deben razonar sobre video, no sobre imágenes estáticas. Su benchmark y sus restricciones de uso de herramientas podrían influir en cómo los laboratorios prueban agentes de investigación multimodal para una ejecución fundamentada.

Puntos clave

  • 1.Video-DR extiende los agentes de investigación profunda desde imágenes estáticas al video continuo.
  • 2.Video-DR-Bench contiene 200 instancias complejas de VQA multi-hop.
  • 3.El resultado reportado de Video-DeepResearch-35B-A3B es una precisión promedio del 64,0%.

Investigadores presentaron Video-DeepResearch, o Video-DR, un framework de agente multimodal diseñado para realizar investigación profunda sobre flujos de video continuo con exploración de la web abierta. El paper afirma que los modelos actuales muestran sesgo de modalidad, al eludir herramientas visuales en favor de búsquedas de texto, y filtración de conocimiento paramétrico, al depender de su memoria interna en lugar del uso de herramientas. Video-DR utiliza un pipeline desacoplado de percepción y exploración, desbloqueo de herramientas por etapas, fine-tuning supervisado y GRPO; su modelo Video-DeepResearch-35B-A3B alcanzó una precisión promedio del 64,0% en el nuevo Video-DR-Bench de 200 instancias.

Pruébalo hoy

Lee el paper y el diseño del benchmark antes de crear agentes de investigación en video que combinen fundamentación visual con recuperación web.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación