Video-DR apunta a la investigación profunda sobre video continuo
El paper de arXiv propone un agente multimodal basado en video y un benchmark de 200 tareas.
Por qué importa
El trabajo pone de relieve brechas de evaluación y entrenamiento en agentes que deben razonar sobre video, no sobre imágenes estáticas. Su benchmark y sus restricciones de uso de herramientas podrían influir en cómo los laboratorios prueban agentes de investigación multimodal para una ejecución fundamentada.
Puntos clave
- 1.Video-DR extiende los agentes de investigación profunda desde imágenes estáticas al video continuo.
- 2.Video-DR-Bench contiene 200 instancias complejas de VQA multi-hop.
- 3.El resultado reportado de Video-DeepResearch-35B-A3B es una precisión promedio del 64,0%.
Investigadores presentaron Video-DeepResearch, o Video-DR, un framework de agente multimodal diseñado para realizar investigación profunda sobre flujos de video continuo con exploración de la web abierta. El paper afirma que los modelos actuales muestran sesgo de modalidad, al eludir herramientas visuales en favor de búsquedas de texto, y filtración de conocimiento paramétrico, al depender de su memoria interna en lugar del uso de herramientas. Video-DR utiliza un pipeline desacoplado de percepción y exploración, desbloqueo de herramientas por etapas, fine-tuning supervisado y GRPO; su modelo Video-DeepResearch-35B-A3B alcanzó una precisión promedio del 64,0% en el nuevo Video-DR-Bench de 200 instancias.
⚡ Pruébalo hoy
Lee el paper y el diseño del benchmark antes de crear agentes de investigación en video que combinen fundamentación visual con recuperación web.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores presentan TTP-D para la planificación de rutas con camiones y drones
El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.