AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Video-DR vise la recherche approfondie sur la vidéo continue

L’article arXiv propose un agent multimodal ancré dans la vidéo et un benchmark de 200 tâches.

Pourquoi c'est important

Ce travail met en évidence les lacunes d’évaluation et d’entraînement des agents qui doivent raisonner sur la vidéo plutôt que sur des images statiques. Son benchmark et ses contraintes d’usage des outils pourraient influencer la manière dont les laboratoires testent les agents de recherche multimodaux pour une exécution ancrée dans les données.

Points clés

  • 1.Video-DR étend les agents de recherche approfondie des images statiques à la vidéo continue.
  • 2.Video-DR-Bench comprend 200 instances VQA complexes et multi-sauts.
  • 3.Le résultat rapporté pour Video-DeepResearch-35B-A3B est de 64,0 % de précision moyenne.

Des chercheurs ont présenté Video-DeepResearch, ou Video-DR, un cadre d’agent multimodal conçu pour mener des recherches approfondies sur des flux vidéo continus avec exploration du web ouvert. Selon l’article, les modèles actuels présentent un biais de modalité, contournant les outils visuels au profit de la recherche textuelle, ainsi qu’une fuite de connaissances paramétriques, en s’appuyant sur leur mémoire interne plutôt que sur l’usage d’outils. Video-DR repose sur un pipeline perception-exploration découplé, un déverrouillage progressif des outils par étapes, un fine-tuning supervisé et GRPO ; son modèle Video-DeepResearch-35B-A3B a atteint 64,0 % de précision moyenne sur le nouveau Video-DR-Bench de 200 instances.

À tester aujourd'hui

Lisez l’article et la conception du benchmark avant de construire des agents de recherche vidéo combinant ancrage visuel et recherche web.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche