Video-DR vise la recherche approfondie sur la vidéo continue
L’article arXiv propose un agent multimodal ancré dans la vidéo et un benchmark de 200 tâches.
Pourquoi c'est important
Ce travail met en évidence les lacunes d’évaluation et d’entraînement des agents qui doivent raisonner sur la vidéo plutôt que sur des images statiques. Son benchmark et ses contraintes d’usage des outils pourraient influencer la manière dont les laboratoires testent les agents de recherche multimodaux pour une exécution ancrée dans les données.
Points clés
- 1.Video-DR étend les agents de recherche approfondie des images statiques à la vidéo continue.
- 2.Video-DR-Bench comprend 200 instances VQA complexes et multi-sauts.
- 3.Le résultat rapporté pour Video-DeepResearch-35B-A3B est de 64,0 % de précision moyenne.
Des chercheurs ont présenté Video-DeepResearch, ou Video-DR, un cadre d’agent multimodal conçu pour mener des recherches approfondies sur des flux vidéo continus avec exploration du web ouvert. Selon l’article, les modèles actuels présentent un biais de modalité, contournant les outils visuels au profit de la recherche textuelle, ainsi qu’une fuite de connaissances paramétriques, en s’appuyant sur leur mémoire interne plutôt que sur l’usage d’outils. Video-DR repose sur un pipeline perception-exploration découplé, un déverrouillage progressif des outils par étapes, un fine-tuning supervisé et GRPO ; son modèle Video-DeepResearch-35B-A3B a atteint 64,0 % de précision moyenne sur le nouveau Video-DR-Bench de 200 instances.
⚡ À tester aujourd'hui
Lisez l’article et la conception du benchmark avant de construire des agents de recherche vidéo combinant ancrage visuel et recherche web.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.