AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

GROVE ajoute une mémoire en couches pour les assistants vidéo en streaming

Ce framework sans entraînement partage une même mémoire vidéo pour la question-réponse réactive et l’assistance proactive.

Pourquoi c'est important

Ces travaux désignent les architectures de mémoire comme un levier clé pour les assistants portables et vidéo-langage, qui doivent exploiter des éléments visuels passés avant même de connaître les questions futures. Ils montrent aussi l’intérêt croissant pour l’amélioration du comportement des Video-LLM sans modifier le modèle sous-jacent.

Points clés

  • 1.GROVE construit une mémoire temporelle à partir de flux vidéo continus.
  • 2.Il prend en charge à la fois la question-réponse réactive et l’assistance proactive.
  • 3.ObjectStream utilise des objets latents comme points d’ancrage persistants pour la mémoire vidéo.

Des chercheurs ont présenté GROVE, un framework sans entraînement pour l’expérience vidéo en streaming, qui construit une mémoire de façon causale à partir d’un flux vidéo continu. Le système conserve des éléments perceptifs fins et les consolide en moments horodatés, en épisodes cohérents et en motifs récurrents d’un jour à l’autre, avec des capacités de récupération adaptées à chaque niveau. Les auteurs indiquent que GROVE a obtenu les meilleurs résultats parmi les méthodes comparées sur plusieurs benchmarks, dont MM-lifelong et EgoServe. Un article arXiv connexe, ObjectStream, vise lui aussi la compréhension de vidéos en streaming avec une mémoire sans entraînement, en utilisant des objets latents comme points d’ancrage persistants.

À tester aujourd'hui

Lisez les articles GROVE et ObjectStream avant de concevoir une mémoire à long contexte pour des assistants vidéo en streaming.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche