AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

GROVE añade memoria por capas para asistentes de video en streaming

El marco, que no requiere entrenamiento, comparte una misma memoria de video para preguntas y respuestas reactivas y asistencia proactiva.

Por qué importa

El trabajo señala las arquitecturas de memoria como una palanca clave para asistentes vestibles y de video-lenguaje, donde los modelos deben usar evidencia visual pasada antes de que se conozcan las preguntas futuras. También muestra un interés creciente en mejorar el comportamiento de los Video-LLM sin cambiar el modelo subyacente.

Puntos clave

  • 1.GROVE construye memoria temporal a partir de flujos de video continuos.
  • 2.Admite tanto preguntas y respuestas reactivas como asistencia proactiva.
  • 3.ObjectStream usa objetos latentes como anclajes persistentes de memoria de video.

Investigadores presentaron GROVE, un marco sin entrenamiento para experiencias de video en streaming que construye memoria de forma causal a partir de un flujo de video continuo. El sistema conserva evidencia perceptiva detallada y la consolida en momentos con marca temporal, episodios coherentes y patrones recurrentes entre días, con capacidades de recuperación ajustadas a cada nivel. Los autores señalan que GROVE obtuvo los mejores resultados entre los métodos comparados en varios benchmarks, incluidos MM-lifelong y EgoServe. Un paper relacionado en arXiv, ObjectStream, también apunta a la comprensión de video en streaming con memoria sin entrenamiento, usando objetos latentes como anclajes persistentes.

Pruébalo hoy

Lee los papers de GROVE y ObjectStream antes de diseñar memoria de largo contexto para asistentes de video en streaming.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación