AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

GROVE adiciona memória em camadas para assistentes de vídeo em streaming

O framework sem treinamento compartilha uma única memória de vídeo para QA reativo e assistência proativa.

Por que importa

O trabalho aponta as arquiteturas de memória como uma alavanca central para assistentes vestíveis e de vídeo-linguagem, nos quais os modelos precisam usar evidências visuais passadas antes que as perguntas futuras sejam conhecidas. Ele também mostra o interesse crescente em melhorar o comportamento de Video-LLMs sem alterar o modelo subjacente.

Pontos-chave

  • 1.O GROVE constrói memória temporal a partir de fluxos contínuos de vídeo.
  • 2.Ele oferece suporte tanto a QA reativo quanto a assistência proativa.
  • 3.O ObjectStream usa objetos latentes como âncoras persistentes de memória de vídeo.

Pesquisadores apresentaram o GROVE, um framework sem treinamento para experiências de vídeo em streaming que constrói memória de forma causal a partir de um fluxo contínuo de vídeo. O sistema preserva evidências perceptivas em alto nível de detalhe e as consolida em momentos com marcação temporal, episódios coerentes e padrões recorrentes ao longo de vários dias, com habilidades de recuperação adaptadas a cada nível. Os autores relatam que o GROVE obteve os melhores resultados entre os métodos comparados em múltiplos benchmarks, incluindo MM-lifelong e EgoServe. Um artigo relacionado no arXiv, ObjectStream, também mira a compreensão de vídeo em streaming com memória sem treinamento, usando objetos latentes como âncoras persistentes.

Experimente hoje

Leia os artigos do GROVE e do ObjectStream antes de projetar memória de longo contexto para assistentes de vídeo em streaming.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa