GROVE adiciona memória em camadas para assistentes de vídeo em streaming
O framework sem treinamento compartilha uma única memória de vídeo para QA reativo e assistência proativa.
Por que importa
O trabalho aponta as arquiteturas de memória como uma alavanca central para assistentes vestíveis e de vídeo-linguagem, nos quais os modelos precisam usar evidências visuais passadas antes que as perguntas futuras sejam conhecidas. Ele também mostra o interesse crescente em melhorar o comportamento de Video-LLMs sem alterar o modelo subjacente.
Pontos-chave
- 1.O GROVE constrói memória temporal a partir de fluxos contínuos de vídeo.
- 2.Ele oferece suporte tanto a QA reativo quanto a assistência proativa.
- 3.O ObjectStream usa objetos latentes como âncoras persistentes de memória de vídeo.
Pesquisadores apresentaram o GROVE, um framework sem treinamento para experiências de vídeo em streaming que constrói memória de forma causal a partir de um fluxo contínuo de vídeo. O sistema preserva evidências perceptivas em alto nível de detalhe e as consolida em momentos com marcação temporal, episódios coerentes e padrões recorrentes ao longo de vários dias, com habilidades de recuperação adaptadas a cada nível. Os autores relatam que o GROVE obteve os melhores resultados entre os métodos comparados em múltiplos benchmarks, incluindo MM-lifelong e EgoServe. Um artigo relacionado no arXiv, ObjectStream, também mira a compreensão de vídeo em streaming com memória sem treinamento, usando objetos latentes como âncoras persistentes.
⚡ Experimente hoje
Leia os artigos do GROVE e do ObjectStream antes de projetar memória de longo contexto para assistentes de vídeo em streaming.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIObjectStream: Latent Objects as Memory Anchors for Streaming Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIGROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video ExperienceAug 4, 12:00 PM↗
- HF Daily PapersGROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video ExperienceAug 3, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Pesquisadores propõem Power Law Graph Attention
PLGA generaliza a atenção por produto escalar escalonado e relata colapso de inferência sob invariância exata.