Pesquisadores miram lacunas de memória em agentes de IA de longo horizonte
Novos artigos propõem versionamento, decaimento temporal e estruturas de teste para tornar a memória de agentes mais confiável.
Por que importa
A pesquisa aponta a memória como um gargalo central para agentes que precisam operar entre sessões, lidar com fatos mutáveis e executar fluxos de trabalho prolongados. Também destaca riscos de segurança e confiabilidade, incluindo contexto desatualizado, corrupção de memória e envenenamento persistente.
Pontos-chave
- 1.A memória atual de agentes muitas vezes se comporta como recuperação, não como aprendizado.
- 2.ChronoMem adiciona rollback semântico para estados de memória.
- 3.ScrubJay-MEM usa decaimento temporal para reduzir a recuperação de memórias desatualizadas.
Um conjunto de artigos recentes no arXiv examina limitações dos atuais sistemas de memória de agentes baseados em LLMs, argumentando que repositórios de recuperação, scratchpads e gestão de contexto muitas vezes funcionam como consulta, e não como aprendizado real. Os trabalhos incluem ChronoMem, uma camada de controle de versão semântico para a memória de agentes no Agent Development Kit open-source do Google; ScrubJay-MEM, um desenho de memória por recuperação que usa decaimento temporal condicionado por tipo; e OneDayAgent, uma estrutura de teste avaliada em 104 tarefas de longo horizonte. Os artigos também analisam a memória de agentes como base para agentes de longo horizonte e autoevolutivos.
⚡ Experimente hoje
Audite implementações de memória de agentes quanto a rollback, decaimento de fatos obsoletos e comportamento após atualizações antes de implantar agentes de longa duração.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLContextual Agentic Memory is a Memo, Not True MemoryAug 6, 12:00 PM↗
- arXiv cs.CLChronoMem: Version Control and Semantic Rollback for Large Language Model Agent MemoryAug 6, 12:00 PM↗
- arXiv cs.CLA Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon AgentsAug 6, 12:00 PM↗
- arXiv cs.CLOneDayAgent: Towards a Long-Horizon Harness for Autonomous AgentsAug 6, 12:00 PM↗
- arXiv cs.CLCaching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory SystemsAug 6, 12:00 PM↗
- arXiv cs.AIA Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon AgentsAug 6, 12:00 PM↗
- arXiv cs.AIContextual Agentic Memory is a Memo, Not True MemoryAug 6, 12:00 PM↗
- arXiv cs.AIOneDayAgent: Towards a Long-Horizon Harness for Autonomous AgentsAug 6, 12:00 PM↗
- arXiv cs.LGOneDayAgent: Towards a Long-Horizon Harness for Autonomous AgentsAug 6, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIBeyond Retrieval: Analytic Memory for Multimodal AgentsAug 5, 12:00 PM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
- arXiv cs.AIVerifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model AgentsAug 5, 12:00 PM↗
- arXiv cs.CLMetis: Memory Foundation ModelAug 5, 12:00 PM↗
- arXiv cs.LGMetis: Memory Foundation ModelAug 5, 12:00 PM↗
- arXiv cs.AIWhen Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation BoundaryAug 4, 12:00 PM↗
- arXiv cs.AIReliable Post-Retrieval Assembly for Agent Memory: Separating Evidence Extraction from Policy ExecutionAug 4, 12:00 PM↗
- arXiv cs.AIStop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIAgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI AgentsAug 4, 12:00 PM↗
- arXiv cs.AIMemoryForge: Synthesize Lifelong Memory for Human-Like LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIHarness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure TrajectoriesAug 4, 12:00 PM↗
- arXiv cs.AIMemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIWhen Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation BoundaryAug 4, 12:00 PM↗
- arXiv cs.AIV-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic MemoryAug 4, 12:00 PM↗
- arXiv cs.AITrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue AgentsAug 4, 12:00 PM↗
- arXiv cs.AIPMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIPersonalizing Large Language Model Agents with Small Policy ModelsAug 4, 12:00 PM↗
- arXiv cs.LGMemoryForge: Synthesize Lifelong Memory for Human-Like LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.LGHarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent HarnessesAug 4, 12:00 PM↗
- arXiv cs.LGStop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.CLReliable Post-Retrieval Assembly for Agent Memory: Separating Evidence Extraction from Policy ExecutionAug 4, 12:00 PM↗
- arXiv cs.CLHarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent HarnessesAug 4, 12:00 PM↗
- arXiv cs.CLV-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic MemoryAug 4, 12:00 PM↗
- arXiv cs.CLAgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI AgentsAug 4, 12:00 PM↗
- arXiv cs.CLMemoryForge: Synthesize Lifelong Memory for Human-Like LLM AgentsAug 4, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores miram lacunas de raciocínio espacial em VLMs
Novos artigos propõem memória, RL e benchmarks para inteligência espacial em sistemas de visão-linguagem.
Google lança Gemini 3.7 Flash para programação e agentes
O novo modelo Flash está disponível na Gemini API, no Google AI Studio, no Android Studio e em ferramentas empresariais.
Novos estudos investigam inteligência espacial em IA de visão
SpaRRTa, SMA e PinpointQA testam ou aprimoram o raciocínio espacial em sistemas de IA visual e incorporada.