PAST-Bench testa se agentes pessoais melhoram com o tempo
O benchmark mede ganhos a partir de experiência retida em diferentes modelos, frameworks e tarefas de agentes.
Por que importa
O trabalho oferece aos desenvolvedores de agentes uma forma mais direcionada de avaliar alegações de aprendizado de longo prazo, separando ganhos de desempenho das evidências de que mecanismos de memória e atualização de fato os causaram.
Pontos-chave
- 1.O PAST-Bench abrange 26 cenários e 204 episódios.
- 2.Os testes comparam execuções com experiência retida a controles equivalentes.
- 3.Os ganhos relatados variam entre capacidades e caminhos causais.
Pesquisadores apresentaram o PAST-Bench, um benchmark para testar se agentes pessoais de IA transformam experiência retida em comportamento futuro melhor. O benchmark compara sequências de tarefas em sessões novas com a experiência retida ativada ou desativada em 26 cenários e 204 episódios. Em sete modelos-base e quatro frameworks de agentes, os autores relatam melhorias reais, mas irregulares, com ganhos gerais semelhantes às vezes diferindo quanto a terem seguido o caminho pretendido de salvar, recuperar e atualizar.
⚡ Experimente hoje
Use ablações no estilo do PAST-Bench antes de afirmar que um agente pessoal melhora com experiência retida.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google testa AMIE em consultas médicas por vídeo em tempo real
O sistema de pesquisa baseado no Gemini foi avaliado em consultas simuladas de telessaúde.
Modelo da Anthropic avança em trabalho sobre a hipótese de Riemann
Um modelo ainda não lançado da Anthropic fez avanços no problema matemático há muito tempo sem solução, segundo o TechCrunch.
IBM detalha método de memória de agentes ALTK-Evolve
O sistema recupera diretrizes específicas da tarefa para reduzir tokens de inferência em comparação com o ACE.