AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

PAST-Bench testa se agentes pessoais melhoram com o tempo

O benchmark mede ganhos a partir de experiência retida em diferentes modelos, frameworks e tarefas de agentes.

Por que importa

O trabalho oferece aos desenvolvedores de agentes uma forma mais direcionada de avaliar alegações de aprendizado de longo prazo, separando ganhos de desempenho das evidências de que mecanismos de memória e atualização de fato os causaram.

Pontos-chave

  • 1.O PAST-Bench abrange 26 cenários e 204 episódios.
  • 2.Os testes comparam execuções com experiência retida a controles equivalentes.
  • 3.Os ganhos relatados variam entre capacidades e caminhos causais.

Pesquisadores apresentaram o PAST-Bench, um benchmark para testar se agentes pessoais de IA transformam experiência retida em comportamento futuro melhor. O benchmark compara sequências de tarefas em sessões novas com a experiência retida ativada ou desativada em 26 cenários e 204 episódios. Em sete modelos-base e quatro frameworks de agentes, os autores relatam melhorias reais, mas irregulares, com ganhos gerais semelhantes às vezes diferindo quanto a terem seguido o caminho pretendido de salvar, recuperar e atualizar.

Experimente hoje

Use ablações no estilo do PAST-Bench antes de afirmar que um agente pessoal melhora com experiência retida.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa