IBM testa quanta memória agentes de IA precisam
Estudo ALTK-Evolve mostra que ganhos com memória em agentes dependem da capacidade do modelo e da estratégia de entrega.
Por que importa
Os resultados sugerem que a memória de agentes deve ser tratada como uma escolha de arquitetura específica para cada modelo, não como um recurso genérico. Em agentes de produção, a estratégia de memória pode afetar tanto a confiabilidade quanto o custo de inferência.
Pontos-chave
- 1.O ALTK-Evolve adiciona memória a agentes sem atualizar os pesos do modelo.
- 2.Os ganhos com memória variaram conforme a capacidade do modelo e a margem de melhora da tarefa.
- 3.A recuperação curada melhorou o gpt-oss-120b com custo adicional de 5% em tokens.
A IBM Research disse que seu sistema ALTK-Evolve melhorou o desempenho de agentes de IA ao destilar diretrizes reutilizáveis de trajetórias anteriores e inseri-las no momento da inferência, sem atualização de pesos nem anotação humana. Em uma avaliação no AppWorld com 585 tarefas de várias etapas em oito modelos, os modelos mais fortes que ainda tinham margem de melhora foram os que mais se beneficiaram do conjunto completo de diretrizes, enquanto modelos mais fracos tiveram melhor desempenho com um núcleo compacto combinado a recuperação específica por tarefa. A publicação também informou que o gpt-oss-120b ganhou 16,1 pontos percentuais em conclusão de tarefas com recuperação curada a um custo adicional de 5% em tokens, enquanto o GLM-5 não apresentou ganho mensurável.
⚡ Experimente hoje
Compare memória completa e memória baseada em recuperação nas tarefas dos seus agentes antes de expandir o contexto por padrão.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.