AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

OneDayAgent testa fluxos de trabalho autônomos de longo horizonte para agentes

O harness gerencia decomposição de tarefas, memória e verificação em 104 tarefas de benchmark.

Por que importa

O trabalho mira modos de falha persistentes em sistemas agentic, incluindo desvio de objetivo, perda de estado e estouro de contexto. O desempenho relatado em cinco LLMs de backend de três famílias de modelos sugere que o design do harness pode melhorar a confiabilidade de longo horizonte independentemente de um único modelo.

Pontos-chave

  • 1.O OneDayAgent gerencia decomposição, memória e verificação final.
  • 2.Ele marcou 0,821 em 104 tarefas do AgentIF-OneDay com GLM-5.2.
  • 3.O harness rodou em cinco backends de LLM de três famílias de modelos.

Pesquisadores apresentaram o OneDayAgent, um harness para agentes autônomos que lidam com solicitações cotidianas em aberto nas áreas de trabalho, estudo e vida pessoal. O sistema divide os pedidos em subtarefas delimitadas, mantém memória de execução sob pressão de contexto e verifica e corrige os entregáveis finais. No AgentIF-OneDay, ele foi avaliado em 104 tarefas e alcançou uma pontuação geral de 0,821 usando o backend GLM-5.2.

Experimente hoje

Leia o paper antes de projetar agentes de longo horizonte que precisam preservar objetivos, memória e qualidade dos entregáveis ao longo de muitas etapas.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa