AAI News Hub
PesquisaMon, August 3, 2026·Aug 3

LongHorizon-Harness mira o estado de agentes de longo horizonte

O ambiente de pesquisa separa o estado da tarefa da execução e verifica atualizações por meio de um ciclo de auditoria.

Por que importa

O trabalho enfrenta um modo de falha central em agentes de longa duração: erros cumulativos gerados por autoavaliações desatualizadas ou incorretas. Um gerenciamento de estado explícito e verificado de forma independente pode tornar sistemas de agentes mais confiáveis em fluxos de trabalho intensivos em ferramentas.

Pontos-chave

  • 1.O LongHorizon-Harness armazena o estado da tarefa fora do contexto de execução.
  • 2.O ciclo MEA verifica as atualizações antes da próxima subtarefa.
  • 3.Os ganhos de benchmark relatados incluem o Qwen 3.7-Plus no WeaveBench.

Pesquisadores propuseram o LongHorizon-Harness, um framework para agentes LLM de longo horizonte que gerencia o estado da tarefa fora do contexto crescente do modelo. Seu ciclo Manage-Execute-Audit usa um gerenciador para escolher subtarefas, um executor com contexto novo para agir e um auditor somente leitura para verificar o estado do ambiente antes de atualizar o registro da tarefa. O artigo relata ganhos para o Qwen 3.7-Plus no WeaveBench, no Terminal-Bench 2.1 e no OSWorld 2.0.

Experimente hoje

Ao criar agentes de longo horizonte, separe o estado da tarefa do contexto de execução e verifique as mudanças de estado em relação ao ambiente antes de continuar.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa