AAI News Hub
PesquisaFri, August 7, 2026·6d ago2 sources corroborating

Pesquisadores apresentam o HarnessOpt-Bench para agentes de LLM

O benchmark testa até que ponto LLMs conseguem aprimorar harnesses de agentes sob orçamentos fixos de avaliação.

Por que importa

O trabalho desloca a avaliação dos pesos do modelo isoladamente para os prompts, ferramentas, fluxo de controle, memória e código de orquestração que moldam o desempenho dos agentes. Ele oferece um protocolo comum para medir se LLMs de fronteira conseguem melhorar sistemas de agentes por meio de mudanças no harness sob restrições realistas de avaliação.

Pontos-chave

  • 1.O HarnessOpt-Bench avalia a otimização de harnesses de ponta a ponta para agentes de LLM.
  • 2.A pontuação usa ganho normalizado em relação a um harness inicial em testes reservados.
  • 3.O benchmark inclui controles de execução para auditoria e medição de recursos.

Pesquisadores apresentaram o HarnessOpt-Bench, um benchmark para avaliar a otimização automatizada de harnesses em sistemas de agentes baseados em LLMs. Na configuração, um otimizador LLM recebe o harness inicial de um agente-alvo, feedback de avaliação com notas e um orçamento fixo de avaliação; em seguida, edita o harness e envia um candidato final. O candidato é pontuado pelo ganho normalizado em relação ao harness inicial em uma partição de teste reservada, com um ambiente de execução confiável que impõe limites de avaliação, mede o uso de recursos e preserva versões para auditoria.

Experimente hoje

Use testes reservados e medição de recursos ao experimentar otimização automatizada de prompts, ferramentas ou orquestração de agentes.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa