AAI News Hub
PesquisaFri, August 7, 2026·6d ago2 sources corroborating

HarnessOpt-Bench testa LLMs em otimização de harnesses

O benchmark avalia como LLMs melhoram prompts de agentes, ferramentas, fluxo de controle e código de orquestração.

Por que importa

O trabalho reflete a atenção crescente a ganhos de desempenho de agentes vindos de prompts, ferramentas, memória e código de orquestração, e não apenas dos pesos do modelo. Um benchmark comum poderia tornar as alegações de otimização de harnesses mais comparáveis entre LLMs de fronteira e sistemas de agentes.

Pontos-chave

  • 1.HarnessOpt-Bench mira a otimização ponta a ponta de harnesses de agentes.
  • 2.As pontuações usam ganho normalizado sobre um harness inicial em testes reservados.
  • 3.A execução confiável mede o uso de recursos e preserva trilhas de auditoria.

Pesquisadores apresentaram o HarnessOpt-Bench, um benchmark para medir quão bem LLMs conseguem otimizar os harnesses em torno de sistemas agênticos. No protocolo, um LLM otimizador recebe um harness inicial, feedback de avaliação com notas e um orçamento fixo de avaliação, edita o harness e submete um candidato final, pontuado pelo ganho normalizado em uma partição de teste reservada. O benchmark usa um ambiente de execução confiável para impor limites de avaliação, medir o uso de recursos do agente-alvo e preservar versões candidatas para auditoria.

Experimente hoje

Use testes reservados e limites rigorosos de avaliação ao permitir que LLMs otimizem harnesses de agentes.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa