Pesquisadores apresentam o HarnessOpt-Bench para agentes de LLM
O benchmark testa até que ponto LLMs conseguem aprimorar harnesses de agentes sob orçamentos fixos de avaliação.
Por que importa
O trabalho desloca a avaliação dos pesos do modelo isoladamente para os prompts, ferramentas, fluxo de controle, memória e código de orquestração que moldam o desempenho dos agentes. Ele oferece um protocolo comum para medir se LLMs de fronteira conseguem melhorar sistemas de agentes por meio de mudanças no harness sob restrições realistas de avaliação.
Pontos-chave
- 1.O HarnessOpt-Bench avalia a otimização de harnesses de ponta a ponta para agentes de LLM.
- 2.A pontuação usa ganho normalizado em relação a um harness inicial em testes reservados.
- 3.O benchmark inclui controles de execução para auditoria e medição de recursos.
Pesquisadores apresentaram o HarnessOpt-Bench, um benchmark para avaliar a otimização automatizada de harnesses em sistemas de agentes baseados em LLMs. Na configuração, um otimizador LLM recebe o harness inicial de um agente-alvo, feedback de avaliação com notas e um orçamento fixo de avaliação; em seguida, edita o harness e envia um candidato final. O candidato é pontuado pelo ganho normalizado em relação ao harness inicial em uma partição de teste reservada, com um ambiente de execução confiável que impõe limites de avaliação, mede o uso de recursos e preserva versões para auditoria.
⚡ Experimente hoje
Use testes reservados e medição de recursos ao experimentar otimização automatizada de prompts, ferramentas ou orquestração de agentes.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.