HarnessOpt-Bench testa LLMs em otimização de harnesses
O benchmark avalia como LLMs melhoram prompts de agentes, ferramentas, fluxo de controle e código de orquestração.
Por que importa
O trabalho reflete a atenção crescente a ganhos de desempenho de agentes vindos de prompts, ferramentas, memória e código de orquestração, e não apenas dos pesos do modelo. Um benchmark comum poderia tornar as alegações de otimização de harnesses mais comparáveis entre LLMs de fronteira e sistemas de agentes.
Pontos-chave
- 1.HarnessOpt-Bench mira a otimização ponta a ponta de harnesses de agentes.
- 2.As pontuações usam ganho normalizado sobre um harness inicial em testes reservados.
- 3.A execução confiável mede o uso de recursos e preserva trilhas de auditoria.
Pesquisadores apresentaram o HarnessOpt-Bench, um benchmark para medir quão bem LLMs conseguem otimizar os harnesses em torno de sistemas agênticos. No protocolo, um LLM otimizador recebe um harness inicial, feedback de avaliação com notas e um orçamento fixo de avaliação, edita o harness e submete um candidato final, pontuado pelo ganho normalizado em uma partição de teste reservada. O benchmark usa um ambiente de execução confiável para impor limites de avaliação, medir o uso de recursos do agente-alvo e preservar versões candidatas para auditoria.
⚡ Experimente hoje
Use testes reservados e limites rigorosos de avaliação ao permitir que LLMs otimizem harnesses de agentes.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo da Anthropic mostra que agentes de IA podem entrar em conflito em tarefas compartilhadas
Pesquisadores dizem que o comportamento multiagente pode expor lacunas nos testes atuais de segurança em IA.
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.