ScrambleToolBench testa agentes sem pistas semânticas sobre ferramentas
O benchmark investiga se agentes conseguem inferir comportamentos ocultos de ferramentas e se adaptar quando os mapeamentos mudam.
Por que importa
O trabalho mira uma lacuna na avaliação de uso de ferramentas: muitos benchmarks permitem que modelos se apoiem em esquemas semânticos em vez de aprender o comportamento das ferramentas por interação. Os resultados sugerem que os agentes atuais ainda podem ser frágeis em contextos de mundo aberto, nos quais as ferramentas mudam ou a documentação não está disponível.
Pontos-chave
- 1.O benchmark remove pistas semânticas das tarefas com ferramentas para agentes.
- 2.Os testes dinâmicos incluem deriva de mapeamento e falhas estocásticas.
- 3.Os modelos mostraram adaptação fraca após a descoberta inicial.
Pesquisadores apresentaram o ScrambleToolBench, um benchmark interativo em terminal para testar o raciocínio comportamental de agentes autônomos em ambientes de ferramentas desconhecidos. O benchmark remove pistas semânticas das ferramentas, usa uma sequência contínua de tarefas e acrescenta desafios dinâmicos, como deriva de mapeamento, falhas estocásticas de ações e janelas temporais de execução. A avaliação relata que modelos de linguagem de ponta conseguem descobrir comportamentos no início, mas têm dificuldade para se adaptar quando as estruturas mudam.
⚡ Experimente hoje
Use testes no estilo do ScrambleToolBench ao avaliar agentes que precisam operar com ferramentas sem documentação ou em constante mudança.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.