AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

ScrambleToolBench testa agentes sem pistas semânticas sobre ferramentas

O benchmark investiga se agentes conseguem inferir comportamentos ocultos de ferramentas e se adaptar quando os mapeamentos mudam.

Por que importa

O trabalho mira uma lacuna na avaliação de uso de ferramentas: muitos benchmarks permitem que modelos se apoiem em esquemas semânticos em vez de aprender o comportamento das ferramentas por interação. Os resultados sugerem que os agentes atuais ainda podem ser frágeis em contextos de mundo aberto, nos quais as ferramentas mudam ou a documentação não está disponível.

Pontos-chave

  • 1.O benchmark remove pistas semânticas das tarefas com ferramentas para agentes.
  • 2.Os testes dinâmicos incluem deriva de mapeamento e falhas estocásticas.
  • 3.Os modelos mostraram adaptação fraca após a descoberta inicial.

Pesquisadores apresentaram o ScrambleToolBench, um benchmark interativo em terminal para testar o raciocínio comportamental de agentes autônomos em ambientes de ferramentas desconhecidos. O benchmark remove pistas semânticas das ferramentas, usa uma sequência contínua de tarefas e acrescenta desafios dinâmicos, como deriva de mapeamento, falhas estocásticas de ações e janelas temporais de execução. A avaliação relata que modelos de linguagem de ponta conseguem descobrir comportamentos no início, mas têm dificuldade para se adaptar quando as estruturas mudam.

Experimente hoje

Use testes no estilo do ScrambleToolBench ao avaliar agentes que precisam operar com ferramentas sem documentação ou em constante mudança.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa