ScrambleToolBench teste les agents sans indices sémantiques sur les outils
Ce benchmark évalue si les agents peuvent déduire le comportement caché des outils et s’adapter lorsque les correspondances changent.
Pourquoi c'est important
Ces travaux ciblent une lacune dans l’évaluation de l’usage des outils : de nombreux benchmarks permettent aux modèles de s’appuyer sur des schémas sémantiques plutôt que d’apprendre le comportement des outils par interaction. Leurs résultats suggèrent que les agents actuels pourraient rester fragiles dans des contextes ouverts où les outils changent ou lorsque la documentation n’est pas disponible.
Points clés
- 1.Le benchmark supprime les indices sémantiques des tâches d’agent.
- 2.Les tests dynamiques incluent la dérive des correspondances et des échecs stochastiques.
- 3.Les modèles ont montré une faible capacité d’adaptation après la découverte initiale.
Des chercheurs ont présenté ScrambleToolBench, un benchmark interactif en terminal destiné à tester le raisonnement comportemental d’agents autonomes dans des environnements d’outils inconnus. Le benchmark supprime les indices sémantiques liés aux outils, s’appuie sur un curriculum de tâches continu et ajoute des défis dynamiques, notamment la dérive des correspondances, des échecs d’action stochastiques et des fenêtres d’exécution temporelles. L’évaluation indique que les modèles de langage de pointe peuvent d’abord découvrir les comportements, mais peinent à s’adapter lorsque les structures changent.
⚡ À tester aujourd'hui
Utilisez des tests de type ScrambleToolBench pour évaluer les agents qui doivent fonctionner avec des outils non documentés ou changeants.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.