AAI News Hub
RechercheFri, August 7, 2026·5d ago2 sources corroborating

Des chercheurs présentent HarnessOpt-Bench pour les agents LLM

Ce benchmark évalue la capacité des LLM à améliorer les harnesses d’agents avec des budgets d’évaluation fixes.

Pourquoi c'est important

Ce travail déplace l’évaluation au-delà des seuls poids des modèles, vers les prompts, les outils, les flux de contrôle, la mémoire et le code d’orchestration qui façonnent les performances des agents. Il propose un protocole commun pour mesurer si les LLM de pointe peuvent améliorer les systèmes d’agents par des changements de harness dans des conditions d’évaluation réalistes.

Points clés

  • 1.HarnessOpt-Bench évalue l’optimisation de bout en bout des harnesses pour agents LLM.
  • 2.La notation repose sur le gain normalisé par rapport à un harness initial sur des tests tenus à l’écart.
  • 3.Le benchmark inclut des contrôles d’exécution pour l’audit et la mesure des ressources.

Des chercheurs ont présenté HarnessOpt-Bench, un benchmark destiné à évaluer l’optimisation automatisée des harnesses dans les systèmes d’agents fondés sur des LLM. Dans ce cadre, un optimiseur LLM reçoit le harness initial d’un agent cible, des retours d’évaluation notés et un budget d’évaluation fixe, puis modifie le harness et soumet un candidat final. Ce candidat est noté selon le gain normalisé par rapport au harness initial sur une partition de test tenue à l’écart, avec un environnement d’exécution de confiance chargé de faire respecter les limites d’évaluation, de mesurer l’utilisation des ressources et de conserver les versions à des fins d’audit.

À tester aujourd'hui

Utilisez des tests tenus à l’écart et une mesure des ressources lorsque vous expérimentez l’optimisation automatisée des prompts, des outils ou de l’orchestration d’agents.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche