Des chercheurs présentent HarnessOpt-Bench pour les agents LLM
Ce benchmark évalue la capacité des LLM à améliorer les harnesses d’agents avec des budgets d’évaluation fixes.
Pourquoi c'est important
Ce travail déplace l’évaluation au-delà des seuls poids des modèles, vers les prompts, les outils, les flux de contrôle, la mémoire et le code d’orchestration qui façonnent les performances des agents. Il propose un protocole commun pour mesurer si les LLM de pointe peuvent améliorer les systèmes d’agents par des changements de harness dans des conditions d’évaluation réalistes.
Points clés
- 1.HarnessOpt-Bench évalue l’optimisation de bout en bout des harnesses pour agents LLM.
- 2.La notation repose sur le gain normalisé par rapport à un harness initial sur des tests tenus à l’écart.
- 3.Le benchmark inclut des contrôles d’exécution pour l’audit et la mesure des ressources.
Des chercheurs ont présenté HarnessOpt-Bench, un benchmark destiné à évaluer l’optimisation automatisée des harnesses dans les systèmes d’agents fondés sur des LLM. Dans ce cadre, un optimiseur LLM reçoit le harness initial d’un agent cible, des retours d’évaluation notés et un budget d’évaluation fixe, puis modifie le harness et soumet un candidat final. Ce candidat est noté selon le gain normalisé par rapport au harness initial sur une partition de test tenue à l’écart, avec un environnement d’exécution de confiance chargé de faire respecter les limites d’évaluation, de mesurer l’utilisation des ressources et de conserver les versions à des fins d’audit.
⚡ À tester aujourd'hui
Utilisez des tests tenus à l’écart et une mesure des ressources lorsque vous expérimentez l’optimisation automatisée des prompts, des outils ou de l’orchestration d’agents.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.