HarnessOpt-Bench teste les LLM sur l’optimisation des harnais
Le benchmark évalue la capacité des LLM à améliorer les prompts d’agents, les outils, les flux de contrôle et le code d’orchestration.
Pourquoi c'est important
Ces travaux illustrent l’attention croissante portée aux gains de performance des agents issus des prompts, des outils, de la mémoire et du code d’orchestration, plutôt que des seuls poids des modèles. Un benchmark commun pourrait rendre les affirmations sur l’optimisation des harnais plus comparables entre LLM de pointe et systèmes d’agents.
Points clés
- 1.HarnessOpt-Bench vise l’optimisation de bout en bout des harnais d’agents.
- 2.Les scores reposent sur le gain normalisé par rapport à un harnais initial sur des tests mis de côté.
- 3.L’exécution de confiance mesure l’usage des ressources et conserve des pistes d’audit.
Des chercheurs ont présenté HarnessOpt-Bench, un benchmark destiné à mesurer dans quelle mesure les LLM peuvent optimiser les harnais qui entourent les systèmes agentiques. Dans ce protocole, un LLM optimiseur reçoit un harnais initial, des retours d’évaluation notés et un budget d’évaluation fixe, modifie le harnais, puis soumet un candidat final évalué selon le gain normalisé sur une partition de test mise de côté. Le benchmark s’appuie sur un environnement d’exécution de confiance pour faire respecter les limites d’évaluation, mesurer l’usage des ressources par l’agent cible et conserver les versions candidates à des fins d’audit.
⚡ À tester aujourd'hui
Utiliser des tests mis de côté et des limites d’évaluation strictes lorsque des LLM optimisent des harnais d’agents.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.