FM-Bench teste des agents sur 20 ans de gestion footballistique
Ce benchmark évalue des agents LLM sur un horizon long, à travers des centaines de décisions liées entre elles.
Pourquoi c'est important
Ce benchmark vise une lacune dans l’évaluation des agents : les décisions cumulatives dans des environnements qui réagissent au fil du temps. Son format en face-à-face pourrait aider à comparer le comportement des agents au-delà de tâches courtes et bornées.
Points clés
- 1.Les agents gèrent un club de football pendant 20 années simulées.
- 2.La notation repose sur un moteur déterministe, et non sur un juge LLM.
- 3.Arena compare les modèles dans un même monde partagé à long horizon.
FM-Bench est un nouveau Football Management Benchmark conçu pour évaluer si des agents fondés sur des modèles de langage peuvent maintenir une prise de décision sur de longues périodes. Dans ce benchmark, un agent LLM dirige un club de football pendant 20 années de jeu, à l’aide de 26 outils et à travers environ 340 à 400 points de décision, avec des résultats notés par un moteur déterministe plutôt que par un juge LLM ou un évaluateur humain. Le dispositif présenté comprend un parcours solo opposant 15 modèles de pointe à un monde scripté, ainsi qu’un parcours Arena plaçant des modèles et un point d’ancrage scripté dans un même monde partagé de 20 ans.
⚡ À tester aujourd'hui
Lisez l’article FM-Bench avant d’utiliser des benchmarks d’agents sur tâches courtes comme preuve d’une capacité de gestion sur le long terme.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.