Le benchmark GDPevo teste l’auto-évolution des agents
Ce benchmark s’appuie sur des tâches de workflows d’entreprise pour mesurer si les agents s’améliorent grâce à leur expérience passée.
Pourquoi c'est important
Ces travaux ciblent une lacune majeure dans l’évaluation des agents IA : déterminer si les gains de performance peuvent être attribués à une expérience réutilisable plutôt qu’à une contamination ou à des artefacts de benchmark. Son pipeline automatisé est conçu pour élargir la suite de tests et réduire le risque de contamination.
Points clés
- 1.Teste les progrès des agents liés à l’expérience passée
- 2.Couvre des workflows CRM, ERP, finance, santé et juridique
- 3.La V1 comprend 120 tâches réparties en 12 groupes
Des chercheurs ont présenté GDPevo, un benchmark destiné à évaluer l’auto-évolution des agents dans des workflows d’entreprise liés au PIB. Il utilise l’hybridation de règles pour décomposer les workflows en règles métier atomiques, les répartir entre des tâches d’entraînement, puis les recombiner dans des tâches de test tenues à l’écart. GDPevo couvre les workflows CRM, ERP, finance, santé, juridique et centrés sur les données, avec une version V1 comprenant 120 tâches réparties en 12 groupes.
⚡ À tester aujourd'hui
Examinez GDPevo avant d’affirmer qu’un agent progresse grâce à une mémoire persistante ou à l’expérience acquise sur des tâches antérieures.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.