AAI News Hub
RechercheWed, August 5, 2026·Aug 52 sources corroborating

Le benchmark GDPevo teste l’auto-évolution des agents

Ce benchmark s’appuie sur des tâches de workflows d’entreprise pour mesurer si les agents s’améliorent grâce à leur expérience passée.

Pourquoi c'est important

Ces travaux ciblent une lacune majeure dans l’évaluation des agents IA : déterminer si les gains de performance peuvent être attribués à une expérience réutilisable plutôt qu’à une contamination ou à des artefacts de benchmark. Son pipeline automatisé est conçu pour élargir la suite de tests et réduire le risque de contamination.

Points clés

  • 1.Teste les progrès des agents liés à l’expérience passée
  • 2.Couvre des workflows CRM, ERP, finance, santé et juridique
  • 3.La V1 comprend 120 tâches réparties en 12 groupes

Des chercheurs ont présenté GDPevo, un benchmark destiné à évaluer l’auto-évolution des agents dans des workflows d’entreprise liés au PIB. Il utilise l’hybridation de règles pour décomposer les workflows en règles métier atomiques, les répartir entre des tâches d’entraînement, puis les recombiner dans des tâches de test tenues à l’écart. GDPevo couvre les workflows CRM, ERP, finance, santé, juridique et centrés sur les données, avec une version V1 comprenant 120 tâches réparties en 12 groupes.

À tester aujourd'hui

Examinez GDPevo avant d’affirmer qu’un agent progresse grâce à une mémoire persistante ou à l’expérience acquise sur des tâches antérieures.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche