AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

PAST-Bench teste si les agents personnels s'améliorent avec le temps

Ce benchmark mesure les progrès tirés de l’expérience conservée à travers différents modèles, frameworks et tâches d’agents.

Pourquoi c'est important

Ce travail offre aux développeurs d’agents une méthode plus ciblée pour évaluer les affirmations d’apprentissage à long terme, en distinguant les gains de performance des preuves montrant que les mécanismes de mémoire et de mise à jour en sont réellement la cause.

Points clés

  • 1.PAST-Bench couvre 26 scénarios et 204 épisodes.
  • 2.Les tests comparent les exécutions avec expérience conservée à des contrôles appariés.
  • 3.Les gains rapportés varient selon les capacités et les chaînes causales.

Des chercheurs ont présenté PAST-Bench, un benchmark destiné à vérifier si les agents IA personnels transforment l’expérience conservée en meilleurs comportements futurs. Il compare des séquences de tâches en session fraîche avec des exécutions où l’expérience conservée est activée ou désactivée, sur 26 scénarios et 204 épisodes. Sur sept modèles de base et quatre frameworks d’agents, les auteurs font état d’améliorations réelles mais inégales, avec des gains globaux parfois similaires qui diffèrent selon qu’ils suivent ou non le parcours prévu de sauvegarde, récupération et mise à jour.

À tester aujourd'hui

Utilisez des ablations de type PAST-Bench avant d’affirmer qu’un agent personnel s’améliore grâce à l’expérience conservée.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche