Des chercheurs présentent SPADE pour l’entraînement d’agents par auto-jeu
Le framework confie à un LLM la génération d’environnements exécutables et à un autre rôle l’apprentissage à l’intérieur de ceux-ci.
Pourquoi c'est important
SPADE s’attaque à un goulet d’étranglement central de l’entraînement des agents : les ensembles d’environnements statiques qui cessent de s’adapter à mesure que les modèles progressent. Si l’approche est validée au-delà des expériences rapportées, des environnements exécutables adaptatifs pourraient rendre l’entraînement des agents plus scalable pour les tâches de raisonnement et d’utilisation d’outils en plusieurs étapes.
Points clés
- 1.SPADE utilise un même LLM dans les rôles de designer et d’agent.
- 2.Les environnements générés incluent les transitions d’état, les récompenses et le code de vérification.
- 3.Le designer cible des tâches réalisables proches des limites de l’agent.
Un article publié sur Hugging Face décrit SPADE, un framework d’apprentissage par renforcement en auto-jeu pour agents linguistiques. Dans SPADE, un même LLM joue à la fois le rôle d’Environment Designer, qui écrit des environnements d’entraînement exécutables et de longue durée avec une interface de type OpenAI Gym, et celui de Reasoning Agent, qui apprend à y agir. Le designer utilise un signal de regret estimé, fondé sur les écarts de récompense avec et sans indices privilégiés, afin de cibler des environnements réalisables proches de la limite de capacité de l’agent.
⚡ À tester aujourd'hui
Lisez l’article avant de construire des pipelines d’environnements synthétiques pour le RL d’agents.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.