Des chercheurs proposent des cadres RL pour les harnais d’agents
LEGO-RL et ClawGym II visent un apprentissage par renforcement plus stable pour les agents IA sur des tâches de longue durée.
Pourquoi c'est important
Ces travaux s’attaquent à un problème central de l’entraînement des agents IA : les harnais améliorent les performances sur les tâches de longue durée, mais leurs plantages, leur exécution opaque et les décalages entre entraînement et inférence peuvent corrompre les signaux RL. Un RL natif des harnais plus fiable pourrait mieux aligner l’optimisation des agents sur leur comportement réel en déploiement.
Points clés
- 1.LEGO-RL cible l’entraînement de harnais pour agents de codage.
- 2.ClawGym II propose un RL en boîte noire pour les agents généralistes.
- 3.Les deux utilisent des proxys et des sandboxes pour stabiliser les rollouts.
Deux nouveaux articles publiés sur arXiv décrivent des cadres permettant d’appliquer l’apprentissage par renforcement à des agents exécutés dans des harnais complexes et de longue durée. LEGO-RL se concentre sur les agents de codage, avec un proxy LLM intégré au processus, l’orchestration de sandboxes, des outils de validation et de suivi, ainsi qu’une interface en direct pour aligner l’entraînement par gradient de politique sur l’exécution native du harnais. ClawGym II présente un cadre RL en boîte noire pour les agents généralistes, reposant sur des rollouts concurrents en sandbox, des proxys de service aux frontières du modèle, la reconstruction de trajectoires par arbre de préfixes, ainsi que des adaptations de PPO et GRPO.
⚡ À tester aujourd'hui
Lisez les deux articles avant de construire des pipelines RL autour de harnais pour agents de codage ou agents généralistes.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.