AAI News Hub
RechercheWed, August 19, 2026·1d ago2 sources corroborating

Des chercheurs proposent des cadres RL pour les harnais d’agents

LEGO-RL et ClawGym II visent un apprentissage par renforcement plus stable pour les agents IA sur des tâches de longue durée.

Pourquoi c'est important

Ces travaux s’attaquent à un problème central de l’entraînement des agents IA : les harnais améliorent les performances sur les tâches de longue durée, mais leurs plantages, leur exécution opaque et les décalages entre entraînement et inférence peuvent corrompre les signaux RL. Un RL natif des harnais plus fiable pourrait mieux aligner l’optimisation des agents sur leur comportement réel en déploiement.

Points clés

  • 1.LEGO-RL cible l’entraînement de harnais pour agents de codage.
  • 2.ClawGym II propose un RL en boîte noire pour les agents généralistes.
  • 3.Les deux utilisent des proxys et des sandboxes pour stabiliser les rollouts.

Deux nouveaux articles publiés sur arXiv décrivent des cadres permettant d’appliquer l’apprentissage par renforcement à des agents exécutés dans des harnais complexes et de longue durée. LEGO-RL se concentre sur les agents de codage, avec un proxy LLM intégré au processus, l’orchestration de sandboxes, des outils de validation et de suivi, ainsi qu’une interface en direct pour aligner l’entraînement par gradient de politique sur l’exécution native du harnais. ClawGym II présente un cadre RL en boîte noire pour les agents généralistes, reposant sur des rollouts concurrents en sandbox, des proxys de service aux frontières du modèle, la reconstruction de trajectoires par arbre de préfixes, ainsi que des adaptations de PPO et GRPO.

À tester aujourd'hui

Lisez les deux articles avant de construire des pipelines RL autour de harnais pour agents de codage ou agents généralistes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche