AAI News Hub
RechercheMon, August 17, 2026·1d ago2 sources corroborating

ClawGym II cible le RL en boîte noire pour les harnais d’agents

L’article propose des déploiements en bac à sable et une récupération des trajectoires pour entraîner des agents au sein de harnais complexes.

Pourquoi c'est important

Les harnais d’agents jouent un rôle de plus en plus important dans les tâches de longue durée, mais entraîner des modèles à travers des harnais opaques et multi-étapes reste difficile. Ce travail propose une infrastructure et des méthodes d’optimisation visant à rendre l’apprentissage par renforcement plus scalable et plus cohérent pour les systèmes d’agents.

Points clés

  • 1.L’exécution en bac à sable isole les déploiements de harnais à grande échelle.
  • 2.Le proxy de service capture les appels au modèle sans exposer les composants internes du harnais.
  • 3.Les arbres de préfixes reconstruisent les trajectoires à plusieurs tours pour PPO et GRPO.

L’article ClawGym II présente un cadre unifié d’apprentissage par renforcement en boîte noire pour optimiser des agents généraux à travers des harnais d’agents complexes. L’approche s’appuie sur une exécution en bac à sable pour mener à grande échelle des déploiements concurrents, sur un proxy de service à la frontière du modèle pour capturer les appels au modèle, et sur des arbres de préfixes pour reconstruire des trajectoires à plusieurs tours. Les auteurs adaptent à la fois PPO et GRPO afin d’optimiser la structure arborescente récupérée, et introduisent un entraînement mix-harness pour des harnais hétérogènes.

À tester aujourd'hui

Lisez l’article avant de concevoir des boucles d’entraînement RL pour des agents qui s’exécutent à travers des harnais opaques ou hétérogènes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche