ClawGym II cible le RL en boîte noire pour les harnais d’agents
L’article propose des déploiements en bac à sable et une récupération des trajectoires pour entraîner des agents au sein de harnais complexes.
Pourquoi c'est important
Les harnais d’agents jouent un rôle de plus en plus important dans les tâches de longue durée, mais entraîner des modèles à travers des harnais opaques et multi-étapes reste difficile. Ce travail propose une infrastructure et des méthodes d’optimisation visant à rendre l’apprentissage par renforcement plus scalable et plus cohérent pour les systèmes d’agents.
Points clés
- 1.L’exécution en bac à sable isole les déploiements de harnais à grande échelle.
- 2.Le proxy de service capture les appels au modèle sans exposer les composants internes du harnais.
- 3.Les arbres de préfixes reconstruisent les trajectoires à plusieurs tours pour PPO et GRPO.
L’article ClawGym II présente un cadre unifié d’apprentissage par renforcement en boîte noire pour optimiser des agents généraux à travers des harnais d’agents complexes. L’approche s’appuie sur une exécution en bac à sable pour mener à grande échelle des déploiements concurrents, sur un proxy de service à la frontière du modèle pour capturer les appels au modèle, et sur des arbres de préfixes pour reconstruire des trajectoires à plusieurs tours. Les auteurs adaptent à la fois PPO et GRPO afin d’optimiser la structure arborescente récupérée, et introduisent un entraînement mix-harness pour des harnais hétérogènes.
⚡ À tester aujourd'hui
Lisez l’article avant de concevoir des boucles d’entraînement RL pour des agents qui s’exécutent à travers des harnais opaques ou hétérogènes.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.