EnvACE et State2State visent un entraînement scalable des agents LLM
Deux articles sur arXiv proposent de réduire la dépendance aux tâches, vérificateurs et environnements exécutables conçus à la main.
Pourquoi c'est important
Ces travaux s’attaquent à un goulot d’étranglement central du développement d’agents : faire passer à l’échelle l’entraînement à l’usage d’outils sur de longs horizons sans environnements exécutables coûteux, vérificateurs artisanaux ni démonstrations d’experts. Si elles sont validées au-delà des benchmarks rapportés, ces approches pourraient rendre l’entraînement des agents plus transférable et moins dépendant d’une ingénierie d’environnements sur mesure.
Points clés
- 1.EnvACE entraîne les agents par répétition du monde autogénérée.
- 2.State2State déduit les objectifs des agents à partir d’états d’environnement explorés.
- 3.Les deux méthodes cherchent à réduire la supervision manuelle dans l’entraînement des agents.
Deux nouveaux articles sur arXiv présentent des méthodes d’entraînement pour agents LLM qui réduisent la dépendance à une supervision définie de l’extérieur. EnvACE remplace, pendant l’entraînement, l’interaction avec un environnement externe par une « répétition du monde » : la politique génère des appels d’outils, simule la réponse de l’environnement et optimise les deux rôles à l’aide de récompenses liées à la réussite de la tâche. State2State transforme les états d’environnement explorés en objectifs d’état cible, en s’appuyant sur une mise en correspondance des états fondée sur des règles plutôt que sur des trajectoires d’experts ou une conception manuelle des tâches, et fait état de gains sur ALFWorld et ScienceWorld.
⚡ À tester aujourd'hui
Lisez les articles EnvACE et State2State avant de concevoir de nouveaux pipelines d’entraînement d’agents LLM dépendant d’environnements conçus à la main ou de trajectoires d’experts.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées
Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.