Des articles arXiv testent l’auto-distillation pour le RL agentique
Trois études examinent si l’auto-distillation avec informations privilégiées améliore l’entraînement d’agents à long horizon.
Pourquoi c'est important
Ces articles mettent en lumière une ligne de fracture active dans l’entraînement des agents : des signaux d’auto-distillation denses peuvent aider à attribuer le crédit, mais aussi introduire des biais lorsque des informations privilégiées façonnent les cibles de l’enseignant. C’est un enjeu important pour les équipes qui cherchent à améliorer l’usage d’outils sur plusieurs tours sans ajouter de critiques, de rollouts supplémentaires ni de supervision peu fiable.
Points clés
- 1.AgentOPSD cible l’attribution du crédit au niveau des tours sans critique ni rollouts supplémentaires.
- 2.OCSD tente de distinguer le signal d’observation des variations de score liées à la structure de rejeu.
- 3.Une étude sur les biais fait état d’une perte en baisse, mais d’une précision de validation dégradée sur des tâches plus difficiles.
Trois articles publiés sur arXiv analysent des méthodes d’auto-distillation pour l’apprentissage par renforcement dans des tâches agentiques. AgentOPSD propose une méthode récursive sans critique pour l’attribution du crédit au niveau des tours, évaluée sur ALFWorld, WebShop et Search-QA avec les modèles Qwen2.5 3B et 7B. OCSD propose de comparer des vues de rejeu complètes et amputées de leurs observations afin d’isoler l’effet des observations futures, tandis qu’un troisième article soutient que l’auto-distillation fondée sur des informations privilégiées peut réduire la perte sans améliorer, et souvent en dégradant, la précision de validation sur des tâches plus difficiles.
⚡ À tester aujourd'hui
Avant d’utiliser l’auto-distillation avec informations privilégiées comme objectif autonome, il faut la valider sur des tâches difficiles tenues à l’écart et la comparer à un entraînement fondé sur les récompenses.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.