Des chercheurs s’attaquent aux échecs de distillation on-policy chez les agents
De récents articles publiés sur arXiv proposent des correctifs d’entraînement sensibles aux tours, aux étapes et aux préfixes pour les agents LLM utilisant des outils.
Pourquoi c'est important
Ces travaux traduisent une évolution plus large, qui s’éloigne de l’apprentissage par renforcement fondé uniquement sur le résultat final au profit d’une supervision plus dense et attentive à l’état pour l’entraînement des agents. C’est important parce que les agents utilisant des outils échouent souvent au fil de plusieurs tours, là où des récompenses grossières attribuées à toute une trajectoire peuvent ne pas révéler quelle étape ou quel appel d’outil a provoqué l’échec.
Points clés
- 1.De nouvelles méthodes repondèrent la distillation selon le tour, l’étape, le préfixe ou la qualité de l’échantillon.
- 2.Les articles ciblent les récompenses clairsemées et les signaux enseignants peu fiables dans les longues trajectoires d’agents.
- 3.Les erreurs d’appel d’outils peuvent se propager en cascade, affaiblissant la supervision de l’enseignant au niveau des tokens.
Un ensemble de récents articles publiés sur arXiv propose de nouvelles façons d’entraîner des agents fondés sur des modèles de langage, intégrés à des outils et capables d’échanges multi-tours, au moyen de la distillation on-policy et de l’apprentissage par renforcement. Parmi ces méthodes figurent TurnSight, SOD, ATOD, PG-OPD et RSTG, qui s’attaquent toutes à des problèmes de fiabilité tels que les récompenses clairsemées, les erreurs en cascade dans les appels d’outils, la divergence enseignant-élève, l’inefficacité des longs rollouts et la perte de gradients dans les groupes de récompenses à variance nulle. Les articles rapportent des expériences couvrant le raisonnement à long horizon, les mathématiques, les sciences, le code et les tâches d’agents interactifs, mais les résumés fournis n’établissent pas de méthode nettement dominante sur un benchmark unique couvrant l’ensemble des approches.
⚡ À tester aujourd'hui
Si vous entraînez des agents utilisant des outils, vérifiez si la supervision de l’enseignant est conditionnée par la qualité de chaque étape ou tour avant de combiner OPD avec l’apprentissage par renforcement.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- HF Daily PapersTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.