De nouveaux articles testent l’auto-distillation pour le RL agentique
AgentOPSD et OCSD proposent des correctifs, tandis qu’une autre étude montre que des enseignants privilégiés peuvent échouer sur des tâches plus difficiles.
Pourquoi c'est important
Ces articles désignent l’attribution du crédit et les biais liés à la supervision privilégiée comme deux problèmes centraux encore non résolus dans le RL agentique. Ils suggèrent aussi qu’une baisse de la perte de distillation ne suffit pas à prouver qu’un agent apprend un meilleur comportement.
Points clés
- 1.AgentOPSD cible l’attribution du crédit au niveau de chaque tour sans critique ni rollouts supplémentaires.
- 2.OCSD tente d’éliminer la confusion liée à l’échafaudage de rejeu dans les signaux d’observation privilégiés.
- 3.Une étude sur les biais montre que l’auto-distillation peut dégrader la précision de validation sur des tâches plus difficiles.
Trois articles arXiv examinent des méthodes d’auto-distillation pour entraîner des agents fondés sur des modèles de langage avec des récompenses rares en apprentissage par renforcement. AgentOPSD propose une méthode récursive sans critique pour attribuer le crédit au niveau de chaque tour, et présente des évaluations sur ALFWorld, WebShop et Search-QA avec des modèles Qwen2.5 3B et 7B. OCSD propose de comparer des vues de rejeu complètes et des vues dont les observations sont masquées afin d’isoler la supervision provenant des observations futures, tandis qu’un article distinct soutient que des enseignants conditionnés par des informations privilégiées peuvent réduire la perte par token sans améliorer, et souvent en dégradant, la précision de validation sur des tâches plus difficiles.
⚡ À tester aujourd'hui
Avant d’adopter une auto-distillation de type OPSD, validez-la sur des tâches agentiques difficiles tenues à l’écart et suivez la précision sur les tâches, pas seulement la perte par token.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.
Les outils et pratiques de développement IA suscitent le débat sur Hacker News
Des publications sur MathCode, les habitudes de codage avec l’IA, Cloudflare et HEIR de Google ont alimenté les discussions.
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.