Des chercheurs s’attaquent aux récompenses rares dans le RL agentique
De nouveaux articles sur arXiv proposent des méthodes d’auto-distillation pour une attribution du crédit plus dense dans les agents LLM.
Pourquoi c'est important
Ces articles s’inscrivent dans un effort de recherche plus large visant à rendre l’entraînement des agents moins dépendant de récompenses terminales rares. Une meilleure attribution du crédit pourrait améliorer les agents à plusieurs tours pour l’utilisation d’outils, le codage, les requêtes de bases de données et d’autres tâches où les résultats sont faciles à vérifier, mais où les étapes individuelles sont difficiles à noter.
Points clés
- 1.L’auto-distillation est utilisée pour ajouter des signaux d’entraînement plus denses aux agents LLM.
- 2.SERL-SQL cible les agents Text-to-SQL avec une attribution du crédit fondée sur l’exécution.
- 3.Ces méthodes visent à préserver les récompenses des vérificateurs tout en localisant les signaux d’apprentissage.
Plusieurs nouveaux articles sur arXiv proposent des approches d’auto-distillation pour améliorer l’apprentissage par renforcement dans les agents LLM à plusieurs tours, où les récompenses au niveau de la trajectoire ne permettent souvent pas d’identifier quelles décisions intermédiaires ont conduit au succès ou à l’échec. Parmi ces méthodes figurent ADRS, qui utilise une notation privilégiée des tokens et une porte Teacher Value Advantage ; SERL-SQL, qui applique aux agents Text-to-SQL un recul fondé sur l’exécution ; GRSD, qui tire des indications de rollouts vérifiés ; et PCSD, qui pondère la distillation selon des signaux persistants favorables à l’enseignant. SERL-SQL annonce une précision d’exécution de 76,56 % sur BIRD-Dev et de 89,92 % sur Spider-Test.
⚡ À tester aujourd'hui
Lisez les articles ADRS, SERL-SQL, GRSD et PCSD avant de concevoir des pipelines de RL pour des agents à plusieurs tours soumis à des récompenses rares.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- HF Daily PapersPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 3, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées
Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.