Forschende nehmen spärliche Rewards im agentischen RL ins Visier
Neue arXiv-Papers schlagen Self-Distillation-Methoden für eine dichtere Credit Assignment in LLM-Agenten vor.
Warum es wichtig ist
Die Papers spiegeln einen breiteren Forschungstrend wider, Agententraining weniger abhängig von spärlichen finalen Rewards zu machen. Bessere Credit Assignment könnte mehrstufige Agenten für Tool-Nutzung, Coding, Datenbankabfragen und andere Aufgaben verbessern, bei denen Ergebnisse leicht zu verifizieren sind, einzelne Schritte aber schwer zu bewerten bleiben.
Die Kernpunkte
- 1.Self-Distillation wird genutzt, um dichtere Trainingssignale für LLM-Agenten zu ergänzen.
- 2.SERL-SQL zielt auf Text-to-SQL-Agenten mit ausführungsgestützter Credit Assignment.
- 3.Die Methoden sollen Verifier-Rewards erhalten und zugleich Lernsignale lokalisieren.
Mehrere neue arXiv-Papers schlagen Self-Distillation-Ansätze vor, um Reinforcement Learning in mehrstufigen LLM-Agenten zu verbessern, bei denen Rewards auf Trajektorienebene oft nicht erkennen lassen, welche Zwischenschritte Erfolg oder Misserfolg verursacht haben. Zu den Methoden gehören ADRS, das privilegiertes Token-Scoring und ein Teacher Value Advantage Gate nutzt; SERL-SQL, das ausführungsgestützte Rückschau auf Text-to-SQL-Agenten anwendet; GRSD, das Guidance aus verifizierten Rollouts ableitet; und PCSD, das Distillation anhand dauerhaft lehrerfavorisierender Signale gewichtet. SERL-SQL meldet eine Execution Accuracy von 76,56 % auf BIRD-Dev und 89,92 % auf Spider-Test.
⚡ Heute ausprobieren
Lesen Sie die Papers zu ADRS, SERL-SQL, GRSD und PCSD, bevor Sie RL-Pipelines für mehrstufige Agenten mit spärlichen Rewards entwerfen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- HF Daily PapersPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 3, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.
Forscher schlagen Power Law Graph Attention vor
PLGA verallgemeinert Scaled Dot-Product Attention und berichtet von Inferenz-Kollaps unter exakter Invarianz.
Neue Papers zielen auf VLM-Reasoning für lange Dokumente
InSight-doc, DocAtlas und DocMemo schlagen agentische Ansätze vor, um Belege in komplexen Dokumenten zu finden.