Neue Studien testen Self-Distillation für agentisches RL
AgentOPSD und OCSD schlagen Korrekturen vor, während eine weitere Studie zeigt, dass privilegierte Lehrer bei schwierigeren Aufgaben scheitern können.
Warum es wichtig ist
Die Studien weisen auf Credit Assignment und verzerrte privilegierte Supervision als zentrale ungelöste Probleme im agentischen RL hin. Sie legen außerdem nahe, dass ein niedrigerer Distillation Loss allein kein ausreichender Beleg dafür ist, dass ein Agent besseres Verhalten lernt.
Die Kernpunkte
- 1.AgentOPSD zielt auf Credit Assignment auf Turn-Ebene ohne Critic oder zusätzliche Rollouts.
- 2.OCSD versucht, die Vermischung durch Replay-Scaffolds von privilegierten Beobachtungssignalen zu trennen.
- 3.Eine Bias-Studie zeigt, dass Self-Distillation die Validierungsgenauigkeit bei schwierigeren Aufgaben verschlechtern kann.
Drei arXiv-Studien untersuchen Self-Distillation-Methoden zum Training von Sprachmodell-Agenten mit spärlichen Reinforcement-Learning-Belohnungen. AgentOPSD schlägt ein rekursives Verfahren ohne Critic für die Credit Assignment auf Turn-Ebene vor und berichtet über Evaluationen auf ALFWorld, WebShop und Search-QA mit Qwen2.5-Modellen mit 3B und 7B Parametern. OCSD kontrastiert vollständige Replay-Ansichten mit Ansichten, bei denen Beobachtungen entfernt wurden, um Supervision aus künftigen Beobachtungen zu isolieren. Eine separate Studie argumentiert, dass Lehrer, die auf privilegierte Informationen konditioniert sind, zwar den Token-Verlust senken können, aber die Validierungsgenauigkeit bei schwierigeren Aufgaben nicht verbessern und häufig verschlechtern.
⚡ Heute ausprobieren
Bevor OPSD-ähnliche Self-Distillation eingesetzt wird, sollte sie auf schwierigen zurückgehaltenen Agentenaufgaben validiert werden; maßgeblich ist die Aufgaben-Accuracy, nicht nur der Token Loss.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.
Forscher schlagen Power Law Graph Attention vor
PLGA verallgemeinert Scaled Dot-Product Attention und berichtet von Inferenz-Kollaps unter exakter Invarianz.
Google testet AMIE für medizinische Videokonsultationen in Echtzeit
Das auf Gemini basierende Forschungssystem wurde in simulierten Telemedizin-Konsultationen evaluiert.