arXiv-Paper testen Self-Distillation für agentisches RL
Drei Studien untersuchen, ob privilegierte Self-Distillation das Training von Long-Horizon-Agenten verbessert.
Warum es wichtig ist
Die Paper markieren eine aktive Bruchlinie im Agenten-Training: Dichte Self-Distillation-Signale können beim Credit Assignment helfen, aber auch Bias einführen, wenn privilegierte Informationen Teacher-Ziele formen. Das ist relevant für Teams, die Multi-Turn-Tool-Nutzung verbessern wollen, ohne Critics, zusätzliche Rollouts oder unzuverlässige Supervision hinzuzufügen.
Die Kernpunkte
- 1.AgentOPSD zielt auf Credit Assignment auf Turn-Ebene ohne Critic oder zusätzliche Rollouts.
- 2.OCSD versucht, Beobachtungssignale von Score-Verschiebungen durch das Replay-Gerüst zu trennen.
- 3.Eine Bias-Studie berichtet von sinkendem Loss, aber schlechterer Validierungsgenauigkeit bei schwierigeren Aufgaben.
Drei arXiv-Paper untersuchen Self-Distillation-Methoden für Reinforcement Learning in agentischen Aufgaben. AgentOPSD schlägt ein critic-freies rekursives Verfahren für Credit Assignment auf Turn-Ebene vor, evaluiert auf ALFWorld, WebShop und Search-QA mit Qwen2.5-Modellen mit 3B und 7B Parametern. OCSD stellt vollständige Replay-Ansichten solchen mit ausgeblendeten Beobachtungen gegenüber, um den Effekt künftiger Beobachtungen zu isolieren, während ein drittes Paper argumentiert, dass Self-Distillation mit privilegierten Informationen den Loss senken kann, ohne die Validierungsgenauigkeit zu verbessern, und sie bei schwierigeren Aufgaben oft verschlechtert.
⚡ Heute ausprobieren
Bevor privilegierte Self-Distillation als eigenständiges Ziel eingesetzt wird, sollte sie auf schwierigen, zurückgehaltenen Aufgaben validiert und mit reward-basiertem Training verglichen werden.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.
Forscher schlagen Power Law Graph Attention vor
PLGA verallgemeinert Scaled Dot-Product Attention und berichtet von Inferenz-Kollaps unter exakter Invarianz.