AAI News Hub
ForschungFri, August 7, 2026·5d ago2 sources corroborating

Neue Studien testen Self-Distillation für agentisches RL

AgentOPSD und OCSD schlagen Korrekturen vor, während eine weitere Studie zeigt, dass privilegierte Lehrer bei schwierigeren Aufgaben scheitern können.

Warum es wichtig ist

Die Studien weisen auf Credit Assignment und verzerrte privilegierte Supervision als zentrale ungelöste Probleme im agentischen RL hin. Sie legen außerdem nahe, dass ein niedrigerer Distillation Loss allein kein ausreichender Beleg dafür ist, dass ein Agent besseres Verhalten lernt.

Die Kernpunkte

  • 1.AgentOPSD zielt auf Credit Assignment auf Turn-Ebene ohne Critic oder zusätzliche Rollouts.
  • 2.OCSD versucht, die Vermischung durch Replay-Scaffolds von privilegierten Beobachtungssignalen zu trennen.
  • 3.Eine Bias-Studie zeigt, dass Self-Distillation die Validierungsgenauigkeit bei schwierigeren Aufgaben verschlechtern kann.

Drei arXiv-Studien untersuchen Self-Distillation-Methoden zum Training von Sprachmodell-Agenten mit spärlichen Reinforcement-Learning-Belohnungen. AgentOPSD schlägt ein rekursives Verfahren ohne Critic für die Credit Assignment auf Turn-Ebene vor und berichtet über Evaluationen auf ALFWorld, WebShop und Search-QA mit Qwen2.5-Modellen mit 3B und 7B Parametern. OCSD kontrastiert vollständige Replay-Ansichten mit Ansichten, bei denen Beobachtungen entfernt wurden, um Supervision aus künftigen Beobachtungen zu isolieren. Eine separate Studie argumentiert, dass Lehrer, die auf privilegierte Informationen konditioniert sind, zwar den Token-Verlust senken können, aber die Validierungsgenauigkeit bei schwierigeren Aufgaben nicht verbessern und häufig verschlechtern.

Heute ausprobieren

Bevor OPSD-ähnliche Self-Distillation eingesetzt wird, sollte sie auf schwierigen zurückgehaltenen Agentenaufgaben validiert werden; maßgeblich ist die Aufgaben-Accuracy, nicht nur der Token Loss.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung