AAI News Hub
ForschungThu, August 6, 2026·Aug 62 sources corroborating

Neue Papers testen Self-Distillation für Reinforcement Learning bei LLMs

Studien schlagen ICE und OCSD vor, während eine weitere zeigt, dass Lehrer mit privilegierten Informationen bei schwierigeren Aufgaben scheitern können.

Warum es wichtig ist

Die Papers sprechen für einen differenzierteren Blick auf Self-Distillation im LLM-Post-Training: Sie kann helfen, wenn sie mit Exploration oder Kalibrierung kombiniert wird, kann aber auch Token-Verluste optimieren, ohne die Aufgabenleistung zu verbessern. Das ist relevant für Teams, die dichte Supervision als günstigere Alternative oder Ergänzung zu belohnungsbasiertem RL einsetzen.

Die Kernpunkte

  • 1.ICE verbesserte den Mathe-pass@1 von Qwen3-1.7B relativ zu DAPO um 5,0 %.
  • 2.Der berichtete ICE-Zugewinn zeigte sich bei Qwen3-4B mit 4K nicht.
  • 3.Self-Distillation mit privilegierten Informationen kann den Loss senken und zugleich die Validierungsgenauigkeit verschlechtern.

Mehrere neue arXiv-Papers untersuchen Self-Distillation-Methoden für das Post-Training großer Sprachmodelle mit Reinforcement Learning. Ein Paper stellt Instruction-Conditioned Exploration vor: Dabei werden feste Trainingsanweisungen ergänzt und korrekte Rollouts in eine unbedingte Testzeit-Policy destilliert. Für Qwen3-1.7B wird bei mathematischem Schlussfolgern mit 4K-Antwortlänge ein relativer Zuwachs von 5,0 % beim Held-out-pass@1 gegenüber DAPO berichtet. Ein weiteres Paper schlägt Observation-Calibrated Self-Distillation für agentisches RL vor, während ein drittes berichtet, dass Self-Distillation mit privilegierten Informationen in einfachen Szenarien Zugewinne reproduzieren kann, auf schwierigeren QA-, Mathematik-, Coding- und Tool-Use-Aufgaben aber häufig keine Verbesserung bringt und die Validierungsgenauigkeit sogar verschlechtern kann.

Heute ausprobieren

Bevor Self-Distillation für das LLM-Post-Training übernommen wird, sollte sie auf schwierigen Held-out-Aufgaben validiert werden; gemessen werden sollte Genauigkeit, nicht nur der Verlust pro Token.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung