Neue Papers testen Self-Distillation für Reinforcement Learning bei LLMs
Studien schlagen ICE und OCSD vor, während eine weitere zeigt, dass Lehrer mit privilegierten Informationen bei schwierigeren Aufgaben scheitern können.
Warum es wichtig ist
Die Papers sprechen für einen differenzierteren Blick auf Self-Distillation im LLM-Post-Training: Sie kann helfen, wenn sie mit Exploration oder Kalibrierung kombiniert wird, kann aber auch Token-Verluste optimieren, ohne die Aufgabenleistung zu verbessern. Das ist relevant für Teams, die dichte Supervision als günstigere Alternative oder Ergänzung zu belohnungsbasiertem RL einsetzen.
Die Kernpunkte
- 1.ICE verbesserte den Mathe-pass@1 von Qwen3-1.7B relativ zu DAPO um 5,0 %.
- 2.Der berichtete ICE-Zugewinn zeigte sich bei Qwen3-4B mit 4K nicht.
- 3.Self-Distillation mit privilegierten Informationen kann den Loss senken und zugleich die Validierungsgenauigkeit verschlechtern.
Mehrere neue arXiv-Papers untersuchen Self-Distillation-Methoden für das Post-Training großer Sprachmodelle mit Reinforcement Learning. Ein Paper stellt Instruction-Conditioned Exploration vor: Dabei werden feste Trainingsanweisungen ergänzt und korrekte Rollouts in eine unbedingte Testzeit-Policy destilliert. Für Qwen3-1.7B wird bei mathematischem Schlussfolgern mit 4K-Antwortlänge ein relativer Zuwachs von 5,0 % beim Held-out-pass@1 gegenüber DAPO berichtet. Ein weiteres Paper schlägt Observation-Calibrated Self-Distillation für agentisches RL vor, während ein drittes berichtet, dass Self-Distillation mit privilegierten Informationen in einfachen Szenarien Zugewinne reproduzieren kann, auf schwierigeren QA-, Mathematik-, Coding- und Tool-Use-Aufgaben aber häufig keine Verbesserung bringt und die Validierungsgenauigkeit sogar verschlechtern kann.
⚡ Heute ausprobieren
Bevor Self-Distillation für das LLM-Post-Training übernommen wird, sollte sie auf schwierigen Held-out-Aufgaben validiert werden; gemessen werden sollte Genauigkeit, nicht nur der Verlust pro Token.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AITCPO: Turn-Level Credit Policy OptimizationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.
InternLM schlägt Mobius-Modellarchitektur vor
Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.