ReflectRL trainiert Reasoning-Modelle mit gescheiterten Experten-Trajektorien
Das arXiv-Paper schlägt vor, fehlerhafte Expert-Rollouts im On-Policy-Training als Ziele für Reflexion zu nutzen.
Warum es wichtig ist
Die Arbeit adressiert einen Engpass beim Post-Training von Reasoning-Modellen: Experten-Trajektorien werden weniger nützlich, wenn der Experte an schwierigen Problemen scheitert. Sollte sich der Ansatz bestätigen, könnten fehlgeschlagene Rollouts zu einem verwertbaren Trainingssignal werden, statt als unbrauchbare Daten verworfen zu werden.
Die Kernpunkte
- 1.ReflectRL lernt aus gescheiterten Reasoning-Trajektorien von Experten.
- 2.Die Methode überführt Reflexionsverhalten zurück in direktes Reasoning.
- 3.Die Evaluationen umfassen 9 Benchmarks und 4 LLM-Backbones.
Forschende haben ReflectRL vorgestellt, ein leichtgewichtiges Plug-and-play-Framework zur Verbesserung des Reasonings großer Sprachmodelle während des On-Policy-Trainings. Die Methode nutzt „Golden Negative Trajectories“, also fehlgeschlagene Ausgaben stärkerer Expertenmodelle, nicht als Demonstrationen zum Nachahmen, sondern als fehlerhafte Denkpfade, über die das Modell reflektieren soll, bevor dieses Verhalten zurück in direktes Reasoning übertragen wird. Ein Eintrag bei Hugging Face Daily Papers zufolge evaluierten die Autoren den Ansatz über 9 Benchmarks, 4 LLM-Backbones und 4 On-Policy-Settings hinweg.
⚡ Heute ausprobieren
Lesen Sie das ReflectRL-Paper, bevor Sie fehlgeschlagene Expert-Rollouts in Post-Training-Pipelines für Reasoning-Modelle verwerfen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGPrefix-Guided On-Policy Distillation: Mining Golden Trajectories from RolloutsAug 4, 12:00 PM↗
- HF Daily PapersReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 4, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google treibt private KI mit homomorpher Verschlüsselung voran
Google will private KI mithilfe homomorpher Verschlüsselung praxistauglicher machen.
Google will private KI praxistauglich machen
Ein Beitrag im Google Security Blog sorgte auf Hacker News für Diskussionen, flankiert von breiterer Kritik an KI.
Forscher veröffentlichen LittleLearner für kontrollierte LLM-Studien
Das Modell mit 5 Milliarden Parametern wird auf einem Curriculum-Korpus mit 88 Milliarden Tokens trainiert, der Stoff bis einschließlich fünfter Klasse umfasst.