AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

ReflectRL trainiert Reasoning-Modelle mit gescheiterten Experten-Trajektorien

Das arXiv-Paper schlägt vor, fehlerhafte Expert-Rollouts im On-Policy-Training als Ziele für Reflexion zu nutzen.

Warum es wichtig ist

Die Arbeit adressiert einen Engpass beim Post-Training von Reasoning-Modellen: Experten-Trajektorien werden weniger nützlich, wenn der Experte an schwierigen Problemen scheitert. Sollte sich der Ansatz bestätigen, könnten fehlgeschlagene Rollouts zu einem verwertbaren Trainingssignal werden, statt als unbrauchbare Daten verworfen zu werden.

Die Kernpunkte

  • 1.ReflectRL lernt aus gescheiterten Reasoning-Trajektorien von Experten.
  • 2.Die Methode überführt Reflexionsverhalten zurück in direktes Reasoning.
  • 3.Die Evaluationen umfassen 9 Benchmarks und 4 LLM-Backbones.

Forschende haben ReflectRL vorgestellt, ein leichtgewichtiges Plug-and-play-Framework zur Verbesserung des Reasonings großer Sprachmodelle während des On-Policy-Trainings. Die Methode nutzt „Golden Negative Trajectories“, also fehlgeschlagene Ausgaben stärkerer Expertenmodelle, nicht als Demonstrationen zum Nachahmen, sondern als fehlerhafte Denkpfade, über die das Modell reflektieren soll, bevor dieses Verhalten zurück in direktes Reasoning übertragen wird. Ein Eintrag bei Hugging Face Daily Papers zufolge evaluierten die Autoren den Ansatz über 9 Benchmarks, 4 LLM-Backbones und 4 On-Policy-Settings hinweg.

Heute ausprobieren

Lesen Sie das ReflectRL-Paper, bevor Sie fehlgeschlagene Expert-Rollouts in Post-Training-Pipelines für Reasoning-Modelle verwerfen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung