AAI News Hub
ForschungWed, August 19, 2026·2d ago2 sources corroborating

Forschende schlagen Co-RL für Reasoning mit Peer-Belohnungen vor

Das Framework trainiert getrennte Modelle mit Belohnungen von Peer-Modellen, um das Risiko eines Kollapses durch Selbstbelohnung zu verringern.

Warum es wichtig ist

Die Arbeit zielt auf einen zentralen Engpass beim Training von Reasoning-Modellen: die Abhängigkeit von teuren oder knappen verifizierbaren Belohnungen. Sollte sich der Ansatz über das berichtete Setup hinaus bestätigen, könnte Multi-Agenten-RL mit Peer-Belohnungen einen Weg zu besser skalierbarer, unüberwachter Verbesserung von Reasoning eröffnen und zugleich Risiken der Homogenisierung mindern.

Die Kernpunkte

  • 1.Co-RL nutzt von Peers abgeleitete Belohnungen statt Ground-Truth-Supervision.
  • 2.Getrennte Modelle teilen während des kooperativen RL-Trainings keine Parameter.
  • 3.Vielfältige Kohorten sollen korrelierte Fehler und Kollaps verringern.

Ein neues arXiv-Paper stellt Co-RL vor, ein kooperatives Multi-Agenten-Reinforcement-Learning-Framework zur Verbesserung von Reasoning ohne Ground-Truth-Supervision. Die Methode trainiert mehrere entkoppelte Modelle, die keine Parameter teilen, und nutzt Belohnungen, die von Peer-Modellen stammen, statt ausschließlich selbst erzeugtes Feedback. Die Autoren argumentieren, dass die Vielfalt der Kohorten über Modellfamilien, Größen und umformulierte Trainingsbeispiele hinweg korrelierte Fehler reduziert, die selbstverstärkende Feedbackschleifen und einen Trainingskollaps auslösen können.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie Self-Rewarding-RL einsetzen, und prüfen Sie, ob diverse Peer-Evaluatoren korrelierte Fehlermuster in Ihrem Trainingssetup reduzieren.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung