AAI News Hub
ForschungWed, August 19, 2026·1d ago2 sources corroborating

Co-RL trainiert Reasoning-Modelle mit Belohnungen aus Peer-Modellen

Das arXiv-Paper schlägt kooperatives Multi-Agenten-RL vor, um die Abhängigkeit von Ground-Truth-Supervision zu verringern.

Warum es wichtig ist

Die Arbeit adressiert einen zentralen Engpass im Post-Training von Reasoning-Modellen: die Abhängigkeit von teuren oder knappen verifizierbaren Rewards. Sollte sich der Ansatz über das im Paper berichtete Setting hinaus bestätigen, könnte peer-basiertes RL Trainingsmethoden prägen, die weniger auf menschlich gelabelte Supervision angewiesen sind und zugleich einen Kollaps durch rein selbstgeneriertes Feedback vermeiden.

Die Kernpunkte

  • 1.Co-RL nutzt peer-abgeleitete Rewards über entkoppelte Modelle hinweg.
  • 2.Kohortenvielfalt wird als Weg dargestellt, korrelierte Fehler zu reduzieren.
  • 3.Das Paper konzentriert sich auf unüberwachtes Reasoning im RL-Post-Training.

Forschende haben Co-RL vorgestellt, ein Framework zur Verbesserung des Reasonings in Sprach- und Vision-Language-Modellen durch kooperatives Multi-Agenten-Reinforcement-Learning. Die Methode trainiert mehrere entkoppelte Modelle ohne gemeinsam genutzte Parameter und nutzt Belohnungen, die von Peer-Modellen statt aus Ground-Truth-Annotationen abgeleitet werden. Die Autorinnen und Autoren argumentieren, dass vielfältigere Kohorten, darunter unterschiedliche Modellfamilien, Größen und umformulierte Samples, korrelierte Fehler reduzieren, die selbstverstärkende Feedback-Schleifen auslösen können.

Heute ausprobieren

Lesen Sie das Co-RL-Paper, bevor Sie selbstbelohnendes RL für Reasoning-Modelle einsetzen, insbesondere wenn Ihr Setup keine verifizierbaren Rewards bietet.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung