Co-RL trainiert Reasoning-Modelle mit Belohnungen aus Peer-Modellen
Das arXiv-Paper schlägt kooperatives Multi-Agenten-RL vor, um die Abhängigkeit von Ground-Truth-Supervision zu verringern.
Warum es wichtig ist
Die Arbeit adressiert einen zentralen Engpass im Post-Training von Reasoning-Modellen: die Abhängigkeit von teuren oder knappen verifizierbaren Rewards. Sollte sich der Ansatz über das im Paper berichtete Setting hinaus bestätigen, könnte peer-basiertes RL Trainingsmethoden prägen, die weniger auf menschlich gelabelte Supervision angewiesen sind und zugleich einen Kollaps durch rein selbstgeneriertes Feedback vermeiden.
Die Kernpunkte
- 1.Co-RL nutzt peer-abgeleitete Rewards über entkoppelte Modelle hinweg.
- 2.Kohortenvielfalt wird als Weg dargestellt, korrelierte Fehler zu reduzieren.
- 3.Das Paper konzentriert sich auf unüberwachtes Reasoning im RL-Post-Training.
Forschende haben Co-RL vorgestellt, ein Framework zur Verbesserung des Reasonings in Sprach- und Vision-Language-Modellen durch kooperatives Multi-Agenten-Reinforcement-Learning. Die Methode trainiert mehrere entkoppelte Modelle ohne gemeinsam genutzte Parameter und nutzt Belohnungen, die von Peer-Modellen statt aus Ground-Truth-Annotationen abgeleitet werden. Die Autorinnen und Autoren argumentieren, dass vielfältigere Kohorten, darunter unterschiedliche Modellfamilien, Größen und umformulierte Samples, korrelierte Fehler reduzieren, die selbstverstärkende Feedback-Schleifen auslösen können.
⚡ Heute ausprobieren
Lesen Sie das Co-RL-Paper, bevor Sie selbstbelohnendes RL für Reasoning-Modelle einsetzen, insbesondere wenn Ihr Setup keine verifizierbaren Rewards bietet.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.