Forschende schlagen Co-RL für Reasoning mit Peer-Belohnungen vor
Das Framework trainiert getrennte Modelle mit Belohnungen von Peer-Modellen, um das Risiko eines Kollapses durch Selbstbelohnung zu verringern.
Warum es wichtig ist
Die Arbeit zielt auf einen zentralen Engpass beim Training von Reasoning-Modellen: die Abhängigkeit von teuren oder knappen verifizierbaren Belohnungen. Sollte sich der Ansatz über das berichtete Setup hinaus bestätigen, könnte Multi-Agenten-RL mit Peer-Belohnungen einen Weg zu besser skalierbarer, unüberwachter Verbesserung von Reasoning eröffnen und zugleich Risiken der Homogenisierung mindern.
Die Kernpunkte
- 1.Co-RL nutzt von Peers abgeleitete Belohnungen statt Ground-Truth-Supervision.
- 2.Getrennte Modelle teilen während des kooperativen RL-Trainings keine Parameter.
- 3.Vielfältige Kohorten sollen korrelierte Fehler und Kollaps verringern.
Ein neues arXiv-Paper stellt Co-RL vor, ein kooperatives Multi-Agenten-Reinforcement-Learning-Framework zur Verbesserung von Reasoning ohne Ground-Truth-Supervision. Die Methode trainiert mehrere entkoppelte Modelle, die keine Parameter teilen, und nutzt Belohnungen, die von Peer-Modellen stammen, statt ausschließlich selbst erzeugtes Feedback. Die Autoren argumentieren, dass die Vielfalt der Kohorten über Modellfamilien, Größen und umformulierte Trainingsbeispiele hinweg korrelierte Fehler reduziert, die selbstverstärkende Feedbackschleifen und einen Trainingskollaps auslösen können.
⚡ Heute ausprobieren
Lesen Sie das Paper, bevor Sie Self-Rewarding-RL einsetzen, und prüfen Sie, ob diverse Peer-Evaluatoren korrelierte Fehlermuster in Ihrem Trainingssetup reduzieren.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MemTrapBench testet kognitive Fallen beim Speichereinsatz von LLMs
Der Benchmark zeigt, dass Speicher die Aufgabenleistung verschlechtern kann, selbst wenn die abgerufenen Einträge relevant sind.
AI4AI-Bench testet Agenten beim Entwurf von Trainingsalgorithmen
Der arXiv-Benchmark prüft, ob LLM-Agenten Trainingsalgorithmen in eingefrorenen Repositories umschreiben können.
Neue Arbeiten zielen auf Sparse Attention für Long-Context-KI
Forschende schlagen Methoden für günstigere Long-Context-Inferenz, Serving, Videogenerierung und Speicher vor.