Des chercheurs proposent Co-RL pour un raisonnement récompensé par les pairs
Le framework entraîne des modèles distincts avec des récompenses fournies par leurs pairs afin de réduire les risques d’effondrement liés à l’auto-récompense.
Pourquoi c'est important
Ces travaux visent un goulet d’étranglement majeur dans l’entraînement des modèles de raisonnement : la dépendance à des récompenses vérifiables coûteuses ou rares. Si l’approche est validée au-delà du cadre rapporté, le RL multi-agent récompensé par les pairs pourrait ouvrir une voie vers une amélioration non supervisée du raisonnement plus scalable, tout en limitant les risques d’homogénéisation.
Points clés
- 1.Co-RL utilise des récompenses dérivées des pairs plutôt qu’une supervision fondée sur des vérités terrain.
- 2.Des modèles distincts ne partagent aucun paramètre pendant l’entraînement coopératif par RL.
- 3.Des cohortes diversifiées visent à réduire les erreurs corrélées et l’effondrement.
Un nouvel article publié sur arXiv présente Co-RL, un framework d’apprentissage par renforcement coopératif multi-agent destiné à améliorer le raisonnement sans supervision fondée sur des vérités terrain. La méthode entraîne plusieurs modèles découplés, sans paramètres partagés, en s’appuyant sur des récompenses issues de modèles pairs plutôt que sur le seul feedback auto-généré. Les auteurs soutiennent que la diversité des cohortes, entre familles de modèles, tailles et échantillons d’entraînement reformulés, réduit les erreurs corrélées susceptibles d’alimenter des boucles de rétroaction auto-renforcées et un effondrement de l’entraînement.
⚡ À tester aujourd'hui
Lisez l’article avant d’utiliser le RL auto-récompensé, et vérifiez si des évaluateurs pairs diversifiés réduisent les modes d’échec corrélés dans votre configuration d’entraînement.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.
De nouveaux articles ciblent l’attention éparse pour l’IA à long contexte
Des chercheurs proposent des méthodes pour rendre moins coûteuses l’inférence à long contexte, le serving, la génération vidéo et la mémoire.