Co-RL entraîne des modèles de raisonnement avec des récompenses issues de leurs pairs
L’article publié sur arXiv propose un apprentissage par renforcement multi-agent coopératif afin de réduire la dépendance à la supervision fondée sur des vérités de référence.
Pourquoi c'est important
Ces travaux s’attaquent à un goulot d’étranglement central du post-entraînement des modèles de raisonnement : la dépendance à des récompenses vérifiables coûteuses ou rares. S’il est validé au-delà du cadre présenté dans l’article, le RL fondé sur les pairs pourrait inspirer des méthodes d’entraînement moins dépendantes de la supervision annotée par des humains, tout en évitant l’effondrement lié à des retours entièrement auto-générés.
Points clés
- 1.Co-RL utilise des récompenses issues de pairs entre modèles découplés.
- 2.La diversité des cohortes est présentée comme un moyen de réduire les erreurs corrélées.
- 3.L’article se concentre sur le raisonnement non supervisé dans le post-entraînement par RL.
Des chercheurs ont présenté Co-RL, un cadre destiné à améliorer le raisonnement dans les modèles de langage et les modèles vision-langage grâce à l’apprentissage par renforcement coopératif multi-agent. La méthode entraîne plusieurs modèles découplés, sans paramètres partagés, en utilisant des récompenses dérivées de modèles pairs plutôt que d’annotations de référence. Les auteurs estiment que des cohortes plus diverses, incluant différentes familles et tailles de modèles ainsi que des échantillons reformulés, réduisent les erreurs corrélées susceptibles de provoquer des boucles de rétroaction auto-renforcées.
⚡ À tester aujourd'hui
Lisez l’article sur Co-RL avant d’adopter le RL auto-récompensé pour les modèles de raisonnement, surtout si votre configuration ne dispose pas de récompenses vérifiables.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.