AAI News Hub
RechercheWed, August 19, 2026·1d ago2 sources corroborating

Co-RL entraîne des modèles de raisonnement avec des récompenses issues de leurs pairs

L’article publié sur arXiv propose un apprentissage par renforcement multi-agent coopératif afin de réduire la dépendance à la supervision fondée sur des vérités de référence.

Pourquoi c'est important

Ces travaux s’attaquent à un goulot d’étranglement central du post-entraînement des modèles de raisonnement : la dépendance à des récompenses vérifiables coûteuses ou rares. S’il est validé au-delà du cadre présenté dans l’article, le RL fondé sur les pairs pourrait inspirer des méthodes d’entraînement moins dépendantes de la supervision annotée par des humains, tout en évitant l’effondrement lié à des retours entièrement auto-générés.

Points clés

  • 1.Co-RL utilise des récompenses issues de pairs entre modèles découplés.
  • 2.La diversité des cohortes est présentée comme un moyen de réduire les erreurs corrélées.
  • 3.L’article se concentre sur le raisonnement non supervisé dans le post-entraînement par RL.

Des chercheurs ont présenté Co-RL, un cadre destiné à améliorer le raisonnement dans les modèles de langage et les modèles vision-langage grâce à l’apprentissage par renforcement coopératif multi-agent. La méthode entraîne plusieurs modèles découplés, sans paramètres partagés, en utilisant des récompenses dérivées de modèles pairs plutôt que d’annotations de référence. Les auteurs estiment que des cohortes plus diverses, incluant différentes familles et tailles de modèles ainsi que des échantillons reformulés, réduisent les erreurs corrélées susceptibles de provoquer des boucles de rétroaction auto-renforcées.

À tester aujourd'hui

Lisez l’article sur Co-RL avant d’adopter le RL auto-récompensé pour les modèles de raisonnement, surtout si votre configuration ne dispose pas de récompenses vérifiables.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche