ReflectRL entraîne des modèles de raisonnement à partir de trajectoires d’experts échouées
L’article publié sur arXiv propose d’utiliser des rollouts d’experts imparfaits comme cibles de réflexion pendant l’entraînement on-policy.
Pourquoi c'est important
Ce travail s’attaque à un goulot d’étranglement dans le post-entraînement des modèles de raisonnement : les trajectoires d’experts deviennent moins utiles lorsque l’expert échoue sur des problèmes difficiles. Si elle est validée, l’approche pourrait transformer des rollouts échoués en signal d’entraînement exploitable au lieu d’en faire des données écartées.
Points clés
- 1.ReflectRL apprend à partir de trajectoires de raisonnement d’experts échouées.
- 2.La méthode reconvertit le comportement de réflexion en raisonnement direct.
- 3.Les évaluations couvrent 9 benchmarks et 4 architectures de base de LLM.
Des chercheurs ont présenté ReflectRL, un framework léger et plug-and-play destiné à améliorer le raisonnement des grands modèles de langage pendant l’entraînement on-policy. La méthode s’appuie sur des « Golden Negative Trajectories », des sorties échouées produites par des modèles experts plus puissants, non pas comme des démonstrations à imiter, mais comme des cheminements de raisonnement défaillants sur lesquels le modèle doit réfléchir avant de transférer ce comportement vers le raisonnement direct. Selon une entrée de Hugging Face Daily Papers, les auteurs ont évalué l’approche sur 9 benchmarks, 4 architectures de base de LLM et 4 configurations on-policy.
⚡ À tester aujourd'hui
Lisez l’article ReflectRL avant de jeter les rollouts d’experts échoués dans les pipelines de post-entraînement des modèles de raisonnement.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGPrefix-Guided On-Policy Distillation: Mining Golden Trajectories from RolloutsAug 4, 12:00 PM↗
- HF Daily PapersReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.