AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Des chercheurs s’attaquent aux échecs de distillation on-policy chez les agents

De récents articles publiés sur arXiv proposent des correctifs d’entraînement sensibles aux tours, aux étapes et aux préfixes pour les agents LLM utilisant des outils.

Pourquoi c'est important

Ces travaux traduisent une évolution plus large, qui s’éloigne de l’apprentissage par renforcement fondé uniquement sur le résultat final au profit d’une supervision plus dense et attentive à l’état pour l’entraînement des agents. C’est important parce que les agents utilisant des outils échouent souvent au fil de plusieurs tours, là où des récompenses grossières attribuées à toute une trajectoire peuvent ne pas révéler quelle étape ou quel appel d’outil a provoqué l’échec.

Points clés

  • 1.De nouvelles méthodes repondèrent la distillation selon le tour, l’étape, le préfixe ou la qualité de l’échantillon.
  • 2.Les articles ciblent les récompenses clairsemées et les signaux enseignants peu fiables dans les longues trajectoires d’agents.
  • 3.Les erreurs d’appel d’outils peuvent se propager en cascade, affaiblissant la supervision de l’enseignant au niveau des tokens.

Un ensemble de récents articles publiés sur arXiv propose de nouvelles façons d’entraîner des agents fondés sur des modèles de langage, intégrés à des outils et capables d’échanges multi-tours, au moyen de la distillation on-policy et de l’apprentissage par renforcement. Parmi ces méthodes figurent TurnSight, SOD, ATOD, PG-OPD et RSTG, qui s’attaquent toutes à des problèmes de fiabilité tels que les récompenses clairsemées, les erreurs en cascade dans les appels d’outils, la divergence enseignant-élève, l’inefficacité des longs rollouts et la perte de gradients dans les groupes de récompenses à variance nulle. Les articles rapportent des expériences couvrant le raisonnement à long horizon, les mathématiques, les sciences, le code et les tâches d’agents interactifs, mais les résumés fournis n’établissent pas de méthode nettement dominante sur un benchmark unique couvrant l’ensemble des approches.

À tester aujourd'hui

Si vous entraînez des agents utilisant des outils, vérifiez si la supervision de l’enseignant est conditionnée par la qualité de chaque étape ou tour avant de combiner OPD avec l’apprentissage par renforcement.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche