AAI News Hub
RechercheWed, August 5, 2026·6d ago2 sources corroborating

Des chercheurs étendent la distillation on-policy à travers les modèles d’IA

De nouveaux articles s’attaquent aux limites multimodales, agentiques et de génération d’images dans l’entraînement OPD.

Pourquoi c'est important

Ces travaux suggèrent que l’OPD devient un schéma d’entraînement plus large que la simple imitation de modèles de langage, mais les chercheurs constatent qu’une supervision naïve par l’enseignant peut induire les étudiants en erreur lorsque les modalités, les architectures ou les trajectoires divergent. Un meilleur filtrage, un routage plus fin et des calendriers hybrides de RL pourraient être importants pour les modèles multimodaux compacts, les générateurs d’images et les petits agents.

Points clés

  • 1.Les variantes de l’OPD ciblent l’entraînement de modèles multimodaux, agentiques et à correspondance de flux.
  • 2.De nouvelles méthodes filtrent les signaux trompeurs des enseignants ou les orientent selon la modalité.
  • 3.Plusieurs articles se concentrent sur des enseignants hétérogènes aux architectures incompatibles.

Plusieurs articles de recherche nouveaux ou mis à jour proposent des variantes de la distillation on-policy, une méthode de post-entraînement qui utilise des signaux d’enseignants sur des trajectoires générées par l’étudiant. Ces travaux traitent différents modes d’échec : enseignants multimodaux contradictoires, supervision parasite au niveau des tokens, décalage entre familles de modèles de génération d’images, modèles de flux à enseignants multiples, cascades d’appels d’outils chez de petits agents, et entraînement agentique multi-tours à horizon long. Les méthodes proposées incluent OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD et ATOD.

À tester aujourd'hui

Avant d’utiliser l’OPD, vérifiez si les signaux de l’enseignant restent ancrés et fiables sur les trajectoires générées par l’étudiant lui-même.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche