Des chercheurs proposent de nouveaux contrôles pour la distillation on-policy
Trois articles publiés sur arXiv ciblent les modes d’échec liés à l’entraînement de modèles étudiants à partir de trajectoires guidées par un modèle enseignant.
Pourquoi c'est important
Ces articles mettent en évidence une limite commune des pipelines de distillation actuels : reproduire localement le comportement de l’enseignant peut ne pas suffire lorsque les résultats en aval, la récupérabilité et la robustesse au contexte comptent. Un meilleur contrôle sur le moment et le contenu à distiller pourrait améliorer les modèles étudiants plus petits utilisés pour le raisonnement et les charges de travail agentiques.
Points clés
- 1.SPOT utilise un sondage parcimonieux et des continuations évaluées par un vérificateur pour calibrer les cibles.
- 2.Le contrôle fondé sur la récupérabilité distingue les erreurs corrigeables des états qui nécessitent un retour en arrière.
- 3.FutureBridge-OPD fait état de gains sur ALFWorld, WebShop et ScienceWorld.
Plusieurs nouveaux articles sur arXiv proposent des méthodes pour rendre la distillation on-policy plus sélective et plus robuste. SPOT réserve un budget limité de sondage aux positions incertaines ou mal alignées, et calibre les cibles de distillation à l’aide de continuations évaluées par un vérificateur. D’autres travaux introduisent la récupérabilité contrefactuelle afin de décider si les erreurs du modèle étudiant doivent être conservées ou annulées, tandis que FutureBridge-OPD teste si de courts ponts fournis par l’enseignant améliorent les trajectoires ultérieures du modèle étudiant dans des tâches agentiques.
⚡ À tester aujourd'hui
Avant d’appliquer la distillation on-policy, vérifiez si votre pipeline valide les interventions de l’enseignant au regard des résultats en aval de la tâche, et pas seulement de la divergence au niveau des tokens.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AINative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.LGNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.