Des chercheurs proposent de nouvelles méthodes de distillation on-policy
Plusieurs articles publiés sur arXiv examinent quand et comment le guidage d’un modèle enseignant doit façonner de plus petits modèles étudiants.
Pourquoi c'est important
Ces travaux mettent en évidence une limite récurrente de la distillation : des signaux plus forts venus de l’enseignant ne sont pas toujours utiles si l’étudiant ne peut pas les représenter ou s’ils dégradent les trajectoires ultérieures. C’est un enjeu important pour rendre les modèles et agents plus petits plus fiables, sans copier aveuglément des enseignants à l’échelle frontière.
Points clés
- 1.Le guidage de l’enseignant peut échouer lorsque les étudiants ne peuvent pas représenter la correction.
- 2.Les vérifications de trajectoires futures ont dépassé l’OPD classique dans les benchmarks d’agents.
- 3.Les étiquettes de récupérabilité peuvent aider à décider s’il faut conserver ou annuler des états divergents.
Une série d’articles sur arXiv propose des améliorations de la distillation on-policy, une méthode d’entraînement qui supervise les modèles étudiants à partir de trajectoires qu’ils génèrent eux-mêmes. Ces approches comprennent Fisher-Projected OPD pour les modèles vision-langage, FutureBridge-OPD pour les tâches d’agents multi-tours, SPOT pour le sondage parcimonieux et les cibles calibrées sur les résultats, ainsi qu’un contrôle sensible à la récupérabilité pour décider si des états de raisonnement divergents doivent être conservés, annulés ou supervisés normalement. Les évaluations rapportées couvrent le raisonnement vision-langage, ALFWorld, WebShop, ScienceWorld, AIME et GPQA-Diamond, plusieurs articles revendiquant des gains par rapport aux références OPD classiques.
⚡ À tester aujourd'hui
Avant d’appliquer l’OPD, vérifiez si les interventions de l’enseignant améliorent les continuations ultérieures de l’étudiant, et pas seulement l’accord local sur les tokens.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.