Des chercheurs étendent la distillation on-policy à travers les modèles d’IA
De nouveaux articles s’attaquent aux limites multimodales, agentiques et de génération d’images dans l’entraînement OPD.
Pourquoi c'est important
Ces travaux suggèrent que l’OPD devient un schéma d’entraînement plus large que la simple imitation de modèles de langage, mais les chercheurs constatent qu’une supervision naïve par l’enseignant peut induire les étudiants en erreur lorsque les modalités, les architectures ou les trajectoires divergent. Un meilleur filtrage, un routage plus fin et des calendriers hybrides de RL pourraient être importants pour les modèles multimodaux compacts, les générateurs d’images et les petits agents.
Points clés
- 1.Les variantes de l’OPD ciblent l’entraînement de modèles multimodaux, agentiques et à correspondance de flux.
- 2.De nouvelles méthodes filtrent les signaux trompeurs des enseignants ou les orientent selon la modalité.
- 3.Plusieurs articles se concentrent sur des enseignants hétérogènes aux architectures incompatibles.
Plusieurs articles de recherche nouveaux ou mis à jour proposent des variantes de la distillation on-policy, une méthode de post-entraînement qui utilise des signaux d’enseignants sur des trajectoires générées par l’étudiant. Ces travaux traitent différents modes d’échec : enseignants multimodaux contradictoires, supervision parasite au niveau des tokens, décalage entre familles de modèles de génération d’images, modèles de flux à enseignants multiples, cascades d’appels d’outils chez de petits agents, et entraînement agentique multi-tours à horizon long. Les méthodes proposées incluent OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD et ATOD.
⚡ À tester aujourd'hui
Avant d’utiliser l’OPD, vérifiez si les signaux de l’enseignant restent ancrés et fiables sur les trajectoires générées par l’étudiant lui-même.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google teste AMIE pour des consultations médicales vidéo en temps réel
Ce système de recherche fondé sur Gemini a été évalué dans des consultations de télésanté simulées.
Un modèle d’Anthropic fait avancer les travaux sur l’hypothèse de Riemann
Un modèle inédit d’Anthropic a permis des progrès sur ce problème mathématique non résolu de longue date, rapporte TechCrunch.
IBM détaille ALTK-Evolve, une méthode de mémoire pour agents
Le système récupère des consignes propres à chaque tâche afin de réduire les tokens d’inférence par rapport à ACE.