Des chercheurs repoussent la distillation on-policy au-delà des enseignants classiques
De nouveaux articles sur arXiv s’attaquent aux limites de l’OPD pour les générateurs, les agents, les VLM et les LLM.
Pourquoi c'est important
Ces travaux suggèrent que l’OPD devient une boîte à outils plus large pour transférer des comportements lorsque les modèles enseignant et étudiant diffèrent par leur architecture, leur modalité, leur capacité ou leur dynamique de trajectoire. Cela pourrait compter pour déployer des modèles plus petits ou spécialisés sans nécessiter un enseignant plus grand et étroitement apparié.
Points clés
- 1.Any-OPD rapproche des générateurs à flow matching incompatibles grâce à des représentations visuelles.
- 2.FutureBridge-OPD teste le guidage de l’enseignant à l’aune des trajectoires ultérieures des agents.
- 3.Les variantes weak-to-strong et projetées par Fisher ciblent les écarts de capacité.
Plusieurs nouveaux articles sur arXiv proposent des moyens d’assouplir les hypothèses centrales de la distillation on-policy, où un modèle étudiant est entraîné sur des états ou des échantillons qu’il génère lui-même. Any-OPD vise des générateurs latents à flow matching issus de familles de modèles différentes en comparant des sorties décodées indépendamment dans une représentation visuelle figée, tandis que FutureBridge-OPD valide le guidage de l’enseignant en testant son effet sur les trajectoires ultérieures des agents. D’autres articles proposent de distiller des étudiants performants à partir de paires de modèles plus faibles et de projeter les corrections d’enseignants vision-langage sur ce qu’un étudiant compact peut représenter localement.
⚡ À tester aujourd'hui
Avant d’adopter l’OPD, vérifiez si votre enseignant et votre étudiant partagent les mêmes latents, calendriers, capacités et comportements de trajectoire ; choisissez une méthode conçue pour le décalage concerné.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs présentent TTP-D pour l’optimisation des tournées camion-drone
Ce nouveau benchmark combine sélection d’objets, itinéraires dépendants de la charge et synchronisation du drone.
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.