Des chercheurs affinent la distillation on-policy pour les agents
Trois articles publiés sur arXiv proposent des méthodes pour déterminer quand le guidage d’un enseignant améliore les trajectoires d’un étudiant.
Pourquoi c'est important
Ces travaux esquissent une approche plus sélective de la distillation des comportements agentiques et de raisonnement, dans laquelle un désaccord local entre modèles n’est pas considéré comme une preuve suffisante pour intervenir. Cela pourrait compter pour construire des modèles plus petits qui préservent les performances sur les tâches aval sans copier chaque préférence de l’enseignant.
Points clés
- 1.FutureBridge-OPD fait état de gains sur ALFWorld, WebShop et ScienceWorld.
- 2.SPOT répartit un nombre limité de sondages à partir de l’entropie, de la masse top-k et du décalage enseignant-étudiant.
- 3.Les étiquettes de récupérabilité distinguent les erreurs corrigibles des états nécessitant un retour en arrière.
Trois articles publiés sur arXiv examinent les limites de la distillation on-policy, où un modèle enseignant supervise des trajectoires générées par un modèle étudiant. FutureBridge-OPD teste de brèves interventions de l’enseignant dans des états de fort désaccord et fait état de gains sur ALFWorld, WebShop et ScienceWorld dans une configuration Qwen3-32B vers Qwen3-1.7B. SPOT utilise un sondage parcimonieux et des continuations évaluées par vérificateur pour décider où et quoi distiller, tandis qu’une méthode de récupérabilité contrefactuelle rejoue les états d’erreur afin de déterminer s’il faut conserver une trajectoire, revenir en arrière ou appliquer une supervision conventionnelle.
⚡ À tester aujourd'hui
Avant d’adopter la distillation on-policy pour les agents, évaluez les interventions de l’enseignant à l’aune de la réussite des continuations aval, pas seulement de la divergence au niveau des tokens.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.