Forscher schlagen neue Methoden für On-Policy-Distillation vor
Mehrere arXiv-Paper untersuchen, wann und wie die Anleitung durch Lehrermodelle kleinere Student-Modelle prägen sollte.
Warum es wichtig ist
Die Arbeiten verweisen auf eine gemeinsame Grenze der Distillation: Stärkere Lehrersignale sind nicht immer hilfreich, wenn der Student sie nicht abbilden kann oder wenn sie spätere Trajektorien verschlechtern. Das ist wichtig, um kleinere Modelle und Agenten zuverlässiger zu machen, ohne Lehrermodelle auf Frontier-Niveau blind zu kopieren.
Die Kernpunkte
- 1.Lehrerführung kann scheitern, wenn Student-Modelle die Korrektur nicht darstellen können.
- 2.Prüfungen künftiger Trajektorien schnitten in Agenten-Benchmarks besser ab als einfache OPD.
- 3.Recoverability-Labels können steuern, ob abweichende Zustände beibehalten oder zurückgesetzt werden sollten.
Eine Reihe von arXiv-Papern schlägt Verfeinerungen der On-Policy-Distillation vor, eines Trainingsansatzes, bei dem Student-Modelle anhand von Trajektorien beaufsichtigt werden, die sie selbst erzeugen. Zu den Methoden zählen Fisher-Projected OPD für Vision-Language-Modelle, FutureBridge-OPD für Multi-Turn-Agentenaufgaben, SPOT für Sparse Probing und ergebnis-kalibrierte Zielvorgaben sowie recoverability-aware control, um zu entscheiden, ob abweichende Reasoning-Zustände beibehalten, zurückgesetzt oder regulär beaufsichtigt werden sollten. Die berichteten Evaluationen umfassen Vision-Language-Reasoning, ALFWorld, WebShop, ScienceWorld, AIME und GPQA-Diamond; mehrere Paper reklamieren dabei Zugewinne gegenüber einfachen OPD-Baselines.
⚡ Heute ausprobieren
Bevor OPD eingesetzt wird, sollte geprüft werden, ob Eingriffe des Lehrermodells die nachgelagerten Fortsetzungen des Student-Modells verbessern, statt nur die lokale Token-Übereinstimmung zu messen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google DeepMind stellt Modell für Gebärdensprache-zu-Text vor
DeepMinds SL2T treibt neue Gebärdensprachfunktionen für gehörlose und schwerhörige Nutzer an.
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.