Forschende erweitern On-Policy-Distillation über Standard-Lehrer hinaus
Neue arXiv-Papers nehmen OPD-Grenzen bei Generatoren, Agenten, VLMs und LLMs ins Visier.
Warum es wichtig ist
Die Arbeiten deuten darauf hin, dass OPD zu einem breiteren Werkzeugkasten für die Übertragung von Verhalten wird, wenn sich Lehrer- und Studentenmodelle in Architektur, Modalität, Kapazität oder Trajektorien-Dynamik unterscheiden. Das könnte für den Einsatz kleinerer oder spezialisierter Modelle wichtig sein, ohne einen größeren, eng passenden Lehrer zu benötigen.
Die Kernpunkte
- 1.Any-OPD überbrückt nicht passende Flow-Matching-Generatoren über Vision-Repräsentationen.
- 2.FutureBridge-OPD testet Lehrer-Hinweise anhand späterer Agenten-Trajektorien.
- 3.Weak-to-strong- und Fisher-projizierte Varianten zielen auf Kapazitätsunterschiede.
Mehrere neue arXiv-Papers schlagen Wege vor, zentrale Annahmen der On-Policy-Distillation zu lockern, bei der ein Student-Modell mit Zuständen oder Samples trainiert wird, die es selbst erzeugt. Any-OPD zielt auf latente Flow-Matching-Generatoren aus unterschiedlichen Modellfamilien, indem unabhängig dekodierte Ausgaben in einer eingefrorenen Vision-Repräsentation verglichen werden, während FutureBridge-OPD Lehrer-Hinweise validiert, indem deren Wirkung auf spätere Agenten-Trajektorien getestet wird. Weitere Arbeiten schlagen vor, starke Studenten aus schwächeren Modellpaaren zu destillieren und Korrekturen von Vision-Language-Lehrern auf das zu projizieren, was ein kompaktes Studentenmodell lokal darstellen kann.
⚡ Heute ausprobieren
Bevor Sie OPD einsetzen, prüfen Sie, ob Lehrer und Student Latents, Zeitpläne, Kapazität und Trajektorienverhalten teilen; wählen Sie eine Methode, die für die jeweilige Abweichung ausgelegt ist.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor
Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.