Forscher weiten On-Policy-Distillation auf verschiedene KI-Modelle aus
Neue Arbeiten nehmen multimodale, agentische und bildgenerierende Grenzen im OPD-Training ins Visier.
Warum es wichtig ist
Die Arbeiten deuten darauf hin, dass OPD über die Imitation von Sprachmodellen hinaus zu einem breiteren Trainingsmuster wird. Zugleich stellen Forscher fest, dass naive Lehrer-Supervision Schüler in die Irre führen kann, wenn Modalitäten, Architekturen oder Trajektorien auseinanderlaufen. Besseres Filtern, Routing und hybride RL-Zeitpläne könnten für kompakte multimodale Modelle, Bildgeneratoren und kleine Agenten entscheidend sein.
Die Kernpunkte
- 1.OPD-Varianten zielen auf das Training multimodaler, agentischer und Flow-Matching-Modelle.
- 2.Neue Methoden filtern irreführende Lehrersignale oder routen sie nach Modalität.
- 3.Mehrere Arbeiten konzentrieren sich auf heterogene Lehrer mit inkompatiblen Architekturen.
Mehrere neue und aktualisierte Forschungsarbeiten schlagen Varianten der On-Policy-Distillation vor, einer Methode des Post-Trainings, die Lehrersignale auf von Schülern erzeugten Trajektorien nutzt. Die Arbeiten adressieren unterschiedliche Fehlerbilder: widersprüchliche multimodale Lehrer, irreführende Token-Level-Supervision, nicht passende Modellfamilien in der Bildgenerierung, Multi-Teacher-Flow-Modelle, Kaskaden von Tool-Aufrufen in kleinen Agenten sowie Long-Horizon-Training über mehrere Agenten-Interaktionen hinweg. Zu den vorgeschlagenen Methoden gehören OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD und ATOD.
⚡ Heute ausprobieren
Prüfen Sie vor dem Einsatz von OPD, ob Lehrersignale auf den vom Schüler selbst erzeugten Trajektorien fundiert und zuverlässig bleiben.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
Google testet AMIE für medizinische Videokonsultationen in Echtzeit
Das auf Gemini basierende Forschungssystem wurde in simulierten Telemedizin-Konsultationen evaluiert.
Anthropic-Modell bringt Arbeit an der Riemannschen Vermutung voran
Ein unveröffentlichtes Anthropic-Modell hat Fortschritte bei dem seit Langem ungelösten mathematischen Problem erzielt, berichtete TechCrunch.