AAI News Hub
ForschungWed, August 5, 2026·Aug 52 sources corroborating

Forscher weiten On-Policy-Distillation auf verschiedene KI-Modelle aus

Neue Arbeiten nehmen multimodale, agentische und bildgenerierende Grenzen im OPD-Training ins Visier.

Warum es wichtig ist

Die Arbeiten deuten darauf hin, dass OPD über die Imitation von Sprachmodellen hinaus zu einem breiteren Trainingsmuster wird. Zugleich stellen Forscher fest, dass naive Lehrer-Supervision Schüler in die Irre führen kann, wenn Modalitäten, Architekturen oder Trajektorien auseinanderlaufen. Besseres Filtern, Routing und hybride RL-Zeitpläne könnten für kompakte multimodale Modelle, Bildgeneratoren und kleine Agenten entscheidend sein.

Die Kernpunkte

  • 1.OPD-Varianten zielen auf das Training multimodaler, agentischer und Flow-Matching-Modelle.
  • 2.Neue Methoden filtern irreführende Lehrersignale oder routen sie nach Modalität.
  • 3.Mehrere Arbeiten konzentrieren sich auf heterogene Lehrer mit inkompatiblen Architekturen.

Mehrere neue und aktualisierte Forschungsarbeiten schlagen Varianten der On-Policy-Distillation vor, einer Methode des Post-Trainings, die Lehrersignale auf von Schülern erzeugten Trajektorien nutzt. Die Arbeiten adressieren unterschiedliche Fehlerbilder: widersprüchliche multimodale Lehrer, irreführende Token-Level-Supervision, nicht passende Modellfamilien in der Bildgenerierung, Multi-Teacher-Flow-Modelle, Kaskaden von Tool-Aufrufen in kleinen Agenten sowie Long-Horizon-Training über mehrere Agenten-Interaktionen hinweg. Zu den vorgeschlagenen Methoden gehören OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD und ATOD.

Heute ausprobieren

Prüfen Sie vor dem Einsatz von OPD, ob Lehrersignale auf den vom Schüler selbst erzeugten Trajektorien fundiert und zuverlässig bleiben.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung