AAI News Hub
ForschungFri, August 7, 2026·5d ago2 sources corroborating

Forscher schlagen neue Methoden für On-Policy-Distillation vor

Mehrere arXiv-Paper untersuchen, wann und wie die Anleitung durch Lehrermodelle kleinere Student-Modelle prägen sollte.

Warum es wichtig ist

Die Arbeiten verweisen auf eine gemeinsame Grenze der Distillation: Stärkere Lehrersignale sind nicht immer hilfreich, wenn der Student sie nicht abbilden kann oder wenn sie spätere Trajektorien verschlechtern. Das ist wichtig, um kleinere Modelle und Agenten zuverlässiger zu machen, ohne Lehrermodelle auf Frontier-Niveau blind zu kopieren.

Die Kernpunkte

  • 1.Lehrerführung kann scheitern, wenn Student-Modelle die Korrektur nicht darstellen können.
  • 2.Prüfungen künftiger Trajektorien schnitten in Agenten-Benchmarks besser ab als einfache OPD.
  • 3.Recoverability-Labels können steuern, ob abweichende Zustände beibehalten oder zurückgesetzt werden sollten.

Eine Reihe von arXiv-Papern schlägt Verfeinerungen der On-Policy-Distillation vor, eines Trainingsansatzes, bei dem Student-Modelle anhand von Trajektorien beaufsichtigt werden, die sie selbst erzeugen. Zu den Methoden zählen Fisher-Projected OPD für Vision-Language-Modelle, FutureBridge-OPD für Multi-Turn-Agentenaufgaben, SPOT für Sparse Probing und ergebnis-kalibrierte Zielvorgaben sowie recoverability-aware control, um zu entscheiden, ob abweichende Reasoning-Zustände beibehalten, zurückgesetzt oder regulär beaufsichtigt werden sollten. Die berichteten Evaluationen umfassen Vision-Language-Reasoning, ALFWorld, WebShop, ScienceWorld, AIME und GPQA-Diamond; mehrere Paper reklamieren dabei Zugewinne gegenüber einfachen OPD-Baselines.

Heute ausprobieren

Bevor OPD eingesetzt wird, sollte geprüft werden, ob Eingriffe des Lehrermodells die nachgelagerten Fortsetzungen des Student-Modells verbessern, statt nur die lokale Token-Übereinstimmung zu messen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung