Forscher verfeinern On-Policy-Distillation für Agenten
Drei arXiv-Paper schlagen Methoden vor, um zu testen, wann Lehrer-Anleitung die Trajektorien von Schüler-Modellen verbessert.
Warum es wichtig ist
Die Arbeiten deuten auf einen selektiveren Ansatz zur Destillation agentischer und schlussfolgernder Verhaltensweisen hin, bei dem lokale Uneinigkeit zwischen Modellen nicht als ausreichender Grund für eine Intervention gilt. Das könnte wichtig sein, um kleinere Modelle zu entwickeln, die die Leistung bei nachgelagerten Aufgaben erhalten, ohne jede Präferenz des Lehrer-Modells zu kopieren.
Die Kernpunkte
- 1.FutureBridge-OPD berichtet Verbesserungen auf ALFWorld, WebShop und ScienceWorld.
- 2.SPOT verteilt begrenzte Probes anhand von Entropie, Top-k-Masse und Abweichungen zwischen Lehrer und Schüler.
- 3.Recoverability-Labels unterscheiden korrigierbare Fehler von Zuständen, die ein Rollback erfordern.
Drei arXiv-Paper befassen sich mit Grenzen der On-Policy-Distillation, bei der ein Lehrer-Modell Trajektorien überwacht, die von einem Schüler-Modell erzeugt werden. FutureBridge-OPD testet kurze Lehrer-Interventionen in Zuständen mit hoher Uneinigkeit und berichtet Verbesserungen auf ALFWorld, WebShop und ScienceWorld in einem Qwen3-32B-zu-Qwen3-1.7B-Setting. SPOT nutzt sparse Probing und von Verifiern bewertete Fortsetzungen, um zu entscheiden, wo und was destilliert werden soll, während eine Methode zur kontrafaktischen Wiederherstellbarkeit Fehlerzustände erneut abspielt, um zu entscheiden, ob eine Trajektorie beibehalten, zurückgerollt oder konventionell überwacht werden soll.
⚡ Heute ausprobieren
Bevor On-Policy-Distillation für Agenten eingesetzt wird, sollten Lehrer-Interventionen anhand des Erfolgs nachgelagerter Fortsetzungen bewertet werden, nicht nur anhand von Divergenz auf Token-Ebene.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.
InternLM schlägt Mobius-Modellarchitektur vor
Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.