AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

Forscher nehmen Fehler bei On-Policy-Distillation in Agenten ins Visier

Aktuelle arXiv-Papers schlagen turn-, schritt- und präfixbewusste Trainingskorrekturen für tool-nutzende LLM-Agenten vor.

Warum es wichtig ist

Die Arbeiten spiegeln eine breitere Verschiebung wider: weg von ausschließlich ergebnisorientiertem Reinforcement Learning hin zu dichterer, zustandsbewusster Supervision für das Agententraining. Das ist wichtig, weil tool-nutzende Agenten oft über mehrere Turns hinweg scheitern, während grobe Trajektorien-Rewards übersehen können, welcher Schritt oder welcher Tool Call den Fehler ausgelöst hat.

Die Kernpunkte

  • 1.Neue Methoden gewichten Distillation nach Turn-, Schritt-, Präfix- oder Sample-Qualität neu.
  • 2.Die Papers zielen auf sparse Rewards und unzuverlässige Teacher-Signale in langen Agenten-Trajektorien.
  • 3.Tool-Call-Fehler können sich fortpflanzen und dadurch tokenbasierte Teacher-Supervision schwächen.

Eine Reihe aktueller arXiv-Papers schlägt neue Verfahren vor, um tool-integrierte und mehrzügige Sprachmodell-Agenten mit On-Policy-Distillation und Reinforcement Learning zu trainieren. Dazu gehören TurnSight, SOD, ATOD, PG-OPD und RSTG, die Zuverlässigkeitsprobleme wie sparse Rewards, sich fortpflanzende Tool-Call-Fehler, Teacher-Student-Divergenz, ineffiziente lange Rollouts und verlorene Gradienten in Reward-Gruppen mit Nullvarianz adressieren. Die Papers berichten Experimente über Long-Horizon-Reasoning, Mathematik, Naturwissenschaften, Code und interaktive Agentenaufgaben hinweg, doch die vorliegenden Abstracts belegen keinen einzelnen Benchmark-Spitzenreiter über alle Methoden hinweg.

Heute ausprobieren

Wer tool-nutzende Agenten trainiert, sollte prüfen, ob Teacher-Supervision nach Schritt- oder Turn-Qualität gewichtet wird, bevor OPD mit RL kombiniert wird.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung