AAI News Hub
ForschungFri, August 7, 2026·5d ago2 sources corroborating

EnvACE und State2State zielen auf skalierbares Training von LLM-Agenten

Zwei arXiv-Paper schlagen Wege vor, die Abhängigkeit von manuell erstellten Aufgaben, Prüfern und ausführbaren Umgebungen zu verringern.

Warum es wichtig ist

Die Paper adressieren einen zentralen Engpass in der Agentenentwicklung: das Skalieren von Long-Horizon-Training für Tool-Nutzung ohne teure ausführbare Umgebungen, handgefertigte Prüfer oder Experten-Demonstrationen. Falls sich die Ergebnisse über die berichteten Benchmarks hinaus bestätigen, könnten diese Ansätze Agententraining übertragbarer machen und die Abhängigkeit von maßgeschneiderter Umgebungstechnik verringern.

Die Kernpunkte

  • 1.EnvACE trainiert Agenten durch selbst erzeugte World Rehearsal.
  • 2.State2State leitet Agentenziele aus erkundeten Umgebungszuständen ab.
  • 3.Beide Methoden sollen den manuellen Supervisionsaufwand im Agententraining verringern.

Zwei neue arXiv-Paper stellen Trainingsmethoden für LLM-Agenten vor, die weniger auf extern vorgegebene Supervision angewiesen sind. EnvACE ersetzt die Interaktion mit externen Umgebungen während des Trainings durch „World Rehearsal“: Die Policy erzeugt Tool-Aufrufe, simuliert die Reaktion der Umgebung und optimiert beide Rollen anhand von Belohnungen für erfolgreich gelöste Aufgaben. State2State wandelt erkundete Umgebungszustände in Zielzustandsaufgaben um, nutzt regelbasiertes State Matching statt Expertentrajektorien oder manueller Aufgabengestaltung und berichtet Zugewinne auf ALFWorld und ScienceWorld.

Heute ausprobieren

Lesen Sie die Paper zu EnvACE und State2State, bevor Sie neue Trainingspipelines für LLM-Agenten entwerfen, die auf handgefertigte Umgebungen oder Expertentrajektorien angewiesen sind.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung