EnvACE und State2State zielen auf skalierbares Training von LLM-Agenten
Zwei arXiv-Paper schlagen Wege vor, die Abhängigkeit von manuell erstellten Aufgaben, Prüfern und ausführbaren Umgebungen zu verringern.
Warum es wichtig ist
Die Paper adressieren einen zentralen Engpass in der Agentenentwicklung: das Skalieren von Long-Horizon-Training für Tool-Nutzung ohne teure ausführbare Umgebungen, handgefertigte Prüfer oder Experten-Demonstrationen. Falls sich die Ergebnisse über die berichteten Benchmarks hinaus bestätigen, könnten diese Ansätze Agententraining übertragbarer machen und die Abhängigkeit von maßgeschneiderter Umgebungstechnik verringern.
Die Kernpunkte
- 1.EnvACE trainiert Agenten durch selbst erzeugte World Rehearsal.
- 2.State2State leitet Agentenziele aus erkundeten Umgebungszuständen ab.
- 3.Beide Methoden sollen den manuellen Supervisionsaufwand im Agententraining verringern.
Zwei neue arXiv-Paper stellen Trainingsmethoden für LLM-Agenten vor, die weniger auf extern vorgegebene Supervision angewiesen sind. EnvACE ersetzt die Interaktion mit externen Umgebungen während des Trainings durch „World Rehearsal“: Die Policy erzeugt Tool-Aufrufe, simuliert die Reaktion der Umgebung und optimiert beide Rollen anhand von Belohnungen für erfolgreich gelöste Aufgaben. State2State wandelt erkundete Umgebungszustände in Zielzustandsaufgaben um, nutzt regelbasiertes State Matching statt Expertentrajektorien oder manueller Aufgabengestaltung und berichtet Zugewinne auf ALFWorld und ScienceWorld.
⚡ Heute ausprobieren
Lesen Sie die Paper zu EnvACE und State2State, bevor Sie neue Trainingspipelines für LLM-Agenten entwerfen, die auf handgefertigte Umgebungen oder Expertentrajektorien angewiesen sind.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google DeepMind stellt Modell für Gebärdensprache-zu-Text vor
DeepMinds SL2T treibt neue Gebärdensprachfunktionen für gehörlose und schwerhörige Nutzer an.
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.