ClawGym II zielt auf Black-Box-RL für Agent-Harnesses
Das Paper schlägt sandboxed Rollouts und Trajektorien-Rekonstruktion vor, um Agenten durch komplexe Harnesses hindurch zu trainieren.
Warum es wichtig ist
Agent-Harnesses werden für Aufgaben mit langem Horizont immer wichtiger, doch das Training von Modellen durch opake, mehrstufige Harnesses bleibt schwierig. Diese Arbeit bietet Infrastruktur und Optimierungsmethoden, die Reinforcement Learning für Agentensysteme skalierbarer und konsistenter machen sollen.
Die Kernpunkte
- 1.Sandboxed Execution isoliert Harness-Rollouts im großen Maßstab.
- 2.Ein Serving-Proxy erfasst Modellaufrufe, ohne interne Harness-Details offenzulegen.
- 3.Präfixbäume rekonstruieren mehrstufige Trajektorien für PPO und GRPO.
Das ClawGym-II-Paper stellt ein einheitliches Black-Box-Framework für Reinforcement Learning vor, mit dem allgemeine Agenten über komplexe Agent-Harnesses hinweg optimiert werden können. Der Ansatz nutzt sandboxbasierte Ausführung für groß angelegte parallele Rollouts, einen Serving-Proxy an der Modellgrenze zur Erfassung von Modellaufrufen sowie Präfixbäume, um mehrstufige Trajektorien zu rekonstruieren. Die Autoren passen sowohl PPO als auch GRPO an, um über die wiederhergestellte Baumstruktur zu optimieren, und führen Mix-Harness-Training für heterogene Harnesses ein.
⚡ Heute ausprobieren
Lesen Sie das Paper, bevor Sie RL-Trainingsschleifen für Agenten entwerfen, die durch opake oder heterogene Harnesses laufen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor
Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.