AAI News Hub
ForschungMon, August 17, 2026·1d ago2 sources corroborating

ClawGym II zielt auf Black-Box-RL für Agent-Harnesses

Das Paper schlägt sandboxed Rollouts und Trajektorien-Rekonstruktion vor, um Agenten durch komplexe Harnesses hindurch zu trainieren.

Warum es wichtig ist

Agent-Harnesses werden für Aufgaben mit langem Horizont immer wichtiger, doch das Training von Modellen durch opake, mehrstufige Harnesses bleibt schwierig. Diese Arbeit bietet Infrastruktur und Optimierungsmethoden, die Reinforcement Learning für Agentensysteme skalierbarer und konsistenter machen sollen.

Die Kernpunkte

  • 1.Sandboxed Execution isoliert Harness-Rollouts im großen Maßstab.
  • 2.Ein Serving-Proxy erfasst Modellaufrufe, ohne interne Harness-Details offenzulegen.
  • 3.Präfixbäume rekonstruieren mehrstufige Trajektorien für PPO und GRPO.

Das ClawGym-II-Paper stellt ein einheitliches Black-Box-Framework für Reinforcement Learning vor, mit dem allgemeine Agenten über komplexe Agent-Harnesses hinweg optimiert werden können. Der Ansatz nutzt sandboxbasierte Ausführung für groß angelegte parallele Rollouts, einen Serving-Proxy an der Modellgrenze zur Erfassung von Modellaufrufen sowie Präfixbäume, um mehrstufige Trajektorien zu rekonstruieren. Die Autoren passen sowohl PPO als auch GRPO an, um über die wiederhergestellte Baumstruktur zu optimieren, und führen Mix-Harness-Training für heterogene Harnesses ein.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie RL-Trainingsschleifen für Agenten entwerfen, die durch opake oder heterogene Harnesses laufen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung