AAI News Hub
ForschungWed, August 19, 2026·1d ago2 sources corroborating

Forscher schlagen RL-Frameworks für Agenten-Harnesses vor

LEGO-RL und ClawGym II zielen auf stabiles Reinforcement Learning für KI-Agenten mit langen Aufgabenhorizonten.

Warum es wichtig ist

Die Arbeit greift ein zentrales Trainingsproblem für KI-Agenten auf: Harnesses verbessern die Leistung bei Aufgaben mit langem Horizont, doch Abstürze, undurchsichtige Ausführung und Diskrepanzen zwischen Training und Inferenz können RL-Signale verfälschen. Zuverlässigeres, harness-natives RL könnte die Optimierung von Agenten besser an das tatsächliche Verhalten im Einsatz angleichen.

Die Kernpunkte

  • 1.LEGO-RL zielt auf Harness-Training für Coding-Agenten.
  • 2.ClawGym II schlägt Black-Box-RL für allgemeine Agenten vor.
  • 3.Beide nutzen Proxys und Sandboxes, um Rollouts zu stabilisieren.

Zwei neue arXiv-Paper beschreiben Frameworks, mit denen Reinforcement Learning auf Agenten angewendet werden soll, die in komplexen, lange laufenden Harnesses arbeiten. LEGO-RL konzentriert sich auf Coding-Agenten und nutzt In-Process-LLM-Proxying, Sandbox-Orchestrierung, Validierungs- und Monitoring-Tools sowie eine Live-UI, um Policy-Gradient-Training mit nativer Harness-Ausführung in Einklang zu bringen. ClawGym II stellt ein Black-Box-RL-Framework für allgemeine Agenten vor und setzt auf sandboxed concurrent rollouts, Model-Boundary-Serving-Proxys, Prefix-Tree-Trajektorienrekonstruktion sowie Anpassungen von PPO und GRPO.

Heute ausprobieren

Lesen Sie beide Paper, bevor Sie RL-Pipelines rund um Coding-Agent- oder allgemeine Agenten-Harnesses aufbauen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung