Forscher schlagen RL-Frameworks für Agenten-Harnesses vor
LEGO-RL und ClawGym II zielen auf stabiles Reinforcement Learning für KI-Agenten mit langen Aufgabenhorizonten.
Warum es wichtig ist
Die Arbeit greift ein zentrales Trainingsproblem für KI-Agenten auf: Harnesses verbessern die Leistung bei Aufgaben mit langem Horizont, doch Abstürze, undurchsichtige Ausführung und Diskrepanzen zwischen Training und Inferenz können RL-Signale verfälschen. Zuverlässigeres, harness-natives RL könnte die Optimierung von Agenten besser an das tatsächliche Verhalten im Einsatz angleichen.
Die Kernpunkte
- 1.LEGO-RL zielt auf Harness-Training für Coding-Agenten.
- 2.ClawGym II schlägt Black-Box-RL für allgemeine Agenten vor.
- 3.Beide nutzen Proxys und Sandboxes, um Rollouts zu stabilisieren.
Zwei neue arXiv-Paper beschreiben Frameworks, mit denen Reinforcement Learning auf Agenten angewendet werden soll, die in komplexen, lange laufenden Harnesses arbeiten. LEGO-RL konzentriert sich auf Coding-Agenten und nutzt In-Process-LLM-Proxying, Sandbox-Orchestrierung, Validierungs- und Monitoring-Tools sowie eine Live-UI, um Policy-Gradient-Training mit nativer Harness-Ausführung in Einklang zu bringen. ClawGym II stellt ein Black-Box-RL-Framework für allgemeine Agenten vor und setzt auf sandboxed concurrent rollouts, Model-Boundary-Serving-Proxys, Prefix-Tree-Trajektorienrekonstruktion sowie Anpassungen von PPO und GRPO.
⚡ Heute ausprobieren
Lesen Sie beide Paper, bevor Sie RL-Pipelines rund um Coding-Agent- oder allgemeine Agenten-Harnesses aufbauen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.