研究人员提出面向 agent harness 的强化学习框架
LEGO-RL 和 ClawGym II 旨在为长程 AI agent 提供更稳定的强化学习训练。
为什么重要
这项工作回应了 AI agent 训练中的一个核心问题:harness 能提升长程任务表现,但其崩溃、不透明执行以及训练与推理之间的不匹配,可能污染强化学习信号。更可靠的、原生适配 harness 的强化学习,有望让 agent 优化更贴近真实部署行为。
核心要点
- 1.LEGO-RL 面向编码 agent 的 harness 训练。
- 2.ClawGym II 提出面向通用 agent 的黑盒强化学习。
- 3.两者都使用代理和沙盒来稳定 rollout。
两篇新的 arXiv 论文介绍了在复杂、长时间运行的 harness 中为 agent 应用强化学习的框架。LEGO-RL 聚焦于编码 agent,利用进程内 LLM 代理、沙盒编排、验证与监控工具,以及实时 UI,让策略梯度训练与原生 harness 执行保持一致。ClawGym II 则提出了一个面向通用 agent 的黑盒强化学习框架,采用沙盒化并发 rollout、模型边界服务代理、前缀树轨迹重建,以及对 PPO 和 GRPO 的适配。
⚡ 今天就能用
在围绕编码 agent 或通用 agent harness 构建强化学习流水线之前,建议先阅读这两篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。