AAI News Hub
研究Wed, August 19, 2026·1d ago2 家媒体交叉佐证

研究人员提出面向 agent harness 的强化学习框架

LEGO-RL 和 ClawGym II 旨在为长程 AI agent 提供更稳定的强化学习训练。

为什么重要

这项工作回应了 AI agent 训练中的一个核心问题:harness 能提升长程任务表现,但其崩溃、不透明执行以及训练与推理之间的不匹配,可能污染强化学习信号。更可靠的、原生适配 harness 的强化学习,有望让 agent 优化更贴近真实部署行为。

核心要点

  • 1.LEGO-RL 面向编码 agent 的 harness 训练。
  • 2.ClawGym II 提出面向通用 agent 的黑盒强化学习。
  • 3.两者都使用代理和沙盒来稳定 rollout。

两篇新的 arXiv 论文介绍了在复杂、长时间运行的 harness 中为 agent 应用强化学习的框架。LEGO-RL 聚焦于编码 agent,利用进程内 LLM 代理、沙盒编排、验证与监控工具,以及实时 UI,让策略梯度训练与原生 harness 执行保持一致。ClawGym II 则提出了一个面向通用 agent 的黑盒强化学习框架,采用沙盒化并发 rollout、模型边界服务代理、前缀树轨迹重建,以及对 PPO 和 GRPO 的适配。

今天就能用

在围绕编码 agent 或通用 agent harness 构建强化学习流水线之前,建议先阅读这两篇论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究