AAI News Hub
研究Mon, August 17, 2026·1d ago2 家媒体交叉佐证

ClawGym II 瞄准面向 agent harness 的黑箱强化学习

这篇论文提出通过沙盒化 rollout 和轨迹恢复,在复杂 harness 中训练 agent。

为什么重要

Agent harness 对长周期任务正变得越来越重要,但要通过不透明的多步骤 harness 训练模型仍然很困难。这项工作提供了基础设施和优化方法,旨在让 agent 系统中的强化学习更具可扩展性和一致性。

核心要点

  • 1.沙盒化执行可在大规模 rollout 中隔离 harness。
  • 2.Serving proxy 可在不暴露 harness 内部机制的情况下捕获模型调用。
  • 3.前缀树可为 PPO 和 GRPO 重建多轮轨迹。

ClawGym II 论文提出了一个统一的黑箱强化学习框架,用于通过复杂的 agent harness 优化通用 agent。该方法使用基于沙盒的执行来支持大规模并发 rollout,在模型边界部署 serving proxy 以捕获模型调用,并用前缀树重建多轮轨迹。作者将 PPO 和 GRPO 都改造为可在恢复出的树结构上进行优化,并引入了面向异构 harness 的 mix-harness 训练。

今天就能用

在为通过不透明或异构 harness 运行的 agent 设计强化学习训练循环之前,先读这篇论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究