AAI News Hub
研究Mon, August 17, 2026·1d ago2 sources corroborating

ClawGym II、エージェントハーネス向けブラックボックスRLに照準

この論文は、複雑なハーネスを介してエージェントを訓練するための、サンドボックス化されたロールアウトと軌跡復元を提案している。

なぜ重要か

エージェントハーネスは長期的なタスクで重要性を増しているが、不透明で複数ステップからなるハーネスを介してモデルを訓練することは依然として難しい。この研究は、エージェントシステム向けの強化学習をよりスケーラブルで一貫したものにすることを狙ったインフラと最適化手法を提供している。

要点

  • 1.サンドボックス化された実行により、ハーネスのロールアウトを大規模に分離できる。
  • 2.サービングプロキシが、ハーネス内部を公開せずにモデル呼び出しを捕捉する。
  • 3.prefix treeが、PPOとGRPO向けに複数ターンの軌跡を再構成する。

ClawGym IIの論文は、複雑なエージェントハーネスを介して汎用エージェントを最適化するための、統一的なブラックボックス強化学習フレームワークを提示している。この手法は、大規模な並行ロールアウトのためのサンドボックスベースの実行、モデル呼び出しを捕捉するモデル境界上のサービングプロキシ、そして複数ターンの軌跡を再構成するprefix treeを用いる。著者らは、復元された木構造上で最適化できるようPPOとGRPOの双方を適応させ、異種ハーネス向けのmix-harness trainingも導入している。

今日から使える

不透明または異種混在のハーネスを通るエージェント向けにRL訓練ループを設計する前に、この論文を読むべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究