AAI News Hub
研究Wed, August 19, 2026·1d ago2 sources corroborating

研究者ら、エージェント・ハーネス向けRLフレームワークを提案

LEGO-RLとClawGym IIは、長期タスクに取り組むAIエージェントの強化学習を安定させることを狙う。

なぜ重要か

この研究は、AIエージェントの学習における中核的な課題に取り組むものだ。ハーネスは長期タスクの性能を高める一方で、クラッシュ、不透明な実行、学習時と推論時の不一致によってRL信号が損なわれる可能性がある。より信頼性の高いハーネスネイティブなRLは、エージェント最適化を実際のデプロイ時の挙動により近づけられる可能性がある。

要点

  • 1.LEGO-RLはコーディングエージェントのハーネス学習を対象とする。
  • 2.ClawGym IIは汎用エージェント向けのブラックボックスRLを提案している。
  • 3.両者ともプロキシとサンドボックスを使い、ロールアウトの安定化を図る。

新たに公開された2本のarXiv論文は、複雑で長時間稼働するハーネス内で動くエージェントに強化学習を適用するためのフレームワークを説明している。LEGO-RLはコーディングエージェントに焦点を当て、インプロセスのLLMプロキシ、サンドボックスのオーケストレーション、検証・監視ツール、ライブUIを用いて、ポリシー勾配による学習をネイティブなハーネス実行と整合させる。ClawGym IIは汎用エージェント向けのブラックボックスRLフレームワークを提示し、サンドボックス化された並行ロールアウト、モデル境界でのサービングプロキシ、prefix-treeによる軌跡再構成、PPOとGRPOの適応版を活用する。

今日から使える

コーディングエージェントや汎用エージェントのハーネスを前提にRLパイプラインを構築する前に、両論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究