研究者ら、エージェント・ハーネス向けRLフレームワークを提案
LEGO-RLとClawGym IIは、長期タスクに取り組むAIエージェントの強化学習を安定させることを狙う。
なぜ重要か
この研究は、AIエージェントの学習における中核的な課題に取り組むものだ。ハーネスは長期タスクの性能を高める一方で、クラッシュ、不透明な実行、学習時と推論時の不一致によってRL信号が損なわれる可能性がある。より信頼性の高いハーネスネイティブなRLは、エージェント最適化を実際のデプロイ時の挙動により近づけられる可能性がある。
要点
- 1.LEGO-RLはコーディングエージェントのハーネス学習を対象とする。
- 2.ClawGym IIは汎用エージェント向けのブラックボックスRLを提案している。
- 3.両者ともプロキシとサンドボックスを使い、ロールアウトの安定化を図る。
新たに公開された2本のarXiv論文は、複雑で長時間稼働するハーネス内で動くエージェントに強化学習を適用するためのフレームワークを説明している。LEGO-RLはコーディングエージェントに焦点を当て、インプロセスのLLMプロキシ、サンドボックスのオーケストレーション、検証・監視ツール、ライブUIを用いて、ポリシー勾配による学習をネイティブなハーネス実行と整合させる。ClawGym IIは汎用エージェント向けのブラックボックスRLフレームワークを提示し、サンドボックス化された並行ロールアウト、モデル境界でのサービングプロキシ、prefix-treeによる軌跡再構成、PPOとGRPOの適応版を活用する。
⚡ 今日から使える
コーディングエージェントや汎用エージェントのハーネスを前提にRLパイプラインを構築する前に、両論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。