ClawGym II、エージェントハーネス向けブラックボックスRLに照準
この論文は、複雑なハーネスを介してエージェントを訓練するための、サンドボックス化されたロールアウトと軌跡復元を提案している。
なぜ重要か
エージェントハーネスは長期的なタスクで重要性を増しているが、不透明で複数ステップからなるハーネスを介してモデルを訓練することは依然として難しい。この研究は、エージェントシステム向けの強化学習をよりスケーラブルで一貫したものにすることを狙ったインフラと最適化手法を提供している。
要点
- 1.サンドボックス化された実行により、ハーネスのロールアウトを大規模に分離できる。
- 2.サービングプロキシが、ハーネス内部を公開せずにモデル呼び出しを捕捉する。
- 3.prefix treeが、PPOとGRPO向けに複数ターンの軌跡を再構成する。
ClawGym IIの論文は、複雑なエージェントハーネスを介して汎用エージェントを最適化するための、統一的なブラックボックス強化学習フレームワークを提示している。この手法は、大規模な並行ロールアウトのためのサンドボックスベースの実行、モデル呼び出しを捕捉するモデル境界上のサービングプロキシ、そして複数ターンの軌跡を再構成するprefix treeを用いる。著者らは、復元された木構造上で最適化できるようPPOとGRPOの双方を適応させ、異種ハーネス向けのmix-harness trainingも導入している。
⚡ 今日から使える
不透明または異種混在のハーネスを通るエージェント向けにRL訓練ループを設計する前に、この論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
arXiv cs.AI+1 outlet·11h ago
研究
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
arXiv cs.AI+1 outlet·11h ago
研究
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。
arXiv cs.AI+1 outlet·11h ago