研究者ら、自己対戦によるエージェント訓練手法SPADEを発表
このフレームワークでは、一方のLLMが実行可能な環境を生成し、もう一方の役割がその中で学習する。
なぜ重要か
SPADEは、エージェント訓練における中核的なボトルネックに取り組む。つまり、モデルが改善しても適応を止めてしまう静的な環境プールの問題だ。報告された実験を超えて有効性が確認されれば、適応型の実行可能環境は、推論や複数ステップのツール利用タスクに向けたエージェント訓練をよりスケーラブルにする可能性がある。
要点
- 1.SPADEは1つのLLMをDesignerとAgentの役割で使う。
- 2.生成される環境には、状態遷移、報酬、検証コードが含まれる。
- 3.Designerは、エージェントの限界に近い実行可能なタスクを狙う。
Hugging Faceに掲載された論文は、言語エージェント向けの自己対戦型強化学習フレームワークSPADEを紹介している。SPADEでは、単一のLLMが、OpenAI Gym風のインターフェースを備えた実行可能な長期的訓練環境を作成するEnvironment Designerと、その中で行動を学ぶReasoning Agentの両方を担う。Designerは、特権的なヒントがある場合とない場合の報酬差に基づく推定リグレット信号を用い、エージェントの能力限界に近い実行可能な環境を狙って生成する。
⚡ 今日から使える
エージェントRL向けの合成環境パイプラインを構築する前に、この論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
TechCrunch AI·19h ago
研究
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
arXiv cs.AI+1 outlet·1d ago
研究
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。
arXiv cs.AI+1 outlet·1d ago