EnvACEとState2State、スケーラブルなLLMエージェント訓練を狙う
2本のarXiv論文が、手作業で作るタスク、検証器、実行可能環境への依存を減らす手法を提案した。
なぜ重要か
これらの論文は、エージェント開発における中心的なボトルネックに取り組んでいる。高コストな実行可能環境、手作りの検証器、専門家デモに頼らず、長期的なツール利用訓練をいかにスケールさせるかという課題だ。報告されたベンチマークを超えて有効性が確認されれば、こうした手法はエージェント訓練の転用性を高め、個別環境向けの作り込みへの依存を減らす可能性がある。
要点
- 1.EnvACEは、自己生成したworld rehearsalを通じてエージェントを訓練する。
- 2.State2Stateは、探索済みの環境状態からエージェントの目的を導出する。
- 3.両手法はいずれも、エージェント訓練における手作業の教師信号を減らすことを目指している。
新たに公開された2本のarXiv論文は、外部から定義された教師信号への依存を抑えるLLMエージェントの訓練手法を提案している。EnvACEは、訓練中の外部環境との相互作用を「world rehearsal」に置き換える。ポリシーがツール呼び出しを生成し、環境の応答をシミュレートし、タスク成功報酬によって両方の役割を最適化する。State2Stateは、探索済みの環境状態を目標状態の目的へ変換し、専門家の軌跡や手作業のタスク設計ではなく、ルールベースの状態照合を用いる。ALFWorldとScienceWorldで性能向上を報告している。
⚡ 今日から使える
手作りの環境や専門家の軌跡に依存する新しいLLMエージェント訓練パイプラインを設計する前に、EnvACEとState2Stateの論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。