AAI News Hub
研究Fri, August 7, 2026·Aug 72 sources corroborating

EnvACEとState2State、スケーラブルなLLMエージェント訓練を狙う

2本のarXiv論文が、手作業で作るタスク、検証器、実行可能環境への依存を減らす手法を提案した。

なぜ重要か

これらの論文は、エージェント開発における中心的なボトルネックに取り組んでいる。高コストな実行可能環境、手作りの検証器、専門家デモに頼らず、長期的なツール利用訓練をいかにスケールさせるかという課題だ。報告されたベンチマークを超えて有効性が確認されれば、こうした手法はエージェント訓練の転用性を高め、個別環境向けの作り込みへの依存を減らす可能性がある。

要点

  • 1.EnvACEは、自己生成したworld rehearsalを通じてエージェントを訓練する。
  • 2.State2Stateは、探索済みの環境状態からエージェントの目的を導出する。
  • 3.両手法はいずれも、エージェント訓練における手作業の教師信号を減らすことを目指している。

新たに公開された2本のarXiv論文は、外部から定義された教師信号への依存を抑えるLLMエージェントの訓練手法を提案している。EnvACEは、訓練中の外部環境との相互作用を「world rehearsal」に置き換える。ポリシーがツール呼び出しを生成し、環境の応答をシミュレートし、タスク成功報酬によって両方の役割を最適化する。State2Stateは、探索済みの環境状態を目標状態の目的へ変換し、専門家の軌跡や手作業のタスク設計ではなく、ルールベースの状態照合を用いる。ALFWorldとScienceWorldで性能向上を報告している。

今日から使える

手作りの環境や専門家の軌跡に依存する新しいLLMエージェント訓練パイプラインを設計する前に、EnvACEとState2Stateの論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究