AAI News Hub
研究Thu, August 13, 2026·5d ago2 sources corroborating

新論文、LLMの探索限界に焦点

DORA、3PO、RISE-RLが、エージェントとRLトレーニングにおける探索を改善する手法を提案。

なぜ重要か

これらの論文は、temperature scalingのようなトークン単位の探索手法に共通する限界を示している。そうした手法では、シーケンス単位で有用な多様性が生まれない可能性がある。より優れた探索は、プロンプト変更やスカラー報酬だけに頼らず、LLMエージェント、推論トレーニング、オープンエンドなアラインメントワークフローを改善しうる。

要点

  • 1.DORAはトレーニングなしでシーケンス単位の探索を改善する。
  • 2.3POはポリシーをサンプリングし、RLVRのロールアウトを多様化する。
  • 3.RISE-RLは、繰り返し満たされなかったルーブリック基準を対象にする。

複数のarXiv論文が、大規模言語モデルの探索能力を高める新手法を報告している。DORA Explorerは、トレーニング不要の推論時アルゴリズムで、複数の候補アクションを生成し、シーケンス単位の対数確率統計でスコアリングしたうえで、調整可能な探索パラメータに基づいてサンプリングする。3POはRLVR向けに、事後分布から異なるポリシーをサンプリングすることでパラメータ空間を探索する。一方、RISE-RLは、繰り返し満たされなかったルーブリック基準を使い、オープンエンドなRLで選択的な探索を導く。

今日から使える

エージェント探索やRLロールアウトでtemperatureだけに頼る前に、DORAと3POの論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究