新論文、LLMの探索限界に焦点
DORA、3PO、RISE-RLが、エージェントとRLトレーニングにおける探索を改善する手法を提案。
なぜ重要か
これらの論文は、temperature scalingのようなトークン単位の探索手法に共通する限界を示している。そうした手法では、シーケンス単位で有用な多様性が生まれない可能性がある。より優れた探索は、プロンプト変更やスカラー報酬だけに頼らず、LLMエージェント、推論トレーニング、オープンエンドなアラインメントワークフローを改善しうる。
要点
- 1.DORAはトレーニングなしでシーケンス単位の探索を改善する。
- 2.3POはポリシーをサンプリングし、RLVRのロールアウトを多様化する。
- 3.RISE-RLは、繰り返し満たされなかったルーブリック基準を対象にする。
複数のarXiv論文が、大規模言語モデルの探索能力を高める新手法を報告している。DORA Explorerは、トレーニング不要の推論時アルゴリズムで、複数の候補アクションを生成し、シーケンス単位の対数確率統計でスコアリングしたうえで、調整可能な探索パラメータに基づいてサンプリングする。3POはRLVR向けに、事後分布から異なるポリシーをサンプリングすることでパラメータ空間を探索する。一方、RISE-RLは、繰り返し満たされなかったルーブリック基準を使い、オープンエンドなRLで選択的な探索を導く。
⚡ 今日から使える
エージェント探索やRLロールアウトでtemperatureだけに頼る前に、DORAと3POの論文を読んでおきたい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。