研究者ら、エージェントにおけるオンポリシー蒸留の失敗に照準
最近のarXiv論文群が、ツールを使うLLMエージェント向けに、ターン・ステップ・プレフィックスを意識した訓練改善策を提案している。
なぜ重要か
この研究動向は、結果だけを見る強化学習から、より密度が高く状態を意識したエージェント訓練の監督へと移る大きな流れを映している。ツールを使うエージェントは複数ターンにわたって失敗することが多く、粗い軌跡報酬だけでは、どのステップやツール呼び出しが失敗の原因だったのかを見落としかねないためだ。
要点
- 1.新手法は、ターン、ステップ、プレフィックス、サンプル品質に応じて蒸留の重み付けを変える。
- 2.各論文は、長いエージェント軌跡における疎な報酬と信頼性の低い教師シグナルを対象にしている。
- 3.ツール呼び出しのエラーは連鎖し、トークンレベルの教師監督を弱める可能性がある。
最近のarXiv論文群は、ツール統合型およびマルチターンの言語モデルエージェントを、オンポリシー蒸留と強化学習で訓練する新たな手法を提案している。手法にはTurnSight、SOD、ATOD、PG-OPD、RSTGが含まれ、疎な報酬、連鎖的なツール呼び出しエラー、教師・生徒間の乖離、非効率な長いロールアウト、ゼロ分散報酬グループで失われる勾配といった信頼性の問題に取り組む。各論文は、長期的推論、数学、科学、コード、対話型エージェントタスクでの実験を報告しているが、提示された要旨からは、すべての手法を横断して単一のベンチマークリーダーが確立されたとはいえない。
⚡ 今日から使える
ツールを使うエージェントを訓練しているなら、OPDとRLを組み合わせる前に、教師による監督がステップやターンの品質によって制御されているかを点検すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- HF Daily PapersTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 4, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
Anthropicの研究、AIエージェントが共同タスクで衝突し得ると指摘
研究者らは、マルチエージェントの振る舞いが現行のAI安全性テストの盲点を浮き彫りにする可能性があるとしている。
研究者ら、映像の反射除去に向けた拡散モデルを提案
S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。
論文、エージェント安全性には実行時契約が必要と主張
arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。