Co-RL、ピア由来の報酬で推論モデルを訓練
arXivの論文は、正解データによる教師信号への依存を減らすため、協調型マルチエージェントRLを提案している。
なぜ重要か
この研究は、推論モデルのポストトレーニングにおける中心的なボトルネック、すなわち高コストまたは希少な検証可能報酬への依存に取り組むものだ。論文で報告された設定を超えて有効性が確認されれば、ピアベースのRLは、人間がラベル付けした教師信号への依存を減らしつつ、純粋に自己生成されたフィードバックによる崩壊を避ける訓練手法の設計に示唆を与える可能性がある。
要点
- 1.Co-RLは、分離されたモデル間でピア由来の報酬を用いる。
- 2.コホートの多様性は、相関エラーを減らす方法として提示されている。
- 3.この論文は、RLポストトレーニングにおける教師なし推論に焦点を当てている。
研究者らは、協調型マルチエージェント強化学習を通じて、言語モデルと視覚言語モデルの推論能力を高めるフレームワーク「Co-RL」を発表した。この手法では、パラメータを共有しない複数の分離されたモデルを訓練し、正解アノテーションではなくピアモデルから得た報酬を用いる。著者らは、異なるモデルファミリーや規模、言い換えられたサンプルを含む、より多様なコホートを使うことで、自己強化的なフィードバックループを引き起こし得る相関エラーを減らせると主張している。
⚡ 今日から使える
推論モデルに自己報酬型RLを採用する前に、特に検証可能な報酬がない環境では、Co-RLの論文を読んでおくべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
TechCrunch AI·19h ago
研究
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
arXiv cs.AI+1 outlet·1d ago
研究
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。
arXiv cs.AI+1 outlet·1d ago