AAI News Hub
研究Thu, August 6, 2026·Aug 62 sources corroborating

研究者ら、エージェント向けオンポリシー蒸留を改良

3本のarXiv論文が、教師によるガイダンスが学生モデルの軌跡を改善する条件を検証する手法を提案した。

なぜ重要か

これらの研究は、エージェント的な振る舞いや推論能力を蒸留する際、局所的なモデル間の不一致だけを介入の十分な根拠とは見なさない、より選択的なアプローチを示している。これは、教師モデルのあらゆる選好をコピーせずに、下流タスクの性能を維持する小型モデルを構築するうえで重要になり得る。

要点

  • 1.FutureBridge-OPDは、ALFWorld、WebShop、ScienceWorldでの改善を報告している。
  • 2.SPOTは、エントロピー、top-k質量、教師・学生間のミスマッチを用いて、限られたプローブを配分する。
  • 3.回復可能性ラベルは、修正可能なエラーとロールバックが必要な状態を区別する。

3本のarXiv論文は、学生モデルが生成した軌跡を教師モデルが監督するオンポリシー蒸留の限界に取り組んでいる。FutureBridge-OPDは、モデル間の不一致が大きい状態で短い教師介入を試し、Qwen3-32BからQwen3-1.7Bへの設定でALFWorld、WebShop、ScienceWorldにおける改善を報告した。SPOTは、スパースなプロービングと検証器で採点した継続生成を用いて、どこで何を蒸留すべきかを判断する。一方、反事実的な回復可能性を測る手法は、エラー状態を再実行し、その軌跡を保持するか、ロールバックするか、従来型の監督を行うかを決定する。

今日から使える

エージェント向けオンポリシー蒸留を採用する前に、教師介入をトークン単位の乖離だけでなく、下流の継続成功率で評価すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究