AAI News Hub
研究Fri, August 7, 2026·Aug 72 sources corroborating

研究者ら、オンポリシー蒸留の新手法を提案

複数のarXiv論文が、小規模な学生モデルに対して教師のガイダンスをいつ、どのように反映すべきかを検討している。

なぜ重要か

これらの研究は、蒸留に共通する限界を示している。学生モデルが教師の信号を表現できない場合や、その信号が後続の軌跡を損なう場合、より強い教師シグナルが必ずしも有用とは限らない。これは、小規模モデルやエージェントの信頼性を高めるうえで、フロンティア規模の教師モデルを盲目的に模倣するだけでは不十分であることを意味する。

要点

  • 1.学生モデルが修正を表現できない場合、教師のガイダンスは機能しない可能性がある。
  • 2.将来の軌跡を確認する手法は、エージェントのベンチマークで標準的なOPDを上回った。
  • 3.recoverabilityラベルは、分岐した状態を保持するか巻き戻すかの判断を導ける。

一連のarXiv論文は、学生モデルが自ら生成した軌跡に基づいて監督する学習手法であるオンポリシー蒸留の改良案を提案している。手法には、視覚言語モデル向けのFisher-Projected OPD、マルチターンのエージェントタスク向けFutureBridge-OPD、スパースなプロービングと結果に合わせて較正されたターゲットを用いるSPOT、さらに分岐した推論状態を保持すべきか、巻き戻すべきか、通常通り監督すべきかを判断するrecoverability-aware controlが含まれる。評価は視覚言語推論、ALFWorld、WebShop、ScienceWorld、AIME、GPQA-Diamondに及び、複数の論文が標準的なOPDベースラインを上回る改善を報告している。

今日から使える

OPDを適用する前に、教師の介入が局所的なトークン一致だけでなく、その後の学生モデルの継続にも改善をもたらすかを検証すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究