AAI News Hub
研究Wed, August 5, 2026·Aug 52 sources corroborating

研究者ら、AIモデル間のオンポリシー蒸留を拡張

新たな論文群が、OPDトレーニングにおけるマルチモーダル、エージェント型、画像生成の限界に照準を当てている。

なぜ重要か

一連の研究は、OPDが言語モデルの模倣を超えた、より広範なトレーニングパターンになりつつあることを示している。一方で研究者らは、モダリティ、アーキテクチャ、軌跡が乖離する場合、単純な教師監督が学生モデルを誤った方向に導き得ることも見いだしている。コンパクトなマルチモーダルモデル、画像生成器、小規模エージェントでは、より優れたフィルタリング、ルーティング、ハイブリッドなRLスケジュールが重要になる可能性がある。

要点

  • 1.OPDの変種は、マルチモーダル、エージェント型、フローマッチングモデルのトレーニングを対象としている。
  • 2.新手法は、誤解を招く教師シグナルをフィルタリングするか、モダリティごとにルーティングする。
  • 3.複数の論文が、互換性のないアーキテクチャを持つ異種教師に焦点を当てている。

複数の新規および更新版の研究論文が、学生モデルが生成した軌跡に対して教師シグナルを用いるポストトレーニング手法、オンポリシー蒸留の変種を提案している。これらの論文は、相反するマルチモーダル教師、トークン単位の疑似的な教師あり学習、画像生成モデルファミリーの不一致、複数教師によるフローモデル、小規模エージェントにおけるツール呼び出しの連鎖、長期的なマルチターンのエージェントトレーニングといった異なる失敗モードに取り組む。提案手法には、OPOD、SA-OPD、Any-OPD、Poly-OPD、SOD、ATODが含まれる。

今日から使える

OPDを使う前に、教師シグナルが学生モデル自身の生成した軌跡上で根拠を保ち、信頼できるかを検証すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究