AAI News Hub
研究Wed, August 5, 2026·Aug 52 sources corroborating

研究者ら、オンポリシー蒸留を標準的な教師モデルの枠外へ拡張

新たなarXiv論文群が、生成モデル、エージェント、VLM、LLMにまたがるOPDの限界に挑む。

なぜ重要か

これらの研究は、教師モデルと学生モデルがアーキテクチャ、モダリティ、能力、軌道ダイナミクスの面で異なる場合でも、挙動を移転するためのより幅広いツールキットへとOPDが発展しつつあることを示している。これは、大型で近い構成の教師モデルを必要とせずに、小型モデルや特化型モデルを展開するうえで重要になり得る。

要点

  • 1.Any-OPDは、視覚表現を介して不一致のあるフローマッチング生成モデルを橋渡しする。
  • 2.FutureBridge-OPDは、教師のガイダンスを後続のエージェント軌道に照らして検証する。
  • 3.弱から強への蒸留やFisher射影型の変種は、能力差のあるモデル間の不一致を対象にしている。

複数の新しいarXiv論文が、学生モデルが自ら生成した状態やサンプルで訓練されるオンポリシー蒸留(OPD)の中核的な前提を緩和する手法を提案している。Any-OPDは、異なるモデルファミリーの潜在フローマッチング生成モデルを対象に、独立にデコードした出力を凍結済みの視覚表現上で比較する。FutureBridge-OPDは、教師からのガイダンスが後続のエージェント軌道に与える影響を検証することで、その有効性を確かめる。ほかの論文では、より弱いモデルのペアから強い学生モデルを蒸留する方法や、視覚言語教師モデルの修正を小型の学生モデルが局所的に表現できる範囲へ射影する方法が提案されている。

今日から使える

OPDを採用する前に、教師モデルと学生モデルが潜在空間、スケジュール、能力、軌道上の挙動を共有しているかを確認し、不一致に合わせて設計された手法を選ぶべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究