研究者ら、オンポリシー蒸留を標準的な教師モデルの枠外へ拡張
新たなarXiv論文群が、生成モデル、エージェント、VLM、LLMにまたがるOPDの限界に挑む。
なぜ重要か
これらの研究は、教師モデルと学生モデルがアーキテクチャ、モダリティ、能力、軌道ダイナミクスの面で異なる場合でも、挙動を移転するためのより幅広いツールキットへとOPDが発展しつつあることを示している。これは、大型で近い構成の教師モデルを必要とせずに、小型モデルや特化型モデルを展開するうえで重要になり得る。
要点
- 1.Any-OPDは、視覚表現を介して不一致のあるフローマッチング生成モデルを橋渡しする。
- 2.FutureBridge-OPDは、教師のガイダンスを後続のエージェント軌道に照らして検証する。
- 3.弱から強への蒸留やFisher射影型の変種は、能力差のあるモデル間の不一致を対象にしている。
複数の新しいarXiv論文が、学生モデルが自ら生成した状態やサンプルで訓練されるオンポリシー蒸留(OPD)の中核的な前提を緩和する手法を提案している。Any-OPDは、異なるモデルファミリーの潜在フローマッチング生成モデルを対象に、独立にデコードした出力を凍結済みの視覚表現上で比較する。FutureBridge-OPDは、教師からのガイダンスが後続のエージェント軌道に与える影響を検証することで、その有効性を確かめる。ほかの論文では、より弱いモデルのペアから強い学生モデルを蒸留する方法や、視覚言語教師モデルの修正を小型の学生モデルが局所的に表現できる範囲へ射影する方法が提案されている。
⚡ 今日から使える
OPDを採用する前に、教師モデルと学生モデルが潜在空間、スケジュール、能力、軌道上の挙動を共有しているかを確認し、不一致に合わせて設計された手法を選ぶべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
Anthropicの研究、AIエージェントが共同タスクで衝突し得ると指摘
研究者らは、マルチエージェントの振る舞いが現行のAI安全性テストの盲点を浮き彫りにする可能性があるとしている。
研究者ら、映像の反射除去に向けた拡散モデルを提案
S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。
論文、エージェント安全性には実行時契約が必要と主張
arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。