研究者ら、AIモデル間のオンポリシー蒸留を拡張
新たな論文群が、OPDトレーニングにおけるマルチモーダル、エージェント型、画像生成の限界に照準を当てている。
なぜ重要か
一連の研究は、OPDが言語モデルの模倣を超えた、より広範なトレーニングパターンになりつつあることを示している。一方で研究者らは、モダリティ、アーキテクチャ、軌跡が乖離する場合、単純な教師監督が学生モデルを誤った方向に導き得ることも見いだしている。コンパクトなマルチモーダルモデル、画像生成器、小規模エージェントでは、より優れたフィルタリング、ルーティング、ハイブリッドなRLスケジュールが重要になる可能性がある。
要点
- 1.OPDの変種は、マルチモーダル、エージェント型、フローマッチングモデルのトレーニングを対象としている。
- 2.新手法は、誤解を招く教師シグナルをフィルタリングするか、モダリティごとにルーティングする。
- 3.複数の論文が、互換性のないアーキテクチャを持つ異種教師に焦点を当てている。
複数の新規および更新版の研究論文が、学生モデルが生成した軌跡に対して教師シグナルを用いるポストトレーニング手法、オンポリシー蒸留の変種を提案している。これらの論文は、相反するマルチモーダル教師、トークン単位の疑似的な教師あり学習、画像生成モデルファミリーの不一致、複数教師によるフローモデル、小規模エージェントにおけるツール呼び出しの連鎖、長期的なマルチターンのエージェントトレーニングといった異なる失敗モードに取り組む。提案手法には、OPOD、SA-OPD、Any-OPD、Poly-OPD、SOD、ATODが含まれる。
⚡ 今日から使える
OPDを使う前に、教師シグナルが学生モデル自身の生成した軌跡上で根拠を保ち、信頼できるかを検証すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
MiLMMTチーム、参照訳不要の翻訳モデルを公開
MiLMMT-46-v1.0はGRPOとチェックポイント補間により、オープンな多言語翻訳を改善する。
DistilVDR、視覚文書検索を圧縮
5億2400万パラメータの検索器は、80億パラメータの視覚言語教師モデルから双方向蒸留を行う。
研究者ら、Power Law Graph Attentionを提案
PLGAはscaled dot-product attentionを一般化し、厳密な不変性の下で推論が崩壊すると報告している。