研究者ら、エージェント向けオンポリシー蒸留を改良
3本のarXiv論文が、教師によるガイダンスが学生モデルの軌跡を改善する条件を検証する手法を提案した。
なぜ重要か
これらの研究は、エージェント的な振る舞いや推論能力を蒸留する際、局所的なモデル間の不一致だけを介入の十分な根拠とは見なさない、より選択的なアプローチを示している。これは、教師モデルのあらゆる選好をコピーせずに、下流タスクの性能を維持する小型モデルを構築するうえで重要になり得る。
要点
- 1.FutureBridge-OPDは、ALFWorld、WebShop、ScienceWorldでの改善を報告している。
- 2.SPOTは、エントロピー、top-k質量、教師・学生間のミスマッチを用いて、限られたプローブを配分する。
- 3.回復可能性ラベルは、修正可能なエラーとロールバックが必要な状態を区別する。
3本のarXiv論文は、学生モデルが生成した軌跡を教師モデルが監督するオンポリシー蒸留の限界に取り組んでいる。FutureBridge-OPDは、モデル間の不一致が大きい状態で短い教師介入を試し、Qwen3-32BからQwen3-1.7Bへの設定でALFWorld、WebShop、ScienceWorldにおける改善を報告した。SPOTは、スパースなプロービングと検証器で採点した継続生成を用いて、どこで何を蒸留すべきかを判断する。一方、反事実的な回復可能性を測る手法は、エラー状態を再実行し、その軌跡を保持するか、ロールバックするか、従来型の監督を行うかを決定する。
⚡ 今日から使える
エージェント向けオンポリシー蒸留を採用する前に、教師介入をトークン単位の乖離だけでなく、下流の継続成功率で評価すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究者ら、VLMの空間推論の弱点に照準
新たな論文群が、視覚言語システムの空間知能に向けて、記憶、RL、ベンチマークを提案している。
Google、コーディングとエージェント向けにGemini 3.7 Flashを発表
新しいFlashモデルは、Gemini API、Google AI Studio、Android Studio、企業向けツールで利用できる。
新研究、視覚AIの空間知能を検証
SpaRRTa、SMA、PinpointQAは、視覚AIや身体性AIシステムの空間推論を評価・改善する。