研究者ら、オンポリシー蒸留の新手法を提案
複数のarXiv論文が、小規模な学生モデルに対して教師のガイダンスをいつ、どのように反映すべきかを検討している。
なぜ重要か
これらの研究は、蒸留に共通する限界を示している。学生モデルが教師の信号を表現できない場合や、その信号が後続の軌跡を損なう場合、より強い教師シグナルが必ずしも有用とは限らない。これは、小規模モデルやエージェントの信頼性を高めるうえで、フロンティア規模の教師モデルを盲目的に模倣するだけでは不十分であることを意味する。
要点
- 1.学生モデルが修正を表現できない場合、教師のガイダンスは機能しない可能性がある。
- 2.将来の軌跡を確認する手法は、エージェントのベンチマークで標準的なOPDを上回った。
- 3.recoverabilityラベルは、分岐した状態を保持するか巻き戻すかの判断を導ける。
一連のarXiv論文は、学生モデルが自ら生成した軌跡に基づいて監督する学習手法であるオンポリシー蒸留の改良案を提案している。手法には、視覚言語モデル向けのFisher-Projected OPD、マルチターンのエージェントタスク向けFutureBridge-OPD、スパースなプロービングと結果に合わせて較正されたターゲットを用いるSPOT、さらに分岐した推論状態を保持すべきか、巻き戻すべきか、通常通り監督すべきかを判断するrecoverability-aware controlが含まれる。評価は視覚言語推論、ALFWorld、WebShop、ScienceWorld、AIME、GPQA-Diamondに及び、複数の論文が標準的なOPDベースラインを上回る改善を報告している。
⚡ 今日から使える
OPDを適用する前に、教師の介入が局所的なトークン一致だけでなく、その後の学生モデルの継続にも改善をもたらすかを検証すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。