研究人员提出新的 on-policy distillation 方法
多篇 arXiv 论文聚焦教师模型的指导应在何时、以何种方式影响更小的学生模型。
为什么重要
这些研究指向了蒸馏中的一个共同局限:如果学生模型无法表示教师信号,或这些信号会损害后续轨迹,那么更强的教师指导并不总是有用。这对于提升小模型和智能体的可靠性很重要,因为它们不能只是盲目复制前沿规模教师模型。
核心要点
- 1.当学生模型无法表示修正内容时,教师指导可能失效。
- 2.在智能体基准测试中,未来轨迹检查优于普通 OPD。
- 3.可恢复性标签可以指导系统判断是保留还是回滚偏离状态。
一组 arXiv 论文提出了对 on-policy distillation 的改进。这种训练方法会在学生模型自行生成的轨迹上对其进行监督。相关方法包括面向视觉语言模型的 Fisher-Projected OPD、面向多轮智能体任务的 FutureBridge-OPD、用于稀疏探测和结果校准目标的 SPOT,以及一种具备可恢复性感知的控制方法,用于判断偏离的推理状态应被保留、回滚,还是按常规方式监督。论文报告的评测覆盖视觉语言推理、ALFWorld、WebShop、ScienceWorld、AIME 和 GPQA-Diamond,其中多篇声称相较普通 OPD 基线取得了提升。
⚡ 今天就能用
在应用 OPD 之前,应测试教师干预是否能改善学生模型后续的下游生成,而不只是看局部 token 是否一致。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。