研究人员将 on-policy distillation 扩展到更多 AI 模型
新论文瞄准 OPD 训练在多模态、智能体和图像生成方面的局限。
为什么重要
这些工作表明,OPD 正在从语言模型模仿扩展为一种更广泛的训练范式;但研究人员也发现,当模态、架构或轨迹出现差异时,朴素的教师监督可能误导学生模型。更好的过滤、路由和混合 RL 调度,可能会对紧凑型多模态模型、图像生成器和小型智能体产生重要影响。
核心要点
- 1.OPD 变体瞄准多模态、智能体和 flow-matching 模型训练。
- 2.新方法会过滤误导性的教师信号,或按模态对其进行路由。
- 3.多篇论文聚焦于架构不兼容的异构教师模型。
多篇最新及更新后的研究论文提出了 on-policy distillation 的不同变体。OPD 是一种后训练方法,利用教师模型信号来指导学生模型自己生成的轨迹。这些论文分别处理了多种失效模式:多模态教师之间的冲突、虚假的 token 级监督、图像生成模型家族不匹配、多教师 flow 模型、小型智能体中的工具调用级联,以及长时程多轮智能体训练。提出的方法包括 OPOD、SA-OPD、Any-OPD、Poly-OPD、SOD 和 ATOD。
⚡ 今天就能用
在使用 OPD 之前,应先审查教师信号在学生模型自身生成的轨迹上是否仍然扎实且可靠。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。