研究人员改进面向智能体的 on-policy 蒸馏
三篇 arXiv 论文提出了检验教师指导何时能改善学生轨迹的方法。
为什么重要
这些工作指向了一种更有选择性的智能体与推理行为蒸馏方法:局部模型分歧本身不再被视为足以触发干预的证据。这对于构建更小模型可能很重要,因为它们需要在不复制教师模型每一种偏好的情况下,保留下游任务表现。
核心要点
- 1.FutureBridge-OPD 报告称在 ALFWorld、WebShop 和 ScienceWorld 上取得提升。
- 2.SPOT 利用熵、top-k 质量和教师-学生不匹配来分配有限的探测预算。
- 3.可恢复性标签用于区分可纠正错误与需要回滚的状态。
三篇 arXiv 论文聚焦 on-policy 蒸馏的局限:在这种方法中,教师模型会监督由学生模型生成的轨迹。FutureBridge-OPD 测试了在高分歧状态下进行短时教师干预,并报告称,在 Qwen3-32B 到 Qwen3-1.7B 的设置中,该方法在 ALFWorld、WebShop 和 ScienceWorld 上带来提升。SPOT 使用稀疏探测和由验证器打分的续写来决定在何处、蒸馏什么;而一种反事实可恢复性方法则会重放错误状态,以判断应保留轨迹、回滚轨迹,还是采用常规监督。
⚡ 今天就能用
在为智能体采用 on-policy 蒸馏之前,应根据下游续写是否成功来评估教师干预,而不只是看 token 级别的分歧。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。