AAI News Hub
研究Fri, August 7, 2026·Aug 72 家媒体交叉佐证

研究人员提出新的 on-policy distillation 方法

多篇 arXiv 论文聚焦教师模型的指导应在何时、以何种方式影响更小的学生模型。

为什么重要

这些研究指向了蒸馏中的一个共同局限:如果学生模型无法表示教师信号,或这些信号会损害后续轨迹,那么更强的教师指导并不总是有用。这对于提升小模型和智能体的可靠性很重要,因为它们不能只是盲目复制前沿规模教师模型。

核心要点

  • 1.当学生模型无法表示修正内容时,教师指导可能失效。
  • 2.在智能体基准测试中,未来轨迹检查优于普通 OPD。
  • 3.可恢复性标签可以指导系统判断是保留还是回滚偏离状态。

一组 arXiv 论文提出了对 on-policy distillation 的改进。这种训练方法会在学生模型自行生成的轨迹上对其进行监督。相关方法包括面向视觉语言模型的 Fisher-Projected OPD、面向多轮智能体任务的 FutureBridge-OPD、用于稀疏探测和结果校准目标的 SPOT,以及一种具备可恢复性感知的控制方法,用于判断偏离的推理状态应被保留、回滚,还是按常规方式监督。论文报告的评测覆盖视觉语言推理、ALFWorld、WebShop、ScienceWorld、AIME 和 GPQA-Diamond,其中多篇声称相较普通 OPD 基线取得了提升。

今天就能用

在应用 OPD 之前,应测试教师干预是否能改善学生模型后续的下游生成,而不只是看局部 token 是否一致。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究