AAI News Hub
研究Wed, August 5, 2026·6d ago2 家媒体交叉佐证

研究人员将 on-policy distillation 扩展到更多 AI 模型

新论文瞄准 OPD 训练在多模态、智能体和图像生成方面的局限。

为什么重要

这些工作表明,OPD 正在从语言模型模仿扩展为一种更广泛的训练范式;但研究人员也发现,当模态、架构或轨迹出现差异时,朴素的教师监督可能误导学生模型。更好的过滤、路由和混合 RL 调度,可能会对紧凑型多模态模型、图像生成器和小型智能体产生重要影响。

核心要点

  • 1.OPD 变体瞄准多模态、智能体和 flow-matching 模型训练。
  • 2.新方法会过滤误导性的教师信号,或按模态对其进行路由。
  • 3.多篇论文聚焦于架构不兼容的异构教师模型。

多篇最新及更新后的研究论文提出了 on-policy distillation 的不同变体。OPD 是一种后训练方法,利用教师模型信号来指导学生模型自己生成的轨迹。这些论文分别处理了多种失效模式:多模态教师之间的冲突、虚假的 token 级监督、图像生成模型家族不匹配、多教师 flow 模型、小型智能体中的工具调用级联,以及长时程多轮智能体训练。提出的方法包括 OPOD、SA-OPD、Any-OPD、Poly-OPD、SOD 和 ATOD。

今天就能用

在使用 OPD 之前,应先审查教师信号在学生模型自身生成的轨迹上是否仍然扎实且可靠。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究