AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

研究人员改进面向智能体的 on-policy 蒸馏

三篇 arXiv 论文提出了检验教师指导何时能改善学生轨迹的方法。

为什么重要

这些工作指向了一种更有选择性的智能体与推理行为蒸馏方法:局部模型分歧本身不再被视为足以触发干预的证据。这对于构建更小模型可能很重要,因为它们需要在不复制教师模型每一种偏好的情况下,保留下游任务表现。

核心要点

  • 1.FutureBridge-OPD 报告称在 ALFWorld、WebShop 和 ScienceWorld 上取得提升。
  • 2.SPOT 利用熵、top-k 质量和教师-学生不匹配来分配有限的探测预算。
  • 3.可恢复性标签用于区分可纠正错误与需要回滚的状态。

三篇 arXiv 论文聚焦 on-policy 蒸馏的局限:在这种方法中,教师模型会监督由学生模型生成的轨迹。FutureBridge-OPD 测试了在高分歧状态下进行短时教师干预,并报告称,在 Qwen3-32B 到 Qwen3-1.7B 的设置中,该方法在 ALFWorld、WebShop 和 ScienceWorld 上带来提升。SPOT 使用稀疏探测和由验证器打分的续写来决定在何处、蒸馏什么;而一种反事实可恢复性方法则会重放错误状态,以判断应保留轨迹、回滚轨迹,还是采用常规监督。

今天就能用

在为智能体采用 on-policy 蒸馏之前,应根据下游续写是否成功来评估教师干预,而不只是看 token 级别的分歧。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究