AAI News Hub
研究Fri, August 7, 2026·Aug 72 家媒体交叉佐证

arXiv 论文测试面向智能体 RL 的自蒸馏方法

三项研究探讨特权自蒸馏是否能改进长周期智能体训练。

为什么重要

这些论文凸显了智能体训练中的一条活跃分歧:密集的自蒸馏信号可能有助于信用分配,但当特权信息影响教师目标时,也可能引入偏差。这对试图在不增加 critic、额外 rollout 或不可靠监督的情况下改进多轮工具使用的团队很重要。

核心要点

  • 1.AgentOPSD 旨在不使用 critic 或额外 rollout 的情况下解决回合级信用分配。
  • 2.OCSD 试图将观测信号与回放框架带来的分数变化区分开来。
  • 3.一项偏差研究报告称,在更难任务上,损失下降但验证准确率变差。

三篇 arXiv 论文考察了智能体任务中强化学习的自蒸馏方法。AgentOPSD 提出一种无需 critic 的递归方法,用于回合级信用分配,并在 ALFWorld、WebShop 和 Search-QA 上使用 Qwen2.5 3B 与 7B 模型进行评估。OCSD 提出对比完整回放视图与去除观测后的回放视图,以隔离未来观测的影响;第三篇论文则认为,特权信息自蒸馏可以降低损失,但在更难任务上并不会提升验证准确率,且往往会使其下降。

今天就能用

在将特权自蒸馏作为独立目标之前,应先在困难的留出任务上验证,并与基于奖励的训练进行比较。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究