AAI News Hub
研究Fri, August 7, 2026·Aug 72 家媒体交叉佐证

新论文测试面向智能体强化学习的自蒸馏方法

AgentOPSD 和 OCSD 提出修正方案,另一项研究则发现,带有特权信息的教师模型在更难任务上可能失效。

为什么重要

这些论文表明,信用分配和带偏差的特权监督仍是智能体强化学习中尚未解决的核心问题。它们也提示,较低的蒸馏损失并不足以证明智能体学到了更好的行为。

核心要点

  • 1.AgentOPSD 旨在无需 critic 或额外 rollout 的情况下解决回合级信用分配问题。
  • 2.OCSD 试图从特权观察信号中剔除回放脚手架带来的混杂影响。
  • 3.一项偏差研究发现,自蒸馏可能会降低更难任务上的验证准确率。

三篇 arXiv 论文考察了在稀疏强化学习奖励下训练语言模型智能体的自蒸馏方法。AgentOPSD 提出一种无需 critic 的递归方法,用于回合级信用分配,并报告了基于 Qwen2.5 3B 和 7B 模型在 ALFWorld、WebShop 和 Search-QA 上的评测结果。OCSD 提出对比完整回放视角与去除观察信息的回放视角,以隔离来自未来观察的监督信号;另一篇论文则认为,以特权信息为条件的教师模型可以降低逐 token 损失,但未必提升验证准确率,在更难任务上还常常会使其下降。

今天就能用

在采用 OPSD 风格的自蒸馏之前,应在困难的留出智能体任务上验证,并跟踪任务准确率,而不只是 token 损失。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究