AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

研究人员改进面向工具型 agent 的蒸馏方法

多篇 arXiv 论文聚焦长程 agent 训练中的稀疏奖励和不可靠教师信号问题。

为什么重要

这些论文指向一个共同的研究方向:提升小型语言模型或 agentic 语言模型在多轮工具使用中的信用分配能力和训练稳定性。如果这些技术能在已报告基准之外得到验证,可能会让工具型 agent 的后训练更高效、更可靠。

核心要点

  • 1.多篇论文聚焦长程 agent 训练中的 OPD 失效模式。
  • 2.教师指导正越来越多地由偏离程度、不确定性、置信度或 rollout 质量来控制。
  • 3.共同目标是在不放大劣质轨迹的前提下,实现更密集的信用分配。

近期一组 arXiv 论文提出了新的训练方法,用于结合工具调用、多轮交互的语言模型 agent,在强化学习之外引入 on-policy 蒸馏。这些方法针对一系列相关失效模式:奖励稀疏或延迟、错误工具调用后的连锁错误、长 rollout 效率低,以及当学生轨迹发生偏离时教师监督不再可靠。论文提出的方案包括轮次级 hindsight 信号、逐步重加权、退火式 OPD-RL 调度、由前缀引导的 rollout 分配,以及针对低信号 RL 分组的选择性教师指导。

今天就能用

在训练长程工具型 agent 之前,应将会对教师信号进行重加权或过滤的 OPD-RL 混合方法,与普通 GRPO 或朴素 OPD 基线进行比较。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究