AAI News Hub
研究Fri, August 7, 2026·Aug 72 家媒体交叉佐证

研究人员聚焦搜索智能体中的信用分配问题

新论文提出面向检索与长程搜索智能体的步骤级奖励方法。

为什么重要

这项工作瞄准了推理与搜索智能体训练中的一个核心问题:仅凭最终结果,往往难以看清哪些中间动作真正起了作用。更好的步骤级监督,可能提升智能体在多步检索和证据收集流程中的可靠性。

核心要点

  • 1.RICE-PO 将奖励局部化到检索交互周围。
  • 2.ABSeeker 从答案回溯,为搜索步骤打分。
  • 3.两种方法都面向多步智能体的密集监督。

两篇 arXiv 论文提出了新的方法,用于在需要多步检索、搜索、验证并整合证据的 AI 智能体中,更精确地分配信用。RICE-PO 将检索交互转化为局部化学习信号:它以高不确定性的可执行动作为锚点,并在特定影响与稳定性条件下,将信用传播到潜在推理步骤。ABSeeker 提出 Answer-Backtracked Credit Assignment,从真实答案回溯到中间线索,并对单个搜索步骤打分,以奖励有用操作,同时抑制错误或冗余操作。

今天就能用

在只用轨迹级 SFT 或 RL 奖励训练搜索智能体之前,先读一读这些论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究