研究人员聚焦搜索智能体中的信用分配问题
新论文提出面向检索与长程搜索智能体的步骤级奖励方法。
为什么重要
这项工作瞄准了推理与搜索智能体训练中的一个核心问题:仅凭最终结果,往往难以看清哪些中间动作真正起了作用。更好的步骤级监督,可能提升智能体在多步检索和证据收集流程中的可靠性。
核心要点
- 1.RICE-PO 将奖励局部化到检索交互周围。
- 2.ABSeeker 从答案回溯,为搜索步骤打分。
- 3.两种方法都面向多步智能体的密集监督。
两篇 arXiv 论文提出了新的方法,用于在需要多步检索、搜索、验证并整合证据的 AI 智能体中,更精确地分配信用。RICE-PO 将检索交互转化为局部化学习信号:它以高不确定性的可执行动作为锚点,并在特定影响与稳定性条件下,将信用传播到潜在推理步骤。ABSeeker 提出 Answer-Backtracked Credit Assignment,从真实答案回溯到中间线索,并对单个搜索步骤打分,以奖励有用操作,同时抑制错误或冗余操作。
⚡ 今天就能用
在只用轨迹级 SFT 或 RL 奖励训练搜索智能体之前,先读一读这些论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLRICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning AgentsAug 7, 12:00 PM↗
- arXiv cs.AIABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 6, 12:00 PM↗
- HF Daily PapersABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 5, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。