新论文聚焦 agentic RL 中的稀疏奖励问题
ADRS、SERL-SQL、GRSD 和 PCSD 提出更密集的信用分配方法,用于多轮 LLM agent。
为什么重要
这些论文反映出一个更广泛的研究趋势:通过在训练过程中加入局部化监督,降低 agent 训练对稀疏结果奖励的依赖。更好的信用分配可能提升工具使用、SQL 生成以及其他交互式 agent 任务的可靠性,而且这些方法所描述的机制不需要在推理时额外引入技能。
核心要点
- 1.自蒸馏正被用于定位 agent 的信用分配。
- 2.SERL-SQL 将执行后的回溯信号应用于 SQL 和工具动作 token。
- 3.这些方法把密集指导保留在训练阶段,而不是推理阶段。
多篇新的 arXiv 论文提出了自蒸馏方法,旨在改进多轮 LLM agent 的强化学习。在这类场景中,终局奖励或轨迹级奖励往往难以说明哪些中间决策导致了成功或失败。这些方法包括:ADRS,用于与回报相关的 token 级信用分配;SERL-SQL,面向基于执行结果的 Text-to-SQL agent;GRSD,从经过验证的 rollout 组中提取指导信号;以及 PCSD,基于持续偏向 teacher 的信号进行 token 级加权。SERL-SQL 报告称,其在 BIRD-Dev 上达到 76.56% 的执行准确率,在 Spider-Test 上达到 89.92%。
⚡ 今天就能用
在为目前仅依赖终局奖励的多轮 agent 设计 RL 流水线之前,值得先评估这些方法。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- HF Daily PapersPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 3, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。