Co-RL 用同伴模型生成的奖励训练推理模型
这篇 arXiv 论文提出用协作式多智能体 RL,降低对真实标签监督的依赖。
为什么重要
这项工作瞄准了推理模型后训练中的一个核心瓶颈:对成本高昂或稀缺的可验证奖励的依赖。如果其效果能在论文报告的实验设置之外得到验证,基于同伴的 RL 可能会为训练方法提供启发,使其更少依赖人工标注监督,同时避免纯自生成反馈导致的坍塌。
核心要点
- 1.Co-RL 在解耦模型之间使用同伴模型生成的奖励。
- 2.模型队列多样性被提出为减少相关性错误的一种方式。
- 3.这篇论文聚焦于 RL 后训练中的无监督推理。
研究人员提出了 Co-RL,这是一个通过协作式多智能体强化学习提升语言模型和视觉语言模型推理能力的框架。该方法训练多个彼此解耦、参数不共享的模型,并使用来自同伴模型的奖励,而非真实标注。作者认为,更具多样性的模型队列,包括不同模型家族、不同规模以及改写后的样本,可以减少相关性错误,避免这类错误引发自我强化的反馈循环。
⚡ 今天就能用
在为推理模型采用自奖励 RL 之前,先读一读 Co-RL 论文,尤其是在你的设置缺少可验证奖励时。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。