AAI News Hub
研究Wed, August 19, 2026·2d ago2 家媒体交叉佐证

研究人员提出 Co-RL,用同伴奖励提升推理能力

该框架让独立模型接受来自同伴的奖励信号训练,以降低自我奖励导致训练崩溃的风险。

为什么重要

这项工作瞄准了推理模型训练中的一个关键瓶颈:对昂贵或稀缺的可验证奖励的依赖。如果在论文报告的设置之外也能得到验证,基于同伴奖励的多智能体 RL 可能为更可扩展的无监督推理能力提升提供一条路径,同时缓解同质化风险。

核心要点

  • 1.Co-RL 使用来自同伴的奖励,而不是依赖真实标签监督。
  • 2.在协作式 RL 训练中,独立模型之间不共享参数。
  • 3.多样化模型群体旨在减少相关性错误和训练崩溃。

一篇新的 arXiv 论文介绍了 Co-RL,这是一种用于在没有真实标签监督的情况下提升推理能力的协作式多智能体强化学习框架。该方法训练多个彼此解耦、参数不共享的模型,并使用来自同伴模型的奖励,而不只是依赖自生成反馈。作者认为,来自不同模型家族、不同规模以及改写训练样本的群体多样性,可以减少相关性错误,避免其推动自我强化的反馈循环和训练崩溃。

今天就能用

在采用自我奖励 RL 之前,先阅读这篇论文,并测试多样化的同伴评估器是否能减少你训练设置中的相关性失败模式。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究