#co-rl
2 briefs tagged #co-rl.
Research
Co-RL uses peer rewards for unsupervised reasoning
The paper proposes multi-agent RL to reduce reliance on ground-truth supervision for reasoning models.
arXiv cs.AI+1 outlet·2d ago
Research
Co-RL uses peer rewards for unsupervised reasoning RL
The framework trains decoupled model cohorts with rewards derived from peers, aiming to reduce self-feedback collapse.
arXiv cs.AI+1 outlet·2d ago