Co-RL treina modelos de raciocínio com recompensas derivadas de pares
O artigo no arXiv propõe RL multiagente cooperativo para reduzir a dependência de supervisão com respostas corretas de referência.
Por que importa
O trabalho mira um gargalo central no pós-treinamento de modelos de raciocínio: a dependência de recompensas verificáveis caras ou escassas. Se for validado além do cenário relatado no artigo, o RL baseado em pares pode orientar métodos de treinamento que dependam menos de supervisão rotulada por humanos, evitando ao mesmo tempo o colapso causado por feedback puramente autogerado.
Pontos-chave
- 1.O Co-RL usa recompensas derivadas de pares entre modelos desacoplados.
- 2.A diversidade da coorte é apresentada como uma forma de reduzir erros correlacionados.
- 3.O artigo se concentra em raciocínio não supervisionado no pós-treinamento com RL.
Pesquisadores apresentaram o Co-RL, um framework para aprimorar o raciocínio em modelos de linguagem e de visão-linguagem por meio de aprendizado por reforço multiagente cooperativo. O método treina vários modelos desacoplados, sem parâmetros compartilhados, usando recompensas derivadas de modelos pares em vez de anotações de referência. Os autores argumentam que coortes mais diversas, incluindo diferentes famílias e tamanhos de modelos, além de amostras reformuladas, reduzem erros correlacionados que podem gerar ciclos de feedback autorreforçados.
⚡ Experimente hoje
Leia o artigo do Co-RL antes de adotar RL com autorrecompensa para modelos de raciocínio, especialmente se a sua configuração não tiver recompensas verificáveis.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.