Pesquisadores propõem Co-RL para raciocínio recompensado por pares
O framework treina modelos separados com recompensas vindas de pares para reduzir riscos de colapso por autorrecompensa.
Por que importa
O trabalho mira um gargalo central no treinamento de modelos de raciocínio: a dependência de recompensas verificáveis caras ou escassas. Se for validado além do cenário relatado, o RL multiagente com recompensas de pares pode abrir caminho para melhorias de raciocínio não supervisionadas mais escaláveis, ao mesmo tempo em que mitiga riscos de homogeneização.
Pontos-chave
- 1.O Co-RL usa recompensas derivadas de pares em vez de supervisão por respostas verificadas.
- 2.Modelos separados não compartilham parâmetros durante o treinamento cooperativo de RL.
- 3.Grupos diversos buscam reduzir erros correlacionados e colapso.
Um novo artigo no arXiv apresenta o Co-RL, um framework cooperativo de aprendizado por reforço multiagente para melhorar o raciocínio sem supervisão por respostas verificadas. O método treina múltiplos modelos desacoplados, que não compartilham parâmetros, usando recompensas derivadas de modelos pares em vez de depender apenas de feedback gerado pelo próprio modelo. Os autores argumentam que a diversidade do grupo, entre famílias de modelos, tamanhos e amostras de treinamento reformuladas, reduz erros correlacionados que podem alimentar ciclos de feedback autorreforçadores e levar ao colapso do treinamento.
⚡ Experimente hoje
Leia o artigo antes de usar RL com autorrecompensa e teste se avaliadores pares diversos reduzem modos de falha correlacionados no seu setup de treinamento.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
MemTrapBench testa armadilhas cognitivas no uso de memória por LLMs
O benchmark mostra que a memória pode prejudicar o desempenho em tarefas mesmo quando os registros recuperados são relevantes.
AI4AI-Bench testa agentes no design de algoritmos de treinamento
O benchmark no arXiv avalia se agentes de LLM conseguem reescrever algoritmos de treinamento em repositórios congelados.
Novos artigos miram atenção esparsa para IA de contexto longo
Pesquisadores propõem métodos para inferência, serving, geração de vídeo e memória em contexto longo com menor custo.