AAI News Hub
PesquisaWed, August 19, 2026·2d ago2 sources corroborating

Pesquisadores propõem Co-RL para raciocínio recompensado por pares

O framework treina modelos separados com recompensas vindas de pares para reduzir riscos de colapso por autorrecompensa.

Por que importa

O trabalho mira um gargalo central no treinamento de modelos de raciocínio: a dependência de recompensas verificáveis caras ou escassas. Se for validado além do cenário relatado, o RL multiagente com recompensas de pares pode abrir caminho para melhorias de raciocínio não supervisionadas mais escaláveis, ao mesmo tempo em que mitiga riscos de homogeneização.

Pontos-chave

  • 1.O Co-RL usa recompensas derivadas de pares em vez de supervisão por respostas verificadas.
  • 2.Modelos separados não compartilham parâmetros durante o treinamento cooperativo de RL.
  • 3.Grupos diversos buscam reduzir erros correlacionados e colapso.

Um novo artigo no arXiv apresenta o Co-RL, um framework cooperativo de aprendizado por reforço multiagente para melhorar o raciocínio sem supervisão por respostas verificadas. O método treina múltiplos modelos desacoplados, que não compartilham parâmetros, usando recompensas derivadas de modelos pares em vez de depender apenas de feedback gerado pelo próprio modelo. Os autores argumentam que a diversidade do grupo, entre famílias de modelos, tamanhos e amostras de treinamento reformuladas, reduz erros correlacionados que podem alimentar ciclos de feedback autorreforçadores e levar ao colapso do treinamento.

Experimente hoje

Leia o artigo antes de usar RL com autorrecompensa e teste se avaliadores pares diversos reduzem modos de falha correlacionados no seu setup de treinamento.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa