AAI News Hub
PesquisaWed, August 19, 2026·1d ago2 sources corroborating

Co-RL treina modelos de raciocínio com recompensas derivadas de pares

O artigo no arXiv propõe RL multiagente cooperativo para reduzir a dependência de supervisão com respostas corretas de referência.

Por que importa

O trabalho mira um gargalo central no pós-treinamento de modelos de raciocínio: a dependência de recompensas verificáveis caras ou escassas. Se for validado além do cenário relatado no artigo, o RL baseado em pares pode orientar métodos de treinamento que dependam menos de supervisão rotulada por humanos, evitando ao mesmo tempo o colapso causado por feedback puramente autogerado.

Pontos-chave

  • 1.O Co-RL usa recompensas derivadas de pares entre modelos desacoplados.
  • 2.A diversidade da coorte é apresentada como uma forma de reduzir erros correlacionados.
  • 3.O artigo se concentra em raciocínio não supervisionado no pós-treinamento com RL.

Pesquisadores apresentaram o Co-RL, um framework para aprimorar o raciocínio em modelos de linguagem e de visão-linguagem por meio de aprendizado por reforço multiagente cooperativo. O método treina vários modelos desacoplados, sem parâmetros compartilhados, usando recompensas derivadas de modelos pares em vez de anotações de referência. Os autores argumentam que coortes mais diversas, incluindo diferentes famílias e tamanhos de modelos, além de amostras reformuladas, reduzem erros correlacionados que podem gerar ciclos de feedback autorreforçados.

Experimente hoje

Leia o artigo do Co-RL antes de adotar RL com autorrecompensa para modelos de raciocínio, especialmente se a sua configuração não tiver recompensas verificáveis.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa