AAI News Hub
InvestigaciónWed, August 19, 2026·1d ago2 sources corroborating

Co-RL entrena modelos de razonamiento con recompensas derivadas de pares

El artículo en arXiv propone RL multiagente cooperativo para reducir la dependencia de la supervisión con respuestas verificadas.

Por qué importa

El trabajo apunta a un cuello de botella central en el postentrenamiento de modelos de razonamiento: la dependencia de recompensas verificables costosas o escasas. Si se valida más allá del entorno reportado en el artículo, el RL basado en pares podría orientar métodos de entrenamiento que dependan menos de la supervisión etiquetada por humanos y, al mismo tiempo, eviten el colapso causado por retroalimentación puramente autogenerada.

Puntos clave

  • 1.Co-RL usa recompensas derivadas de pares entre modelos desacoplados.
  • 2.La diversidad de la cohorte se presenta como una forma de reducir errores correlacionados.
  • 3.El artículo se centra en el razonamiento no supervisado durante el postentrenamiento con RL.

Investigadores presentaron Co-RL, un marco para mejorar el razonamiento en modelos de lenguaje y de visión-lenguaje mediante aprendizaje por refuerzo multiagente cooperativo. El método entrena múltiples modelos desacoplados, sin parámetros compartidos, usando recompensas derivadas de modelos pares en lugar de anotaciones con respuestas verificadas. Los autores sostienen que cohortes más diversas, incluidas distintas familias de modelos, tamaños y muestras reformuladas, reducen los errores correlacionados que pueden provocar bucles de retroalimentación autorreforzados.

Pruébalo hoy

Lee el artículo de Co-RL antes de adoptar RL con autorrecompensa para modelos de razonamiento, especialmente si tu configuración carece de recompensas verificables.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación