AAI News Hub
InvestigaciónWed, August 19, 2026·2d ago2 sources corroborating

Investigadores proponen Co-RL para razonamiento recompensado por pares

El marco entrena modelos separados con recompensas de modelos pares para reducir los riesgos de colapso por autorrecompensa.

Por qué importa

El trabajo aborda un cuello de botella clave en el entrenamiento de modelos de razonamiento: la dependencia de recompensas verificables costosas o escasas. Si se valida más allá de la configuración reportada, el RL multiagente recompensado por pares podría ofrecer una vía hacia una mejora del razonamiento no supervisada más escalable, al tiempo que mitiga los riesgos de homogeneización.

Puntos clave

  • 1.Co-RL usa recompensas derivadas de pares en lugar de supervisión con respuestas verdaderas.
  • 2.Modelos separados no comparten parámetros durante el entrenamiento cooperativo con RL.
  • 3.Las cohortes diversas buscan reducir los errores correlacionados y el colapso.

Un nuevo artículo en arXiv presenta Co-RL, un marco cooperativo de aprendizaje por refuerzo multiagente para mejorar el razonamiento sin supervisión con respuestas verdaderas. El método entrena múltiples modelos desacoplados que no comparten parámetros y utiliza recompensas derivadas de modelos pares en lugar de depender solo de retroalimentación autogenerada. Los autores sostienen que la diversidad de la cohorte entre familias de modelos, tamaños y muestras de entrenamiento reformuladas reduce los errores correlacionados que pueden alimentar bucles de retroalimentación autorreforzados y provocar el colapso del entrenamiento.

Pruébalo hoy

Lee el artículo antes de usar RL con autorrecompensa y comprueba si evaluadores pares diversos reducen los modos de fallo correlacionados en tu configuración de entrenamiento.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación