Investigadores proponen Co-RL para razonamiento recompensado por pares
El marco entrena modelos separados con recompensas de modelos pares para reducir los riesgos de colapso por autorrecompensa.
Por qué importa
El trabajo aborda un cuello de botella clave en el entrenamiento de modelos de razonamiento: la dependencia de recompensas verificables costosas o escasas. Si se valida más allá de la configuración reportada, el RL multiagente recompensado por pares podría ofrecer una vía hacia una mejora del razonamiento no supervisada más escalable, al tiempo que mitiga los riesgos de homogeneización.
Puntos clave
- 1.Co-RL usa recompensas derivadas de pares en lugar de supervisión con respuestas verdaderas.
- 2.Modelos separados no comparten parámetros durante el entrenamiento cooperativo con RL.
- 3.Las cohortes diversas buscan reducir los errores correlacionados y el colapso.
Un nuevo artículo en arXiv presenta Co-RL, un marco cooperativo de aprendizaje por refuerzo multiagente para mejorar el razonamiento sin supervisión con respuestas verdaderas. El método entrena múltiples modelos desacoplados que no comparten parámetros y utiliza recompensas derivadas de modelos pares en lugar de depender solo de retroalimentación autogenerada. Los autores sostienen que la diversidad de la cohorte entre familias de modelos, tamaños y muestras de entrenamiento reformuladas reduce los errores correlacionados que pueden alimentar bucles de retroalimentación autorreforzados y provocar el colapso del entrenamiento.
⚡ Pruébalo hoy
Lee el artículo antes de usar RL con autorrecompensa y comprueba si evaluadores pares diversos reducen los modos de fallo correlacionados en tu configuración de entrenamiento.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
MemTrapBench pone a prueba las trampas cognitivas en el uso de memoria por los LLM
El benchmark concluye que la memoria puede degradar el rendimiento en tareas incluso cuando los registros recuperados son relevantes.
AI4AI-Bench pone a prueba a los agentes en el diseño de algoritmos de entrenamiento
El benchmark publicado en arXiv evalúa si los agentes basados en LLM pueden reescribir algoritmos de entrenamiento en repositorios congelados.
Nuevos papers apuntan a la atención dispersa para la IA de contexto largo
Investigadores proponen métodos para abaratar la inferencia de contexto largo, el serving, la generación de video y la memoria.