Co-RL entrena modelos de razonamiento con recompensas derivadas de pares
El artículo en arXiv propone RL multiagente cooperativo para reducir la dependencia de la supervisión con respuestas verificadas.
Por qué importa
El trabajo apunta a un cuello de botella central en el postentrenamiento de modelos de razonamiento: la dependencia de recompensas verificables costosas o escasas. Si se valida más allá del entorno reportado en el artículo, el RL basado en pares podría orientar métodos de entrenamiento que dependan menos de la supervisión etiquetada por humanos y, al mismo tiempo, eviten el colapso causado por retroalimentación puramente autogenerada.
Puntos clave
- 1.Co-RL usa recompensas derivadas de pares entre modelos desacoplados.
- 2.La diversidad de la cohorte se presenta como una forma de reducir errores correlacionados.
- 3.El artículo se centra en el razonamiento no supervisado durante el postentrenamiento con RL.
Investigadores presentaron Co-RL, un marco para mejorar el razonamiento en modelos de lenguaje y de visión-lenguaje mediante aprendizaje por refuerzo multiagente cooperativo. El método entrena múltiples modelos desacoplados, sin parámetros compartidos, usando recompensas derivadas de modelos pares en lugar de anotaciones con respuestas verificadas. Los autores sostienen que cohortes más diversas, incluidas distintas familias de modelos, tamaños y muestras reformuladas, reducen los errores correlacionados que pueden provocar bucles de retroalimentación autorreforzados.
⚡ Pruébalo hoy
Lee el artículo de Co-RL antes de adoptar RL con autorrecompensa para modelos de razonamiento, especialmente si tu configuración carece de recompensas verificables.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.LGCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- arXiv cs.AICo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 12:00 PM↗
- HF Daily PapersCo-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RLAug 19, 4:00 AM↗
- arXiv cs.AILearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
- arXiv cs.LGLearn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy OptimizationAug 18, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.