ReflectRL entrena modelos de razonamiento con trayectorias expertas fallidas
El artículo de arXiv propone usar rollouts expertos defectuosos como objetivos de reflexión durante el entrenamiento on-policy.
Por qué importa
El trabajo aborda un cuello de botella en el post-entrenamiento de modelos de razonamiento: las trayectorias expertas pierden utilidad cuando el experto falla en problemas difíciles. Si se valida, el enfoque podría convertir los rollouts fallidos en una señal de entrenamiento aprovechable, en lugar de datos descartados.
Puntos clave
- 1.ReflectRL aprende de trayectorias fallidas de razonamiento experto.
- 2.El método convierte el comportamiento de reflexión de vuelta en razonamiento directo.
- 3.Las evaluaciones abarcan 9 benchmarks y 4 bases de LLM.
Investigadores presentaron ReflectRL, un marco ligero y plug-and-play para mejorar el razonamiento de los grandes modelos de lenguaje durante el entrenamiento on-policy. El método utiliza “Golden Negative Trajectories”, salidas fallidas de modelos expertos más potentes, no como demostraciones que imitar, sino como rutas de razonamiento defectuosas sobre las que el modelo reflexiona antes de transferir ese comportamiento de vuelta al razonamiento directo. Una entrada de Hugging Face Daily Papers afirma que los autores evaluaron el enfoque en 9 benchmarks, 4 bases de LLM y 4 configuraciones on-policy.
⚡ Pruébalo hoy
Lee el artículo de ReflectRL antes de descartar rollouts expertos fallidos en pipelines de post-entrenamiento de modelos de razonamiento.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGPrefix-Guided On-Policy Distillation: Mining Golden Trajectories from RolloutsAug 4, 12:00 PM↗
- HF Daily PapersReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.
Google dice que está haciendo práctica la IA privada
Una publicación de Google Security generó debate en Hacker News junto con críticas más amplias a la IA.
Publicaciones sobre privacidad y rendición de cuentas en AI generan debate en Hacker News
Seis hilos de Hacker News abarcan AI privada, reventa de tokens, críticas a la AI y herramientas prácticas.