Nuevos papers apuntan a los límites de exploración de los LLM
DORA, 3PO y RISE-RL proponen formas de mejorar la exploración en agentes y entrenamiento RL.
Por qué importa
Los papers señalan una limitación compartida en métodos de exploración a nivel de token, como el escalado de temperatura: puede que no produzcan una diversidad útil a nivel de secuencia. Una mejor exploración podría mejorar los agentes LLM, el entrenamiento de razonamiento y los flujos de trabajo de alineación abiertos sin depender solo de cambios en prompts o recompensas escalares.
Puntos clave
- 1.DORA mejora la exploración a nivel de secuencia sin entrenamiento.
- 2.3PO muestrea políticas para diversificar los rollouts de RLVR.
- 3.RISE-RL apunta a criterios de rúbrica incumplidos repetidamente.
Varios papers en arXiv describen nuevos métodos para mejorar la exploración en los modelos de lenguaje grandes. DORA Explorer es un algoritmo sin entrenamiento que opera en tiempo de inferencia: genera varias acciones candidatas, las puntúa con estadísticas de log-probabilidad a nivel de secuencia y muestrea con un parámetro de exploración ajustable. 3PO explora en el espacio de parámetros para RLVR muestreando distintas políticas desde una posterior, mientras que RISE-RL utiliza criterios de rúbrica incumplidos de forma repetida para guiar una exploración selectiva en RL abierto.
⚡ Pruébalo hoy
Lee los papers de DORA y 3PO antes de depender únicamente de la temperatura para la exploración de agentes o rollouts de RL.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.