Investigadores buscan abordar las recompensas escasas en el RL agéntico
Nuevos artículos en arXiv proponen métodos de autodestilación para una asignación de crédito más densa en agentes LLM.
Por qué importa
Los artículos reflejan un impulso más amplio de la investigación para hacer que el entrenamiento de agentes dependa menos de recompensas terminales escasas. Una mejor asignación de crédito podría mejorar los agentes mult turno para el uso de herramientas, la programación, las consultas a bases de datos y otras tareas en las que los resultados son fáciles de verificar, pero los pasos individuales son difíciles de puntuar.
Puntos clave
- 1.La autodestilación se está usando para añadir señales de entrenamiento más densas para agentes LLM.
- 2.SERL-SQL se centra en agentes Text-to-SQL con asignación de crédito basada en ejecución.
- 3.Los métodos buscan preservar las recompensas del verificador mientras localizan las señales de aprendizaje.
Varios nuevos artículos en arXiv proponen enfoques de autodestilación para mejorar el aprendizaje por refuerzo en agentes LLM mult turno, donde las recompensas a nivel de trayectoria a menudo no logran identificar qué decisiones intermedias causaron el éxito o el fracaso. Los métodos incluyen ADRS, que usa puntuación de tokens privilegiada y una compuerta Teacher Value Advantage; SERL-SQL, que aplica retrospectiva basada en ejecución a agentes Text-to-SQL; GRSD, que deriva orientación de despliegues verificados; y PCSD, que pondera la destilación mediante señales persistentes favorables al profesor. SERL-SQL reporta una precisión de ejecución del 76,56% en BIRD-Dev y del 89,92% en Spider-Test.
⚡ Pruébalo hoy
Lee los artículos de ADRS, SERL-SQL, GRSD y PCSD antes de diseñar pipelines de RL para agentes mult turno con recompensas escasas.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLSERL-SQL: Selective Hindsight Distillation for Text-to-SQL Reinforcement Agentic LearningAug 4, 12:00 PM↗
- HF Daily PapersPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 3, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores presentan TTP-D para la planificación de rutas con camiones y drones
El nuevo benchmark combina selección de artículos, rutas dependientes de la carga y sincronización de drones.
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.