Nuevos estudios ponen a prueba la autodestilación para el aprendizaje por refuerzo en LLM
Los trabajos proponen ICE y OCSD, mientras otro concluye que los docentes con información privilegiada pueden fallar en tareas más difíciles.
Por qué importa
Los estudios apuntan a una visión más matizada de la autodestilación en el post-entrenamiento de LLM: puede ayudar cuando se combina con exploración o calibración, pero también puede optimizar las pérdidas por token sin mejorar la precisión en la tarea. Esto importa para los equipos que usan supervisión densa como alternativa más barata, o complemento, al RL basado en recompensas.
Puntos clave
- 1.ICE mejoró el pass@1 matemático de Qwen3-1.7B en un 5,0% relativo frente a DAPO.
- 2.La mejora reportada de ICE no apareció para Qwen3-4B a 4K.
- 3.La autodestilación con información privilegiada puede reducir la pérdida mientras perjudica la precisión de validación.
Varios nuevos artículos en arXiv examinan métodos de autodestilación para el post-entrenamiento de grandes modelos de lenguaje mediante aprendizaje por refuerzo. Un estudio propone Instruction-Conditioned Exploration, que añade instrucciones de entrenamiento fijas y destila ejecuciones correctas en una política no condicionada para el momento de inferencia; reporta una mejora relativa del 5,0% en pass@1 sobre un conjunto reservado frente a DAPO para Qwen3-1.7B en razonamiento matemático con respuestas de 4K de longitud. Otro propone Observation-Calibrated Self-Distillation para RL agéntico, mientras un tercero informa que la autodestilación con información privilegiada puede reproducir mejoras en escenarios sencillos, pero a menudo no logra mejorar, e incluso puede degradar, la precisión de validación en tareas más difíciles de QA, matemáticas, programación y uso de herramientas.
⚡ Pruébalo hoy
Antes de adoptar la autodestilación para el post-entrenamiento de LLM, valídala en tareas difíciles reservadas y mide la precisión, no solo la pérdida por token.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AITCPO: Turn-Level Credit Policy OptimizationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.