Nuevos papers ponen a prueba la autodestilación para RL agéntico
AgentOPSD y OCSD proponen correcciones, mientras otro estudio encuentra que los profesores con información privilegiada pueden fallar en tareas más difíciles.
Por qué importa
Los papers señalan la asignación de crédito y la supervisión privilegiada sesgada como problemas centrales aún no resueltos en el RL agéntico. También sugieren que una menor pérdida de destilación no es evidencia suficiente de que un agente esté aprendiendo un mejor comportamiento.
Puntos clave
- 1.AgentOPSD apunta a la asignación de crédito a nivel de turno sin crítico ni rollouts adicionales.
- 2.OCSD intenta eliminar la confusión causada por el andamiaje de repetición en las señales de observación privilegiadas.
- 3.Un estudio sobre sesgos encuentra que la autodestilación puede degradar la precisión de validación en tareas más difíciles.
Tres papers de arXiv examinan métodos de autodestilación para entrenar agentes basados en modelos de lenguaje con recompensas escasas de aprendizaje por refuerzo. AgentOPSD propone un método recursivo sin crítico para la asignación de crédito a nivel de turno y reporta evaluaciones en ALFWorld, WebShop y Search-QA usando modelos Qwen2.5 de 3B y 7B. OCSD propone contrastar vistas de repetición completas y con observaciones eliminadas para aislar la supervisión de observaciones futuras, mientras que un paper separado sostiene que los profesores condicionados por información privilegiada pueden reducir la pérdida por token sin mejorar, y a menudo degradando, la precisión de validación en tareas más difíciles.
⚡ Pruébalo hoy
Antes de adoptar autodestilación al estilo OPSD, valida en tareas agénticas difíciles y reservadas, y mide la precisión en la tarea, no solo la pérdida por token.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.
Las herramientas y prácticas de IA para desarrolladores generan debate en Hacker News
Publicaciones sobre MathCode, hábitos de programación con IA, Cloudflare y HEIR de Google impulsaron la discusión.
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.