Investigadores perfeccionan la destilación on-policy para agentes
Tres artículos en arXiv proponen formas de comprobar cuándo la guía de un docente mejora las trayectorias del estudiante.
Por qué importa
El trabajo apunta a un enfoque más selectivo para destilar comportamientos agénticos y de razonamiento, en el que el desacuerdo local entre modelos no se trata como prueba suficiente para intervenir. Eso podría ser importante para crear modelos más pequeños que conserven el rendimiento en tareas posteriores sin copiar todas las preferencias del docente.
Puntos clave
- 1.FutureBridge-OPD reporta mejoras en ALFWorld, WebShop y ScienceWorld.
- 2.SPOT asigna sondeos limitados usando entropía, masa top-k y desajuste entre docente y estudiante.
- 3.Las etiquetas de recuperabilidad distinguen errores corregibles de estados que requieren reversión.
Tres artículos en arXiv abordan los límites de la destilación on-policy, en la que un modelo docente supervisa trayectorias generadas por un modelo estudiante. FutureBridge-OPD prueba breves intervenciones del docente en estados con alto desacuerdo y reporta mejoras en ALFWorld, WebShop y ScienceWorld en un esquema de Qwen3-32B a Qwen3-1.7B. SPOT utiliza sondeos escasos y continuaciones puntuadas por un verificador para decidir dónde y qué destilar, mientras que un método de recuperabilidad contrafactual reproduce estados de error para decidir si conservar, revertir o supervisar de forma convencional una trayectoria.
⚡ Pruébalo hoy
Antes de adoptar la destilación on-policy para agentes, evalúa las intervenciones del docente por el éxito de la continuación en la tarea, no solo por la divergencia a nivel de tokens.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.