Investigadores proponen nuevos métodos de destilación on-policy
Varios artículos en arXiv analizan cuándo y cómo la guía del modelo docente debe moldear modelos estudiantes más pequeños.
Por qué importa
El trabajo apunta a una limitación común de la destilación: las señales de docentes más fuertes no siempre son útiles si el estudiante no puede representarlas o si perjudican trayectorias posteriores. Esto importa para hacer que modelos y agentes más pequeños sean más fiables sin copiar a ciegas a docentes de escala frontera.
Puntos clave
- 1.La guía del docente puede fallar cuando los estudiantes no pueden representar la corrección.
- 2.Las comprobaciones de trayectorias futuras superaron a la OPD vanilla en benchmarks de agentes.
- 3.Las etiquetas de recuperabilidad pueden orientar si conviene conservar o revertir estados divergentes.
Un conjunto de artículos en arXiv propone mejoras a la destilación on-policy, un enfoque de entrenamiento que supervisa a los modelos estudiantes a partir de trayectorias que ellos mismos generan. Los métodos incluyen Fisher-Projected OPD para modelos de visión-lenguaje, FutureBridge-OPD para tareas de agentes de múltiples turnos, SPOT para sondeo disperso y objetivos calibrados por resultados, y control consciente de la recuperabilidad para decidir si los estados de razonamiento divergentes deben conservarse, revertirse o supervisarse de forma normal. Las evaluaciones reportadas abarcan razonamiento de visión-lenguaje, ALFWorld, WebShop, ScienceWorld, AIME y GPQA-Diamond, y varios artículos afirman obtener mejoras frente a las líneas base de OPD vanilla.
⚡ Pruébalo hoy
Antes de aplicar OPD, hay que comprobar si las intervenciones del docente mejoran las continuaciones posteriores del estudiante, no solo la concordancia local de tokens.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Investigadores proponen Power Law Graph Attention
PLGA generaliza la atención de producto punto escalado y reporta colapso de inferencia bajo invariancia exacta.