Investigadores llevan la destilación on-policy más allá de los docentes estándar
Nuevos artículos en arXiv apuntan a los límites de OPD en generadores, agentes, VLM y LLM.
Por qué importa
Estos trabajos apuntan a que OPD se convierta en un conjunto de herramientas más amplio para transferir comportamiento cuando los modelos docente y estudiante difieren en arquitectura, modalidad, capacidad o dinámica de trayectoria. Eso podría ser relevante para desplegar modelos más pequeños o especializados sin requerir un docente más grande y estrechamente alineado.
Puntos clave
- 1.Any-OPD conecta generadores de flow matching no alineados mediante representaciones visuales.
- 2.FutureBridge-OPD prueba la guía del docente frente a trayectorias posteriores de agentes.
- 3.Las variantes weak-to-strong y con proyección de Fisher abordan el desajuste de capacidad.
Varios nuevos artículos en arXiv proponen formas de flexibilizar supuestos centrales de la destilación on-policy, en la que un modelo estudiante se entrena con estados o muestras que genera por sí mismo. Any-OPD se orienta a generadores latentes de flow matching de distintas familias de modelos comparando salidas decodificadas de forma independiente dentro de una representación visual congelada, mientras que FutureBridge-OPD valida la guía del docente probando su efecto en trayectorias posteriores de agentes. Otros trabajos proponen destilar estudiantes fuertes a partir de pares de modelos más débiles y proyectar las correcciones de docentes de visión-lenguaje sobre lo que un estudiante compacto puede representar localmente.
⚡ Pruébalo hoy
Antes de adoptar OPD, comprueba si tu docente y tu estudiante comparten latentes, calendarios, capacidad y comportamiento de trayectoria; elige un método diseñado para ese desajuste.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.