Investigadores amplían la destilación on-policy entre modelos de IA
Nuevos artículos apuntan a los límites multimodales, agénticos y de generación de imágenes en el entrenamiento OPD.
Por qué importa
El trabajo sugiere que OPD se está convirtiendo en un patrón de entrenamiento más amplio, más allá de la imitación de modelos de lenguaje, pero los investigadores están comprobando que una supervisión ingenua del profesor puede desorientar a los estudiantes cuando divergen las modalidades, las arquitecturas o las trayectorias. Un mejor filtrado, enrutamiento y calendarios híbridos de RL podrían ser importantes para modelos multimodales compactos, generadores de imágenes y agentes pequeños.
Puntos clave
- 1.Las variantes de OPD se orientan al entrenamiento de modelos multimodales, agénticos y de correspondencia de flujo.
- 2.Los nuevos métodos filtran señales engañosas del profesor o las enrutan por modalidad.
- 3.Varios artículos se centran en profesores heterogéneos con arquitecturas incompatibles.
Varios artículos de investigación nuevos y actualizados proponen variantes de la destilación on-policy, un método de posentrenamiento que usa señales de un modelo profesor sobre trayectorias generadas por el modelo estudiante. Los trabajos abordan distintos modos de fallo: profesores multimodales con señales contradictorias, supervisión espuria a nivel de token, familias incompatibles de modelos de generación de imágenes, modelos de flujo con múltiples profesores, cascadas de llamadas a herramientas en agentes pequeños y entrenamiento de agentes multiturno de largo horizonte. Entre los métodos propuestos figuran OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD y ATOD.
⚡ Pruébalo hoy
Antes de usar OPD, evalúa si las señales del profesor siguen estando fundamentadas y son fiables en las trayectorias generadas por el propio estudiante.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Google prueba AMIE para consultas médicas por video en tiempo real
El sistema de investigación basado en Gemini fue evaluado en consultas simuladas de telesalud.
Un modelo de Anthropic avanza en el trabajo sobre la hipótesis de Riemann
Un modelo aún no lanzado de Anthropic logró avances en el problema matemático pendiente desde hace décadas, informó TechCrunch.
IBM detalla ALTK-Evolve, un método de memoria para agentes
El sistema recupera pautas específicas de cada tarea para reducir los tokens de inferencia frente a ACE.