Investigadores proponen nuevos controles para la destilación on-policy
Tres artículos en arXiv abordan fallos al entrenar modelos estudiante a partir de trayectorias guiadas por modelos profesor.
Por qué importa
Los artículos señalan una limitación común en las canalizaciones actuales de destilación: igualar localmente el comportamiento del profesor puede no bastar cuando importan los resultados posteriores, la recuperabilidad y la robustez al contexto. Un mejor control sobre cuándo y qué destilar podría mejorar modelos estudiante más pequeños usados en cargas de trabajo de razonamiento y tareas agénticas.
Puntos clave
- 1.SPOT usa sondeo disperso y continuaciones puntuadas por un verificador para calibrar objetivos.
- 2.El control sensible a la recuperabilidad distingue errores corregibles de estados que requieren reversión.
- 3.FutureBridge-OPD reporta mejoras en ALFWorld, WebShop y ScienceWorld.
Varios nuevos artículos en arXiv proponen métodos para hacer que la destilación on-policy sea más selectiva y robusta. SPOT asigna recursos limitados de sondeo a posiciones inciertas o desalineadas y calibra los objetivos de destilación usando continuaciones puntuadas por un verificador. Otros trabajos introducen la recuperabilidad contrafactual para decidir si los errores del estudiante deben conservarse o revertirse, mientras que FutureBridge-OPD evalúa si los puentes breves del profesor mejoran las trayectorias posteriores del estudiante en tareas agénticas.
⚡ Pruébalo hoy
Antes de aplicar destilación on-policy, audita si tu canalización valida las intervenciones del profesor frente a los resultados posteriores de la tarea, no solo frente a la divergencia a nivel de token.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AINative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.LGNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.