OPD² mejora el razonamiento matemático multilingüe con Qwen3
El artículo de arXiv estudia la destilación delta on-policy para el razonamiento matemático en inglés, coreano y japonés.
Por qué importa
El trabajo apunta a la destilación como una posible alternativa al aprendizaje por refuerzo para el posentrenamiento de modelos de razonamiento multilingües. También subraya un riesgo práctico: mejorar el rendimiento entre idiomas sin datos multilingües puede degradar el comportamiento en la lengua objetivo.
Puntos clave
- 1.OPD² utiliza las brechas de probabilidad entre el profesor y el modelo base como señal de aprendizaje.
- 2.Los experimentos con Qwen3 mostraron mejoras más sólidas en coreano y japonés.
- 3.OPD solo en inglés puede desplazar las salidas en otros idiomas hacia el inglés.
Un grupo de investigadores presentó On-Policy Delta Distillation, u OPD², como una variante de la destilación on-policy para el posentrenamiento de LLMs en razonamiento matemático multilingüe. En experimentos con Qwen3 en inglés, coreano y japonés, OPD² superó de forma constante al enfoque OPD original, con mejoras especialmente fuertes en coreano y japonés. El estudio también encontró que OPD solo en inglés puede mejorar el rendimiento en coreano y japonés, pero puede desplazar las respuestas hacia el inglés.
⚡ Pruébalo hoy
Use datos de entrenamiento multilingües al aplicar posentrenamiento al estilo OPD para preservar las respuestas en la lengua objetivo.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.