Investigadores prueban OPD² para el razonamiento matemático multilingüe
Los experimentos con Qwen3 muestran avances frente a OPD en tareas matemáticas en inglés, coreano y japonés.
Por qué importa
Los resultados sugieren que el post-entrenamiento basado en destilación puede mejorar el razonamiento multilingüe sin depender únicamente del aprendizaje por refuerzo. También subrayan que los datos de entrenamiento multilingües son importantes cuando la fidelidad de la salida en el idioma objetivo es clave.
Puntos clave
- 1.OPD² usa una brecha de probabilidad entre profesor y modelo base como señal de aprendizaje.
- 2.Los experimentos con Qwen3 muestran avances más sólidos en coreano y japonés.
- 3.OPD solo en inglés puede empujar las respuestas en otros idiomas hacia el inglés.
Un nuevo artículo en arXiv estudia On-Policy Distillation y On-Policy Delta Distillation, u OPD², para el razonamiento matemático en inglés, coreano y japonés. Con Qwen3, los autores informan que OPD² supera de forma constante al OPD estándar, con mejoras especialmente fuertes en coreano y japonés, y que en general reduce la brecha de rendimiento entre inglés y coreano. También observan que OPD solo en inglés puede mejorar el rendimiento en coreano y japonés, pero podría desplazar las respuestas hacia el inglés.
⚡ Pruébalo hoy
Usa datos de entrenamiento multilingües al aplicar post-entrenamiento de estilo OPD para tareas de razonamiento en idiomas distintos del inglés.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.