AAI News Hub
InvestigaciónFri, August 7, 2026·6d ago2 sources corroborating

Investigadores prueban OPD² para el razonamiento matemático multilingüe

Los experimentos con Qwen3 muestran avances frente a OPD en tareas matemáticas en inglés, coreano y japonés.

Por qué importa

Los resultados sugieren que el post-entrenamiento basado en destilación puede mejorar el razonamiento multilingüe sin depender únicamente del aprendizaje por refuerzo. También subrayan que los datos de entrenamiento multilingües son importantes cuando la fidelidad de la salida en el idioma objetivo es clave.

Puntos clave

  • 1.OPD² usa una brecha de probabilidad entre profesor y modelo base como señal de aprendizaje.
  • 2.Los experimentos con Qwen3 muestran avances más sólidos en coreano y japonés.
  • 3.OPD solo en inglés puede empujar las respuestas en otros idiomas hacia el inglés.

Un nuevo artículo en arXiv estudia On-Policy Distillation y On-Policy Delta Distillation, u OPD², para el razonamiento matemático en inglés, coreano y japonés. Con Qwen3, los autores informan que OPD² supera de forma constante al OPD estándar, con mejoras especialmente fuertes en coreano y japonés, y que en general reduce la brecha de rendimiento entre inglés y coreano. También observan que OPD solo en inglés puede mejorar el rendimiento en coreano y japonés, pero podría desplazar las respuestas hacia el inglés.

Pruébalo hoy

Usa datos de entrenamiento multilingües al aplicar post-entrenamiento de estilo OPD para tareas de razonamiento en idiomas distintos del inglés.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación