AAI News Hub
InvestigaciónFri, August 7, 2026·6d ago2 sources corroborating

OPD² mejora el razonamiento matemático multilingüe con Qwen3

El artículo de arXiv estudia la destilación delta on-policy para el razonamiento matemático en inglés, coreano y japonés.

Por qué importa

El trabajo apunta a la destilación como una posible alternativa al aprendizaje por refuerzo para el posentrenamiento de modelos de razonamiento multilingües. También subraya un riesgo práctico: mejorar el rendimiento entre idiomas sin datos multilingües puede degradar el comportamiento en la lengua objetivo.

Puntos clave

  • 1.OPD² utiliza las brechas de probabilidad entre el profesor y el modelo base como señal de aprendizaje.
  • 2.Los experimentos con Qwen3 mostraron mejoras más sólidas en coreano y japonés.
  • 3.OPD solo en inglés puede desplazar las salidas en otros idiomas hacia el inglés.

Un grupo de investigadores presentó On-Policy Delta Distillation, u OPD², como una variante de la destilación on-policy para el posentrenamiento de LLMs en razonamiento matemático multilingüe. En experimentos con Qwen3 en inglés, coreano y japonés, OPD² superó de forma constante al enfoque OPD original, con mejoras especialmente fuertes en coreano y japonés. El estudio también encontró que OPD solo en inglés puede mejorar el rendimiento en coreano y japonés, pero puede desplazar las respuestas hacia el inglés.

Pruébalo hoy

Use datos de entrenamiento multilingües al aplicar posentrenamiento al estilo OPD para preservar las respuestas en la lengua objetivo.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación