AAI News Hub
RechercheFri, August 7, 2026·6d ago2 sources corroborating

OPD² améliore le raisonnement mathématique multilingue avec Qwen3

L’article publié sur arXiv étudie la distillation delta on-policy pour le raisonnement mathématique en anglais, en coréen et en japonais.

Pourquoi c'est important

Ces travaux présentent la distillation comme une alternative possible à l’apprentissage par renforcement pour le post-entraînement de modèles de raisonnement multilingues. Ils soulignent aussi un risque pratique : améliorer les performances interlingues sans données multilingues peut dégrader le comportement dans la langue cible.

Points clés

  • 1.OPD² utilise les écarts de probabilité entre l’enseignant et le modèle de base comme signal d’apprentissage.
  • 2.Les expériences avec Qwen3 ont montré des gains plus importants en coréen et en japonais.
  • 3.Un OPD entraîné uniquement en anglais peut faire basculer les sorties non anglophones vers l’anglais.

Des chercheurs ont introduit On-Policy Delta Distillation, ou OPD², une variante de la distillation on-policy destinée au post-entraînement des LLM pour le raisonnement mathématique multilingue. Dans des expériences menées avec Qwen3 en anglais, en coréen et en japonais, OPD² a systématiquement surpassé l’approche OPD originale, avec des gains particulièrement marqués en coréen et en japonais. L’étude a aussi montré qu’un OPD entraîné uniquement en anglais peut améliorer les performances en coréen et en japonais, mais risque d’orienter les réponses vers l’anglais.

À tester aujourd'hui

Utiliser des données d’entraînement multilingues lors de l’application d’un post-entraînement de type OPD afin de préserver les réponses dans la langue cible.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche