OPD² améliore le raisonnement mathématique multilingue avec Qwen3
L’article publié sur arXiv étudie la distillation delta on-policy pour le raisonnement mathématique en anglais, en coréen et en japonais.
Pourquoi c'est important
Ces travaux présentent la distillation comme une alternative possible à l’apprentissage par renforcement pour le post-entraînement de modèles de raisonnement multilingues. Ils soulignent aussi un risque pratique : améliorer les performances interlingues sans données multilingues peut dégrader le comportement dans la langue cible.
Points clés
- 1.OPD² utilise les écarts de probabilité entre l’enseignant et le modèle de base comme signal d’apprentissage.
- 2.Les expériences avec Qwen3 ont montré des gains plus importants en coréen et en japonais.
- 3.Un OPD entraîné uniquement en anglais peut faire basculer les sorties non anglophones vers l’anglais.
Des chercheurs ont introduit On-Policy Delta Distillation, ou OPD², une variante de la distillation on-policy destinée au post-entraînement des LLM pour le raisonnement mathématique multilingue. Dans des expériences menées avec Qwen3 en anglais, en coréen et en japonais, OPD² a systématiquement surpassé l’approche OPD originale, avec des gains particulièrement marqués en coréen et en japonais. L’étude a aussi montré qu’un OPD entraîné uniquement en anglais peut améliorer les performances en coréen et en japonais, mais risque d’orienter les réponses vers l’anglais.
⚡ À tester aujourd'hui
Utiliser des données d’entraînement multilingues lors de l’application d’un post-entraînement de type OPD afin de préserver les réponses dans la langue cible.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.