Des chercheurs testent OPD² pour le raisonnement mathématique multilingue
Les expériences menées avec Qwen3 montrent des gains par rapport à OPD sur des tâches de mathématiques en anglais, coréen et japonais.
Pourquoi c'est important
Ces résultats suggèrent que le post-entraînement par distillation peut améliorer le raisonnement multilingue sans dépendre uniquement de l’apprentissage par renforcement. Ils soulignent aussi l’importance des données d’entraînement multilingues lorsque la fidélité de la sortie dans la langue cible est essentielle.
Points clés
- 1.OPD² utilise l’écart de probabilité entre enseignant et modèle de base comme signal d’apprentissage.
- 2.Les expériences avec Qwen3 montrent des gains plus importants en coréen et en japonais.
- 3.Un OPD entraîné uniquement en anglais peut pousser les réponses non anglophones vers l’anglais.
Un nouvel article publié sur arXiv étudie On-Policy Distillation et On-Policy Delta Distillation, ou OPD², pour le raisonnement mathématique en anglais, coréen et japonais. En utilisant Qwen3, les auteurs indiquent qu’OPD² surpasse systématiquement l’OPD standard, avec des améliorations particulièrement marquées en coréen et en japonais, et réduit globalement l’écart de performance entre l’anglais et le coréen. Ils constatent aussi qu’un OPD entraîné uniquement en anglais peut améliorer les performances en coréen et en japonais, mais risque d’orienter les réponses vers l’anglais.
⚡ À tester aujourd'hui
Utiliser des données d’entraînement multilingues lors de l’application d’un post-entraînement de type OPD à des tâches de raisonnement non anglophones.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude d’Anthropic montre que des agents IA peuvent entrer en conflit sur des tâches partagées
Selon les chercheurs, les comportements multi-agents pourraient révéler des angles morts dans les tests actuels de sûreté de l’IA.
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.