AAI News Hub
ForschungFri, August 7, 2026·4d ago2 sources corroborating

OPD² verbessert mehrsprachiges mathematisches Denken mit Qwen3

Das arXiv-Paper untersucht On-Policy Delta Distillation für mathematisches Denken auf Englisch, Koreanisch und Japanisch.

Warum es wichtig ist

Die Arbeit deutet darauf hin, dass Distillation eine mögliche Alternative zu Reinforcement Learning für das Post-Training mehrsprachiger Reasoning-Modelle sein könnte. Zugleich macht sie auf ein praktisches Risiko aufmerksam: Wird die sprachübergreifende Leistung ohne mehrsprachige Daten verbessert, kann dies das Antwortverhalten in der Zielsprache verschlechtern.

Die Kernpunkte

  • 1.OPD² nutzt Wahrscheinlichkeitsabstände zwischen Teacher und Base-Modell als Lernsignal.
  • 2.Experimente mit Qwen3 zeigten stärkere Zugewinne bei Koreanisch und Japanisch.
  • 3.Rein englischsprachiges OPD kann nicht-englische Ausgaben in Richtung Englisch verschieben.

Forschende stellen On-Policy Delta Distillation, kurz OPD², als Variante der On-Policy-Distillation für das Post-Training von LLMs im mehrsprachigen mathematischen Denken vor. In Experimenten mit Qwen3 auf Englisch, Koreanisch und Japanisch schnitt OPD² durchweg besser ab als der ursprüngliche OPD-Ansatz, mit besonders deutlichen Zuwächsen bei Koreanisch und Japanisch. Die Studie ergab außerdem, dass rein englischsprachiges OPD die Leistung in Koreanisch und Japanisch verbessern kann, Antworten aber stärker in Richtung Englisch verschieben kann.

Heute ausprobieren

Beim OPD-artigen Post-Training sollten mehrsprachige Trainingsdaten genutzt werden, um Antworten in der Zielsprache zu erhalten.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung