OPD² verbessert mehrsprachiges mathematisches Denken mit Qwen3
Das arXiv-Paper untersucht On-Policy Delta Distillation für mathematisches Denken auf Englisch, Koreanisch und Japanisch.
Warum es wichtig ist
Die Arbeit deutet darauf hin, dass Distillation eine mögliche Alternative zu Reinforcement Learning für das Post-Training mehrsprachiger Reasoning-Modelle sein könnte. Zugleich macht sie auf ein praktisches Risiko aufmerksam: Wird die sprachübergreifende Leistung ohne mehrsprachige Daten verbessert, kann dies das Antwortverhalten in der Zielsprache verschlechtern.
Die Kernpunkte
- 1.OPD² nutzt Wahrscheinlichkeitsabstände zwischen Teacher und Base-Modell als Lernsignal.
- 2.Experimente mit Qwen3 zeigten stärkere Zugewinne bei Koreanisch und Japanisch.
- 3.Rein englischsprachiges OPD kann nicht-englische Ausgaben in Richtung Englisch verschieben.
Forschende stellen On-Policy Delta Distillation, kurz OPD², als Variante der On-Policy-Distillation für das Post-Training von LLMs im mehrsprachigen mathematischen Denken vor. In Experimenten mit Qwen3 auf Englisch, Koreanisch und Japanisch schnitt OPD² durchweg besser ab als der ursprüngliche OPD-Ansatz, mit besonders deutlichen Zuwächsen bei Koreanisch und Japanisch. Die Studie ergab außerdem, dass rein englischsprachiges OPD die Leistung in Koreanisch und Japanisch verbessern kann, Antworten aber stärker in Richtung Englisch verschieben kann.
⚡ Heute ausprobieren
Beim OPD-artigen Post-Training sollten mehrsprachige Trainingsdaten genutzt werden, um Antworten in der Zielsprache zu erhalten.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Google testet AMIE für medizinische Videokonsultationen in Echtzeit
Das auf Gemini basierende Forschungssystem wurde in simulierten Telemedizin-Konsultationen evaluiert.
Anthropic-Modell bringt Arbeit an der Riemannschen Vermutung voran
Ein unveröffentlichtes Anthropic-Modell hat Fortschritte bei dem seit Langem ungelösten mathematischen Problem erzielt, berichtete TechCrunch.
IBM erläutert Agenten-Gedächtnismethode ALTK-Evolve
Das System ruft aufgabenspezifische Leitlinien ab, um gegenüber ACE Inference-Tokens zu sparen.