OPD² 借助 Qwen3 提升多语言数学推理能力
这篇 arXiv 论文研究了面向英语、韩语和日语数学推理的 on-policy delta distillation。
为什么重要
这项工作表明,在多语言推理模型的后训练中,蒸馏可能成为强化学习之外的一种替代路径。它也凸显了一个实际风险:在没有多语言数据的情况下提升跨语言表现,可能会削弱模型在目标语言中的回答行为。
核心要点
- 1.OPD² 使用 teacher-base 概率差作为学习信号。
- 2.Qwen3 实验显示,韩语和日语上的提升更为显著。
- 3.仅使用英语的 OPD 可能会使非英语输出转向英语。
研究人员提出了 On-Policy Delta Distillation(OPD²),将其作为一种用于多语言数学推理场景下 LLM 后训练的 on-policy distillation 变体。在使用 Qwen3 针对英语、韩语和日语进行的实验中,OPD² 始终优于原始 OPD 方法,在韩语和日语上的提升尤为明显。研究还发现,仅使用英语数据进行 OPD 训练也能提升韩语和日语表现,但可能会使回答更偏向英语。
⚡ 今天就能用
在采用 OPD 风格的后训练时,应使用多语言训练数据,以保留目标语言回答能力。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。