研究人员测试 OPD² 在多语言数学推理中的表现
Qwen3 实验显示,OPD² 在英语、韩语和日语数学任务上均优于 OPD。
为什么重要
这些结果表明,基于蒸馏的后训练可以提升多语言推理能力,而不必完全依赖强化学习。研究也凸显了多语言训练数据的重要性,尤其是在目标语言输出准确性很关键的场景中。
核心要点
- 1.OPD² 使用教师模型与基础模型之间的概率差作为学习信号。
- 2.Qwen3 实验显示,其在韩语和日语上的提升更强。
- 3.仅用英语数据进行 OPD 训练,可能会让非英语答案偏向英语。
一篇新的 arXiv 论文研究了 On-Policy Distillation 以及 On-Policy Delta Distillation(OPD²)在英语、韩语和日语数学推理中的应用。作者使用 Qwen3 进行实验,并报告称 OPD² 持续优于标准 OPD,尤其在韩语和日语上提升明显,同时总体上缩小了英语与韩语之间的性能差距。他们还发现,仅使用英语数据进行 OPD 训练也能提升韩语和日语表现,但可能会让回答更偏向英语。
⚡ 今天就能用
在将 OPD 类后训练用于非英语推理任务时,应使用多语言训练数据。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。