OPD² melhora o raciocínio matemático multilíngue com Qwen3
O artigo no arXiv analisa a destilação delta on-policy para raciocínio matemático em inglês, coreano e japonês.
Por que importa
O trabalho aponta a destilação como uma possível alternativa ao aprendizado por reforço no pós-treinamento de modelos de raciocínio multilíngue. Também destaca um risco prático: melhorar o desempenho entre idiomas sem dados multilíngues pode prejudicar o comportamento no idioma-alvo.
Pontos-chave
- 1.A OPD² usa as diferenças de probabilidade entre professor e modelo-base como sinal de aprendizagem.
- 2.Experimentos com Qwen3 mostraram ganhos maiores em coreano e japonês.
- 3.A OPD treinada apenas em inglês pode deslocar saídas em outros idiomas para o inglês.
Pesquisadores apresentaram a On-Policy Delta Distillation, ou OPD², como uma variante da destilação on-policy para o pós-treinamento de LLMs em raciocínio matemático multilíngue. Em experimentos com Qwen3 em inglês, coreano e japonês, a OPD² superou de forma consistente a abordagem OPD original, com ganhos especialmente fortes em coreano e japonês. O estudo também constatou que a OPD treinada apenas em inglês pode melhorar o desempenho em coreano e japonês, mas pode deslocar as respostas para o inglês.
⚡ Experimente hoje
Use dados de treinamento multilíngues ao aplicar pós-treinamento no estilo OPD para preservar respostas no idioma-alvo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.LGOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- arXiv cs.CLOn-Policy Delta Distillation for Multilingual Math ReasoningAug 7, 12:00 PM↗
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Pesquisadores propõem Power Law Graph Attention
PLGA generaliza a atenção por produto escalar escalonado e relata colapso de inferência sob invariância exata.