AAI News Hub
PesquisaFri, August 7, 2026·5d ago2 sources corroborating

OPD² melhora o raciocínio matemático multilíngue com Qwen3

O artigo no arXiv analisa a destilação delta on-policy para raciocínio matemático em inglês, coreano e japonês.

Por que importa

O trabalho aponta a destilação como uma possível alternativa ao aprendizado por reforço no pós-treinamento de modelos de raciocínio multilíngue. Também destaca um risco prático: melhorar o desempenho entre idiomas sem dados multilíngues pode prejudicar o comportamento no idioma-alvo.

Pontos-chave

  • 1.A OPD² usa as diferenças de probabilidade entre professor e modelo-base como sinal de aprendizagem.
  • 2.Experimentos com Qwen3 mostraram ganhos maiores em coreano e japonês.
  • 3.A OPD treinada apenas em inglês pode deslocar saídas em outros idiomas para o inglês.

Pesquisadores apresentaram a On-Policy Delta Distillation, ou OPD², como uma variante da destilação on-policy para o pós-treinamento de LLMs em raciocínio matemático multilíngue. Em experimentos com Qwen3 em inglês, coreano e japonês, a OPD² superou de forma consistente a abordagem OPD original, com ganhos especialmente fortes em coreano e japonês. O estudo também constatou que a OPD treinada apenas em inglês pode melhorar o desempenho em coreano e japonês, mas pode deslocar as respostas para o inglês.

Experimente hoje

Use dados de treinamento multilíngues ao aplicar pós-treinamento no estilo OPD para preservar respostas no idioma-alvo.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa