AAI News Hub
PesquisaFri, August 7, 2026·6d ago2 sources corroborating

Pesquisadores testam OPD² em raciocínio matemático multilíngue

Os experimentos com Qwen3 mostram ganhos sobre o OPD em tarefas de matemática em inglês, coreano e japonês.

Por que importa

Os resultados sugerem que o pós-treinamento baseado em destilação pode melhorar o raciocínio multilíngue sem depender exclusivamente de aprendizado por reforço. Eles também destacam que dados de treinamento multilíngues são importantes quando a fidelidade da saída no idioma-alvo é essencial.

Pontos-chave

  • 1.O OPD² usa uma lacuna de probabilidade entre professor e base como sinal de aprendizado.
  • 2.Experimentos com Qwen3 mostram ganhos mais fortes em coreano e japonês.
  • 3.O OPD apenas em inglês pode empurrar respostas em outros idiomas para o inglês.

Um novo artigo no arXiv estuda On-Policy Distillation e On-Policy Delta Distillation, ou OPD², para raciocínio matemático em inglês, coreano e japonês. Usando Qwen3, os autores relatam que o OPD² supera de forma consistente o OPD padrão, com melhorias especialmente fortes em coreano e japonês, e em geral reduz a diferença de desempenho entre inglês e coreano. Eles também constatam que o OPD apenas em inglês pode melhorar o desempenho em coreano e japonês, mas pode deslocar as respostas em direção ao inglês.

Experimente hoje

Use dados de treinamento multilíngues ao aplicar pós-treinamento no estilo OPD a tarefas de raciocínio em idiomas que não sejam o inglês.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa