Pesquisadores testam OPD² em raciocínio matemático multilíngue
Os experimentos com Qwen3 mostram ganhos sobre o OPD em tarefas de matemática em inglês, coreano e japonês.
Por que importa
Os resultados sugerem que o pós-treinamento baseado em destilação pode melhorar o raciocínio multilíngue sem depender exclusivamente de aprendizado por reforço. Eles também destacam que dados de treinamento multilíngues são importantes quando a fidelidade da saída no idioma-alvo é essencial.
Pontos-chave
- 1.O OPD² usa uma lacuna de probabilidade entre professor e base como sinal de aprendizado.
- 2.Experimentos com Qwen3 mostram ganhos mais fortes em coreano e japonês.
- 3.O OPD apenas em inglês pode empurrar respostas em outros idiomas para o inglês.
Um novo artigo no arXiv estuda On-Policy Distillation e On-Policy Delta Distillation, ou OPD², para raciocínio matemático em inglês, coreano e japonês. Usando Qwen3, os autores relatam que o OPD² supera de forma consistente o OPD padrão, com melhorias especialmente fortes em coreano e japonês, e em geral reduz a diferença de desempenho entre inglês e coreano. Eles também constatam que o OPD apenas em inglês pode melhorar o desempenho em coreano e japonês, mas pode deslocar as respostas em direção ao inglês.
⚡ Experimente hoje
Use dados de treinamento multilíngues ao aplicar pós-treinamento no estilo OPD a tarefas de raciocínio em idiomas que não sejam o inglês.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo da Anthropic mostra que agentes de IA podem entrar em conflito em tarefas compartilhadas
Pesquisadores dizem que o comportamento multiagente pode expor lacunas nos testes atuais de segurança em IA.
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.