AAI News Hub
PesquisaWed, August 5, 2026·Aug 52 sources corroborating

Pesquisadores ampliam a destilação on-policy entre modelos de IA

Novos artigos miram limites multimodais, agentivos e de geração de imagens no treinamento com OPD.

Por que importa

Os trabalhos sugerem que a OPD está se tornando um padrão de treinamento mais amplo, indo além da imitação de modelos de linguagem, mas pesquisadores estão descobrindo que a supervisão ingênua por professores pode induzir alunos ao erro quando modalidades, arquiteturas ou trajetórias divergem. Filtragem, roteamento e cronogramas híbridos de RL melhores podem ser importantes para modelos multimodais compactos, geradores de imagens e agentes pequenos.

Pontos-chave

  • 1.Variantes de OPD miram o treinamento de modelos multimodais, agentivos e de flow matching.
  • 2.Novos métodos filtram sinais enganosos dos professores ou os roteiam por modalidade.
  • 3.Vários artigos se concentram em professores heterogêneos com arquiteturas incompatíveis.

Vários artigos de pesquisa novos e atualizados propõem variantes da destilação on-policy, um método de pós-treinamento que usa sinais de professores em trajetórias geradas pelo aluno. Os trabalhos abordam diferentes modos de falha: professores multimodais conflitantes, supervisão espúria em nível de token, famílias incompatíveis de modelos de geração de imagens, modelos de fluxo com múltiplos professores, cascatas de chamadas de ferramentas em agentes pequenos e treinamento agentivo multi-turno de horizonte longo. Entre os métodos propostos estão OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD e ATOD.

Experimente hoje

Antes de usar OPD, avalie se os sinais dos professores continuam bem fundamentados e confiáveis nas trajetórias geradas pelo próprio aluno.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa