AAI News Hub
PesquisaFri, August 7, 2026·6d ago2 sources corroborating

Pesquisadores propõem novos métodos de destilação on-policy

Vários artigos no arXiv investigam quando e como a orientação de um modelo professor deve moldar modelos alunos menores.

Por que importa

O trabalho aponta para uma limitação comum na destilação: sinais mais fortes do professor nem sempre são úteis se o aluno não consegue representá-los ou se eles prejudicam trajetórias posteriores. Isso importa para tornar modelos e agentes menores mais confiáveis sem simplesmente copiar professores em escala de fronteira.

Pontos-chave

  • 1.A orientação do professor pode falhar quando os alunos não conseguem representar a correção.
  • 2.Verificações de trajetórias futuras superaram a OPD vanilla em benchmarks de agentes.
  • 3.Rótulos de recuperabilidade podem orientar se estados divergentes devem ser mantidos ou revertidos.

Um conjunto de artigos no arXiv propõe refinamentos para a destilação on-policy, uma abordagem de treinamento que supervisiona modelos alunos com base em trajetórias que eles próprios geram. Os métodos incluem Fisher-Projected OPD para modelos de visão-linguagem, FutureBridge-OPD para tarefas de agentes em múltiplos turnos, SPOT para sondagem esparsa e alvos calibrados por resultado, além de controle sensível à recuperabilidade para decidir se estados de raciocínio divergentes devem ser mantidos, revertidos ou supervisionados normalmente. As avaliações relatadas abrangem raciocínio em visão-linguagem, ALFWorld, WebShop, ScienceWorld, AIME e GPQA-Diamond, com vários artigos afirmando ganhos em relação a linhas de base de OPD vanilla.

Experimente hoje

Antes de aplicar OPD, teste se as intervenções do professor melhoram as continuações posteriores do aluno, não apenas a concordância local de tokens.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa