AAI News Hub
PesquisaThu, August 6, 2026·Aug 62 sources corroborating

Pesquisadores refinam destilação on-policy para agentes

Três artigos no arXiv propõem formas de testar quando a orientação de um professor melhora as trajetórias do aluno.

Por que importa

O trabalho aponta para uma abordagem mais seletiva na destilação de comportamento agentivo e de raciocínio, em que a discordância local entre modelos não é tratada como evidência suficiente para intervenção. Isso pode ser relevante para criar modelos menores que preservem o desempenho em tarefas posteriores sem copiar todas as preferências do professor.

Pontos-chave

  • 1.O FutureBridge-OPD relata ganhos no ALFWorld, WebShop e ScienceWorld.
  • 2.O SPOT aloca sondagens limitadas usando entropia, massa top-k e incompatibilidade entre professor e aluno.
  • 3.Rótulos de recuperabilidade distinguem erros corrigíveis de estados que exigem reversão.

Três artigos no arXiv tratam das limitações da destilação on-policy, em que um modelo professor supervisiona trajetórias geradas por um modelo aluno. O FutureBridge-OPD testa intervenções curtas do professor em estados de alta discordância e relata ganhos no ALFWorld, WebShop e ScienceWorld em uma configuração de Qwen3-32B para Qwen3-1.7B. O SPOT usa sondagem esparsa e continuações avaliadas por verificadores para decidir onde e o que destilar, enquanto um método de recuperabilidade contrafactual reproduz estados de erro para decidir se deve manter, reverter ou supervisionar uma trajetória de forma convencional.

Experimente hoje

Antes de adotar destilação on-policy para agentes, avalie as intervenções do professor pelo sucesso da continuação na tarefa final, não apenas pela divergência em nível de tokens.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa