AAI News Hub
PesquisaFri, August 7, 2026·Aug 72 sources corroborating

Novos artigos testam autodestilação para RL agêntico

AgentOPSD e OCSD propõem correções, enquanto outro estudo mostra que professores privilegiados podem falhar em tarefas mais difíceis.

Por que importa

Os artigos apontam a atribuição de crédito e a supervisão privilegiada enviesada como questões centrais ainda não resolvidas no RL agêntico. Eles também sugerem que uma perda de destilação menor não é evidência suficiente de que um agente esteja aprendendo um comportamento melhor.

Pontos-chave

  • 1.O AgentOPSD mira a atribuição de crédito no nível dos turnos sem crítico nem rollouts extras.
  • 2.O OCSD tenta remover a confusão criada pelo andaime de replay nos sinais de observação privilegiada.
  • 3.Um estudo sobre viés mostra que a autodestilação pode degradar a acurácia de validação em tarefas mais difíceis.

Três artigos no arXiv examinam métodos de autodestilação para treinar agentes baseados em modelos de linguagem com recompensas esparsas de aprendizado por reforço. O AgentOPSD propõe um método recursivo sem crítico para atribuição de crédito no nível dos turnos e relata avaliações no ALFWorld, WebShop e Search-QA usando modelos Qwen2.5 de 3B e 7B. O OCSD propõe contrastar visões de replay completas e com observações removidas para isolar a supervisão de observações futuras, enquanto um artigo separado argumenta que professores condicionados por informação privilegiada podem reduzir a perda por token sem melhorar, e muitas vezes piorando, a acurácia de validação em tarefas mais difíceis.

Experimente hoje

Antes de adotar autodestilação ao estilo OPSD, valide em tarefas agênticas difíceis e separadas do treino, e acompanhe a acurácia nas tarefas, não apenas a perda por token.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa