Pesquisadores propõem novos controles para destilação on-policy
Três artigos no arXiv miram modos de falha no treinamento de modelos estudantes a partir de trajetórias guiadas por modelos professores.
Por que importa
Os artigos apontam para uma limitação comum nos pipelines atuais de destilação: reproduzir localmente o comportamento do professor pode ser insuficiente quando resultados downstream, recuperabilidade e robustez ao contexto são relevantes. Um controle melhor sobre quando e o que destilar pode aprimorar modelos estudantes menores usados em cargas de trabalho de raciocínio e tarefas agênticas.
Pontos-chave
- 1.O SPOT usa sondagem esparsa e continuações pontuadas por verificadores para calibrar alvos.
- 2.O controle atento à recuperabilidade diferencia erros corrigíveis de estados que exigem reversão.
- 3.O FutureBridge-OPD relata ganhos em ALFWorld, WebShop e ScienceWorld.
Vários novos artigos no arXiv propõem métodos para tornar a destilação on-policy mais seletiva e robusta. O SPOT direciona sondagens limitadas a posições incertas ou desalinhadas e calibra os alvos de destilação usando continuações pontuadas por verificadores. Outro trabalho introduz a recuperabilidade contrafactual para decidir se erros do estudante devem ser mantidos ou revertidos, enquanto o FutureBridge-OPD testa se pontes curtas do professor melhoram trajetórias posteriores do estudante em tarefas agênticas.
⚡ Experimente hoje
Antes de aplicar destilação on-policy, audite se seu pipeline valida intervenções do professor com base nos resultados downstream da tarefa, e não apenas na divergência em nível de token.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- HF Daily PapersOn-Policy Delta Distillation for Multilingual Math ReasoningAug 6, 4:00 AM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.CLLanguage-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASRAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AINative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.LGNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLNative Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian LanguagesAug 4, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.